AI语音模型市场正迎来爆发式增长。创作者需要更具表现力的AI语音,而希望实现客服与销售自动化的企业则需要更易调控的语音模型。

总部位于帕洛阿尔托的Fish Audio致力于满足上述各类需求,其平台拥有超过15000种自然语言控制选项。自去年上线以来,已有超过800万用户在使用其开源版本或托管版本的模型,目前年度经常性收入已达2100万美元。

为进一步巩固这一发展势头,Fish Audio于本周二宣布完成5200万美元种子轮融资,由Coreline Ventures和今日资本领投。本轮融资还吸引了359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners以及HF0等机构参与。

Fish Audio最初源于前英伟达研究员廖世嘉(Shijia Liao)的一个小型项目。由于市面上现有的合成语音表现力不足,他在单张GPU上训练了一个语音生成模型,并将其开源。该项目Fish Speech在GitHub上现已累计超过31000个星标,被独立开发者、游戏设计师和内容创作者广泛使用。

过去一年间,Fish Audio共推出了五款模型,包括四款语音生成模型和一款语音转文字模型。其中三款语音生成模型已开源,但最新的S2.1 Pro模型目前仅通过付费API提供服务。

Fish Audio为创作者和团队提供付费月度套餐,解锁一定时长的语音生成功能及语音克隆特性,同时也面向企业提供API和平台的企业版服务。目前,HeyGen和Sanas等机构已在使用其服务。

"每家企业的使用场景和偏好各不相同。比如,像HeyGen这样用我们的声音来驱动AI虚拟形象的公司,追求的是声音的真实感;游戏工作室希望角色拥有富有表现力的声音;而像LiveKit这样的语音智能体公司,则更需要自然流畅、低延迟且具备足够表现力的通话声音。"Fish Audio联合创始人兼CEO曹睿莎(Rissa Cao)表示。

该公司构建声音库的方式之一,是邀请用户提交自己的声音用于模型训练,并在其声音被使用时给予报酬。然而,这一做法在几个月前引发了争议——部分创作者反映,他们的声音在未获授权的情况下被上传至Fish Audio平台。虽然该公司已建立了DMCA内容下架流程,但处理周期较长。

曹睿莎向TechCrunch透露,公司目前已将下架流程自动化。创作者只需提交一段简短的声音样本或相关合同来证明上传声音归其所有,声音即可在3分钟内从平台下架。

不过,这仍无法完全阻止他人在未经当事人知情的情况下擅自上传其声音。在艺术家发现并提出申请之前,其声音仍会持续在平台上被使用。

Coreline Ventures合伙人本田大辅(Osuke Honda)表示,社区驱动模式只有在创作者信任平台的前提下才能持续运作。

"以社区为核心的方式,只有当创作者真正信任平台时,才能形成持久的竞争优势。这意味着同意机制、透明度和署名权必须内嵌于产品本身,而非事后补救。我认为行业需要朝着声音所有权验证、清晰的许可条款、便捷的举报与下架流程,以及最终让创作者在其声音被授权或商业化使用时获得收益分成的方向发展。"他说道。

曹睿莎表示,早期公司仅以开源项目形式运营时,凭借创作者套餐便能高效运转,无需外部融资。但为了开发更先进的模型、拓展企业市场,加之投资方的关注持续升温,公司才决定寻求外部资本。

展望未来,Fish Audio计划今年发布一款音频理解模型,同时也在研发语音到语音的转换模型。

语音生成市场竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(前身为Podcastle)和Krisp等公司均在争夺创作者和企业客户。

359 Capital合伙人里科·马洛兹(Rico Mallozzi)认为,面向开发者的精细化控制能力和高效的模型训练成本,将帮助Fish Audio在与大型AI实验室的竞争中取得优势。

"以他们现有的团队规模,能够构建出行业领先的模型,与那些资金更为充裕的AI实验室相比,这实属不易。这充分体现了他们在缩小人工合成声音与真人声音差距方面的深厚技术实力。"马洛兹在接受TechCrunch采访时表示。

Q&A

Q1:Fish Audio是一家什么样的公司,主要做什么?

A:Fish Audio是一家总部位于帕洛阿尔托的AI语音模型初创公司,提供超过15000种自然语言控制选项,支持语音生成与语音克隆功能。目前平台用户超过800万,年度经常性收入达2100万美元,服务对象涵盖内容创作者、游戏开发者以及HeyGen、Sanas等企业客户。

Q2:Fish Audio在声音版权保护方面存在哪些问题,目前如何解决?

A:此前有创作者反映其声音在未经授权的情况下被上传至Fish Audio平台,且原有下架流程耗时较长。目前公司已将下架流程自动化,创作者提交声音样本或合同证明归属权后,可在3分钟内完成下架处理。不过,在创作者主动发现并申请下架之前,其声音仍可能被平台使用。

Q3:Fish Audio与ElevenLabs等竞争对手相比有哪些优势?

A:Fish Audio的核心竞争力在于面向开发者的精细化控制能力和高效的模型训练成本。其开源模型Fish Speech在GitHub上已积累超过31000个星标,拥有活跃的开发者社区。此外,投资方认为Fish Audio以较小的团队规模实现了行业领先的模型表现,在缩小合成声音与真人声音差距方面展现出较强的技术实力。

TechCrunch - AI