ElevenLabs于周一发布了两款新语音模型,名为ElevenLabs v4和v4 Turbo,提供更强的表达控制能力、更低的语音智能体延迟,并支持超过90种语言。

该公司去年发布了v3模型,并在今年早些时候在华沙举办的一场活动上预告了新模型的到来。在v4系列模型中,ElevenLabs采用了全新架构,能够实现更好的控制效果和更快的声音克隆速度。该公司表示,借助v4,用户仅需10秒的音频即可完成声音克隆。

在创作层面,该模型在处理较长文本段落时能更好地保持声音身份的一致性。它还能在朗读文本时结合上下文内容来调整语气表达。ElevenLabs在v3中引入了用于定义表达方式的内嵌标签,并在v4中对这些标签进行了扩展,允许用户叠加使用多个标签,模型会依照顺序执行相应的表达变化。

此前的版本支持70种语言,而ElevenLabs在新版本中已将这一数字提升至90种语言。该初创公司表示,在日语、巴西葡萄牙语、普通话和粤语方面观察到了最显著的质量提升。

过去一年里,ElevenLabs的企业级通话业务快速扩张,目前超过55%的业务来自大型企业客户。该公司表示,新模型非常适合语音智能体使用,因为v4版本具有更低的延迟,能够支持更流畅的对话。此外,v4能够在其背后的大语言模型开始生成答案的同时立即生成音频。不仅如此,该模型还能针对争执、情绪升级和等待等不同场景做出差异化处理,从而更好地解决问题。

随着Cartesia、Deepgram、Fish Audio、Boson和WellSaid Labs等初创公司相继推出富有表现力的语音模型,语音模型领域的竞争日益激烈。谷歌和OpenAI等大公司也在不断改进自家的语音模型。

ElevenLabs今年早些时候完成了一轮由红杉资本领投的5亿美元融资,公司估值达到110亿美元。目前已有传言称,公司正在筹备新一轮估值220亿美元的融资。ElevenLabs的年化营收从年初的约3.3亿美元增长至超过6亿美元。该公司在印度、欧洲和巴西等不同市场大力招募人才,员工总数已超过800人。

在近期接受TechCrunch采访时,公司联合创始人兼首席执行官Mati Staniszewski表示,公司的目标是"在未来几年内"实现上市,但并未给出具体时间表。

Q&A

Q1:ElevenLabs v4模型有哪些新功能?

A:ElevenLabs v4提供更强的表达控制能力、更低的语音智能体延迟,并支持超过90种语言,同时用户仅需10秒音频即可完成声音克隆。

Q2:ElevenLabs v4支持多少种语言?

A:v4版本支持超过90种语言,相比此前v3版本支持的70种语言有明显提升,在日语、巴西葡萄牙语、普通话和粤语方面质量提升最为显著。

Q3:ElevenLabs公司目前估值多少?

A:ElevenLabs今年早些时候完成由红杉资本领投的5亿美元融资,估值达到110亿美元,目前已有传言称新一轮融资估值将达到220亿美元。

TechCrunch - Apps