ElevenLabs构建了AI的语音层,即把文本转化为听起来像人类说话的模型。多数人在与客服对话时就会接触到它,往往察觉不到。例如,Klarna为3500万美国用户提供的一线电话支持就运行在该技术之上。德国电信、思科、Adobe以及越来越多的政府机构也是其客户。ElevenLabs还向内容创作者销售服务,他们利用该平台制作有声书、配音和音乐。

在这一领域,ElevenLabs并非独行者。事实上,它正越来越多地与自己的客户产生竞争关系,其中包括对话式AI平台Decagon——该公司此前基于ElevenLabs训练了自己的语音产品,如今已成为其竞争对手。但投资者似乎并不太担心这一点。据称,该公司年度经常性收入已达到6亿美元的运行速度,成立仅四年,如今据报道被投资方估值220亿美元。

为了解更多信息,我在多伦多举办的本地创业会议Nrth(原名Elevate)上采访了ElevenLabs联合创始人兼首席执行官Mati Staniszewski。在短暂的时间里,我们讨论了多个话题,包括企业是否应该告知客户对方正在与AI对话(他认为应该),以及他是否能够谈论公司的毛利率。不出所料,Staniszewski表示他无法详细讨论毛利率问题,但他明确表示,只要能扩大公司的市场份额,他并不介意毛利率进一步被压缩。

以下是经过精简和轻微编辑的对话内容。完整对话可在原文链接查看。

去年你在TechCrunch Disrupt活动上曾表示,音频模型将在几年内实现商品化。现在你如何评价这个预测?

目前还有很多工作要做,仅在模型层面能实现的质量差距仍然显著。如果从更长远的角度看,也许三到五年后,这些差异会变小。我们希望做到、并且是第一个做到的,是让对话式AI通过图灵测试。这需要结合智能,但也需要情感智能。你需要理解对方的情绪,能够放慢或提高语速。这一点目前还没有人做到。

企业客户现在占业务的百分之多少?

我们现在的年度经常性收入是6亿美元。55%以上来自传统企业客户,剩余45%中很大一部分来自中小企业、开发者、创业者和创作者。

和AI领域的其他公司一样,你们正越来越多地与自己的客户竞争。Decagon基于你们的技术训练了语音产品,现在通过自己的模型运行查询。

模型公司、平台公司、应用公司之间的界限变得越来越模糊。过去这些角色的起点和终点非常清晰,如今这条界限已经变得十分模糊。以Anthropic为例,它过去是一家模型公司,现在无疑已经成为一个平台,并且正在拓展出越来越广泛的应用。我认为这种趋势会持续下去。

你的客户可以从ElevenLabs提供的选项菜单中选择"推理层"。你们在前沿实验室模型与开放权重模型的使用上观察到了什么趋势?

这不再是一个非此即彼的选择。在客户服务场景中,如果只是提供信息、不执行任何操作,可以使用很多开源模型,因为知识库决定了良好体验的标准。但如果涉及金融服务,你需要身份验证,需要交易信息,可能还涉及退款,这里没有出错的空间。在这类场景中,前沿模型仍将占据主导地位。

其中一些开放权重模型来自中国。美国政府是你们的客户,欧洲政府也是。这方面的对话是怎样的?

各不相同。在每次部署中,我们所使用的模型和语音都会根据具体情况而定。如果我们与波兰政府或巴西政府合作,他们都有自己的一套要求,可能使用开放权重模型、闭源模型,或者他们自己微调的模型。在波兰,这是一个医疗保健案例。患者在整个公共医疗系统中预约就诊,但有18%的人从未按时出现。我们的部署方案是让智能体拨打电话提醒患者。他们有一套基于自身知识优化的模型,我们在保持数据本地存储的前提下进行集成。

企业是否应该告知客户对方正在与智能体交谈,而不是真人?

我认为目前应该进行告知。当下人们还不习惯这种方式,普遍的心理模式是不想在这类通话中感觉被欺骗。但五年后,当每个人都有自己的智能体在为自己工作时,你打电话进去时就会预期对方是智能体。到那时我认为整个社会的态度会发生转变。目前有一些不错的做法——如果人工客服需要等待30分钟,可以给客户一个选择。在几乎所有情况下,他们都会选择智能体,然后对体验之好感到惊讶。

考虑到你们在模型和推理上的支出,你们的毛利率是多少?

我给一个比较模糊的答案。由于我们有研究方面的能力,我们能够以非常聪明的方式对模型进行微调和约束。但如果我们能够把节省下来的成本转嫁给客户,我们会这样做。最重要的事情仍然是证明价值并与客户站在一起。所以如果我们能够投入并证明这种价值,即使毛利率因此降低,我们也不介意,因为在接下来的五年里,价值是共同创造出来的,双方都能从中受益。

你们拥有数百万小时的客服通话记录。你们用这些数据来训练模型吗?训练数据中有多少是合成数据?

在某些公司的合作中,我们是共同创建模型的,他们希望针对自己的使用场景定制一个特定模型。除此之外,训练工作的重点并不在于数据量的大小,而在于数据标注。我们内部有数千名合同工帮助我们标注数据,不仅标注说了什么,还标注人们说话的时机、方式以及使用的情绪。我们还必须请来语音教练,以便准确识别口音。

据报道你们正考虑在2028年进行IPO,能确认吗?

我们希望打造一家经得起时间考验的公司。我们正在为未来几年做这方面的准备。但是否真正实施,将取决于具体的时间和情况。

"几年"这个说法相当模糊。

(笑)

后台环节:你如何看待前沿实验室是否应该放慢发展步伐这个问题?

大家在寻找合适节奏这件事上是一致的,都希望共同努力。至于是否应该公开表态,以及媒体讨论或监管应该介入到什么程度,那是另一个话题。但是的,在部署这项技术时,我们都应该采取正确的预防措施。我们不训练文本模型,也不涉及模型智能核心的部分,而这正是当前争论的核心所在。

ElevenLabs会不会像Hugging Face那样面临风险暴露?

我们更进了一步,因为我们不部署具有自我复制或递归特性的智能体智能部分。我们的技术不允许智能体创建更多智能体。每个客户都需要通过身份核实(KYC)流程。网络安全风险对整个世界来说确实是一个风险,但我们已经制定了一套完善的预防措施。

Q&A

Q1:ElevenLabs的估值是多少?

A:据报道,ElevenLabs目前被投资方估值220亿美元,公司年度经常性收入运行速度约为6亿美元,成立仅四年时间。

Q2:ElevenLabs主要给哪些客户提供服务?

A:ElevenLabs超过55%的业务来自传统企业客户,如Klarna、德国电信、思科、Adobe等,剩余部分来自中小企业、开发者和内容创作者,此外还包括多国政府机构客户。

Q3:企业是否应该告知客户正在与AI智能体对话?

A:ElevenLabs CEO认为目前应该进行告知,因为人们还不习惯这种方式,容易产生被欺骗的感觉。但他预计未来五年内,随着智能体的普及,社会态度会发生转变。

TechCrunch - AI