尽管AI智能体在处理客服问题方面的能力日益增强,但大多数人在与其通话时,仍能立刻判断出对方是机器而非真人。
成立于2024年底的初创公司Smallest.ai认为,语音智能体的下一次飞跃,不会来自于让大语言模型跑得更快,而是要构建专为人类对话设计的小型专用模型。简而言之,该公司的目标是让人们与AI智能体对话时,感受不出任何差异。
为此,Smallest.ai正在研发一种小型语音模型,旨在模拟人类处理信息的方式——边听、边思考、边说话,三者同步进行。
"我和你说话的时候,你已经在思考了,如果我说太久,你可能会打断我。"Smallest.ai创始人兼CEO苏达尔山·卡马思在接受TechCrunch采访时表示,这正是该公司模型的设计逻辑。
为推进这一愿景,Smallest.ai完成了1300万美元的A轮融资,由Seligman Ventures领投,Sierra Ventures和3one4 Capital参与跟投。此次融资完成后,该公司累计融资总额已超过2100万美元。
"大语言模型的工作方式是:你给它一整段提示词,然后它才开始思考。"卡马思说。在文字聊天中,这点延迟尚可接受,但在语音对话里,哪怕是短暂的停顿,也会让人感觉不自然。"想想我们平时说话的方式,我不会先给你发一大段录音,你再开始思考。"
Smallest.ai的模型充当实时智能处理层,能够针对特定话题与客户进行自然对话,且响应延迟几乎为零。但当模型遇到超出其知识范围的问题时,Smallest.ai会将该查询转交给大型基础模型处理,同时让客户短暂等待,以便"查询"相关信息——这与真实人工客服的处理方式如出一辙。
卡马思预计,未来所有AI智能体都将依赖两类模型协同工作:一类是用于实时交互的小型语音模型,另一类是按需调用以解决复杂问题的"离线"大语言模型。
与大型基础模型不同,Smallest.ai专注于语音领域的细粒度能力,涵盖多种口音识别、数十种语言支持以及嘈杂环境下的稳定运行。
目前,该公司的客户已包括RingCentral、Truecaller等语音领域的企业。卡马思表示,所有客服类公司,包括Sierra、Decagon等新兴企业,都是其潜在目标客户。
当被问及资金充裕的AI客服公司为何不自行研发语音模型时,卡马思回应称,对客服初创公司而言,深耕语音技术会分散其对核心业务的专注度。
在竞争格局上,Smallest.ai的主要对手包括语音AI领域的头部企业ElevenLabs、Cartesia,以及专注本地语言的区域性玩家Sarvam。部分竞争对手将语音AI应用于音频配音、播客制作等场景,而Smallest.ai则完全专注于面向企业客户的实时对话语音智能体。
"我们希望自己的模型能够突破图灵测试,"卡马思说,"当你与我们的模型对话时,你应该分辨不出它是AI还是人类。这是公司唯一的核心目标。"
Q&A
Q1:Smallest.ai的语音模型和普通大语言模型有什么区别?
A:普通大语言模型需要接收完整提示词后才开始处理,存在明显延迟,用在语音对话中会让人感觉不自然。Smallest.ai开发的小型语音模型则模拟人类"边听边思考边说"的方式,实现近乎零延迟的实时对话。遇到超出能力范围的问题时,再转交大型基础模型处理,兼顾响应速度与处理深度。
Q2:Smallest.ai目前有哪些客户?
A:Smallest.ai的现有客户包括语音通信领域的RingCentral和来电显示服务商Truecaller。此外,公司创始人卡马思表示,Sierra、Decagon等新兴AI客服公司,以及所有客户支持类企业,都是其潜在目标客户群体。
Q3:Smallest.ai在语音AI市场上面临哪些竞争对手?
A:Smallest.ai的主要竞争对手包括语音AI头部企业ElevenLabs、技术公司Cartesia,以及专注印度等地区本地语言的Sarvam。与部分竞品侧重音频配音、播客等场景不同,Smallest.ai专注于企业级实时对话语音智能体这一垂直方向。
