谷歌近日发布了 Gemini 3.5 Transcribe,这是一款专为语音输入优化设计的 AI 模型,能够自动过滤语音中的"嗯""啊"等口头禅,并在说话者自我纠正时实时编辑文本,最终输出经过润色的文字内容。该模型已率先应用于 Pixel 11 手机 Gboard 输入法的"Rambler"功能,并将逐步扩展至谷歌生态系统的更多产品中。

与前代语音转文字引擎 Chirp 3 相比,Gemini 3.5 Transcribe 在速度和准确性上均有显著提升。从语音输入到最终转录文本的速度提升约 70%,实时语音识别错误率从 7.32% 降至 5.5%。虽然错误率的改善幅度有限,但对于依赖语音输入的用户而言,减少手动纠错的需求本身就是一项实用的改进。

在功能层面,Gemini 3.5 Transcribe 不仅能更准确地识别用户所说的内容,还能更好地理解用户的表达意图。它支持实时删除语流中的冗余词汇,处理说话者的自我纠正,并可调用用户自定义词汇表来识别专业术语。该模型支持 85 种语言,并可处理最多包含三位说话者的预录音频。

值得注意的是,该模型会对用户的原始表达进行一定程度的改写,这在某些需要逐字记录的场景下可能并不适用。

在可用性方面,Gemini 3.5 Transcribe 目前已在 Pixel 11 手机的 Gboard Rambler 功能中上线,macOS 版 Gemini 应用的语音输入功能也已同步升级。谷歌表示,Rambler 功能将于今年晚些时候扩展至更多支持 Gemini Intelligence 的设备。

面向开发者,Antigravity 平台即日起可使用该模型,并支持访问屏幕上下文和聊天记录(需用户授权)。AI Studio 的构建模型同样已集成 Gemini 3.5 Transcribe,开发者也可通过 Gemini API 直接调用该模型。

此外,谷歌计划"近期"将 AI 转录功能引入 Chrome 浏览器,届时用户将可通过语音向任意网页输入框输入内容,包括撰写邮件或向 AI 聊天机器人发送提示词。

Q&A

Q1:Gemini 3.5 Transcribe 和 Chirp 3 相比有哪些提升?

A:Gemini 3.5 Transcribe 的语音转文字速度比 Chirp 3 快约 70%,实时语音识别错误率从 7.32% 降至 5.5%。此外,新模型还新增了自动过滤口头禅、实时处理自我纠正、支持自定义词汇表等功能,整体实用性有明显提升。

Q2:Gemini 3.5 Transcribe 现在在哪些地方可以用?

A:目前该模型已在 Pixel 11 手机的 Gboard Rambler 功能以及 macOS 版 Gemini 应用中上线。开发者可通过 Antigravity 平台、AI Studio 和 Gemini API 使用。谷歌还计划将其引入 Chrome 浏览器,但具体时间尚未公布。

Q3:Gemini 3.5 Transcribe 会改变用户说的原话吗?

A:会。该模型在转录时会对语音内容进行一定程度的润色和改写,例如删除"嗯""啊"等口头禅,并处理说话者的自我纠正。这意味着最终文本并非逐字记录,在需要精确还原原话的场景下需谨慎使用。

ArsTechnica - AI