谷歌更新了Gemini Audio,推出了多款基于Gemini 3.5的新模型,引入了能自动识别专业术语、支持超过85种语言的转录功能。Gemini 3.5 Live、3.5 Live Experimental和3.5 Transcribe三款模型旨在提升谷歌语音AI功能的精准度,同时有效应对背景噪音干扰和说话中断等问题。
Gemini 3.5 Transcribe是Gemini家族的全新成员,其发布时间节点颇为微妙——此前谷歌承诺在6月推出的Gemini 3.5 Pro至今仍未上线。谷歌表示,3.5 Transcribe"相较于前代转录模型Chirp 3实现了重大突破",尤其在多语言处理能力和用词错误率方面表现突出。
据谷歌介绍,该转录模型支持用户"仅凭语音进行自然编辑",可自动格式化文本,并过滤掉"嗯""啊"等语气词。用户还可以为模型提供自定义词汇表,使3.5 Transcribe能够自动适配特定拼写要求和专业术语,避免这些词汇被手动修改。此外,该模型还支持对预录音频中最多三位说话者进行身份标注,并提供逐词时间戳。
Transcribe与3.5 Live及3.5 Live Experimental同步发布。后两款模型在现有语音识别技术基础上进一步升级,为Gemini语音对话模式提供支持。Gemini 3.5 Live在处理句中打断、语言识别和实时视觉处理方面能力更强;而Gemini 3.5 Live Experimental则更进一步,能够在处理复杂推理任务时实时逐步播报进度。
上述Gemini Audio更新从即日起面向所有macOS Gemini应用用户以英语版本推出,同时在部分国家和语言中上线Android端的Rambler听写功能。开发者可通过AI Studio和Antigravity在Gemini API公开预览版中体验上述功能。谷歌表示,Chrome支持即将推出。
Q&A
Q1:Gemini 3.5 Transcribe有哪些核心功能?
A:Gemini 3.5 Transcribe是谷歌全新推出的转录模型,支持超过85种语言,能自动识别专业术语,过滤"嗯""啊"等语气词,并自动格式化文本。用户可提供自定义词汇表,模型会自动适配特定拼写和专业术语。此外,它还支持对预录音频中最多三位说话者进行身份标注,并提供逐词时间戳。
Q2:Gemini 3.5 Live和3.5 Live Experimental有什么区别?
A:Gemini 3.5 Live在处理句中打断、语言识别和实时视觉处理方面有所提升;3.5 Live Experimental则在此基础上更进一步,能够在处理复杂推理任务时实时逐步播报自身的处理进度,适合需要更强推理能力的场景。
Q3:Gemini Audio新功能目前支持哪些平台和语言?
A:目前,Gemini Audio更新从发布之日起以英语版本面向所有macOS Gemini应用用户推出,同时在部分国家和语言中上线Android端的Rambler听写功能。开发者可通过AI Studio和Antigravity在Gemini API公开预览版中使用。谷歌表示Chrome支持即将到来。
