谷歌公司今日通过其云平台推出两款全新文本转语音模型:Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。
这两款算法的应用程序接口高度相似,这使得开发者能够相对轻松地进行对比使用。Flash-Lite TTS 针对成本效率和推理速度进行了优化。Flash TTS 则提供更优的音频质量,但价格更高。谷歌设想客户可将其用于诸如制作有声读物等任务。
两款模型之间还存在其他差异。最值得注意的是,Flash TTS 在发布时可生成 130 种语言的语音,而 Flash-Lite TTS 支持 101 种语言。
两款模型均可访问包含超过 2000 种预设语音的语音库。开发者可通过自然语言提示词创建自定义语音,谷歌支持对 AI 语音的音色、口音和语速等参数进行个性化调整。
第二种自定义模型的方式是基于 30 秒的音频样本生成合成语音。谷歌要求开发者在生成语音复制品之前必须获得说话者本人的同意。展望未来,该公司计划新增第三种自定义选项,允许用户通过修改某个预设语音选项来创建全新语音。
Flash TTS 和 Flash-Lite TTS 还支持对 AI 语音的表达方式进行自定义。据谷歌介绍,开发者可以为模型朗读的脚本中的每一行添加语调提示。这些提示会生成诸如非词汇发声和语速变化等音频元素。
谷歌使用一种名为 SynthID 的技术,在 AI 生成的语音中嵌入音频水印。该水印人耳无法察觉,但可被 AI 检测工具识别。为进一步加强保障,该公司还为其生成的每个音频文件附加了所谓的 C2PA 记录。此类记录会标明文件的生成时间、生成后是否被修改过等相关细节信息。
谷歌使用由创业公司 Hume AI Inc. 开发的音频质量基准对新模型进行了评估。Flash TTS 和 Flash-Lite TTS 分别摘得该基准测试的第一名和第二名。此外,在多个语言版本的 Voice Arena 基准测试中,这两款模型也超越了多款竞品模型。该基准测试基于人类反馈来衡量文本转语音算法的输出质量。
谷歌员工利兰·雷齐斯(Leland Rechis)和艾伦·考恩(Alan Cowen)在一篇博客文章中写道:“这些模型使创作者、开发者和企业能够打造更丰富、更具表现力的音频体验,同时也提升了 Gemini Notebook 和 Google Vids 等产品的用户体验。”
Flash TTS 和 Flash-Lite TTS 是谷歌更广泛的音频处理模型阵容的一部分。此前,谷歌已发布过针对语音智能体、转录和翻译进行优化的算法。
Q&A
Q1:Gemini 3.8 Flash TTS 和 Flash-Lite TTS 有什么区别?
A:Flash TTS 提供更优的音频质量,支持 130 种语言,价格更高,适合有声读物等场景;Flash-Lite TTS 针对成本效率和推理速度进行了优化,支持 101 种语言。
Q2:这两款模型如何防止语音被滥用?
A:谷歌使用 SynthID 技术在生成语音中嵌入人耳不可察觉但 AI 可识别的水印,并为每个音频文件附加 C2PA 记录,标明生成时间及是否被修改。此外,克隆声音前需获得说话者本人同意。
Q3:这两款模型在基准测试中表现如何?
A:在 Hume AI 开发的音频质量基准测试中,Flash TTS 和 Flash-Lite TTS 分别获得第一和第二名,并在多个语言版本的 Voice Arena 基准测试中超越了多款竞品模型。
