Suno正从AI音乐领域向外拓展,推出了一项基于脚本或提示描述生成语音的新功能。该功能名为Speech,目前已在Suno的网页端和移动端平台开放公测,用户可以同时生成配音旁白和伴随的背景音乐。

Suno首席产品官Jack Brody在公告中表示:"音乐将永远是Suno的核心,也是我们构建一切的根本。同时,我们的愿景一直延伸至人类表达的其他形式。今天,我们通过Speech拓展了Suno的可能性:这是首个将语音与音乐作为一个统一音轨共同生成的音频模型。"

AI生成语音技术并非新鲜事物——DeepMind十年来一直在尝试深度学习语音合成,Adobe也有文本转语音工具,而ElevenLabs自2023年推出以来已成为该领域最知名的平台之一。Suno此举只是加入这场竞争——很可能是为了实现平台多元化,因为其音乐生成器已经招致了大量诉讼。

将AI音乐与生成语音相结合,是Suno对文本转语音工具的独特演绎。这项功能是可选的,意味着如果用户只想要纯净的语音,可以轻松关闭背景音乐,但这个设计理念是希望它能为特定的生成式口语场景增添亮点——比如为诗歌配上舒缓的音轨,或为戏剧性旁白和激励性演讲配上更具活力的背景音乐。

要使用该功能,选择"Create"标签页,并导航至Speech选项。该功能提供两种模式:简单模式允许用户通过提供的提示框描述想要创建的内容(例如"一位海盗船长正在激励他的船员");高级模式则允许用户添加自定义脚本,如果已经清楚知道想让其说些什么。高级设置还允许用户调整AI语音的性别、语音风格,以及每次语音生成的变化程度。Speech功能生成的音频最长时长约为八分钟。

Suno承认该功能远非完美,但表示会根据用户反馈持续改进Speech功能。"公测确实意味着公测,"Brody说道。"偶尔英式口音可能会飘忽不定地变成澳式口音,然后再飘回来。戏剧性的停顿可能会非常戏剧化。你们几乎肯定会发现一些我们从未想到过的用途。"

Q&A

Q1:Suno的Speech功能是什么?

A:Speech是Suno推出的新功能,可以根据脚本或提示描述生成语音旁白,并能同时生成配套的背景音乐,让语音和音乐作为一个统一的音轨共同呈现。

Q2:Speech功能怎么使用?

A:选择"Create"标签页进入Speech选项,有简单模式(用提示框描述想要的内容)和高级模式(可添加自定义脚本,并调整语音性别、风格等参数)两种,最长可生成约八分钟的音频。

Q3:Speech功能目前成熟吗?

A:该功能目前处于公测阶段,Suno官方也承认存在不完美之处,比如口音可能会出现偏差,戏剧性停顿可能把握不准,但会持续根据用户反馈进行改进。

The Verge