谷歌DeepMind今日宣布推出手语转文字模型SL2T(Sign Language to Text),旨在让全球约7000万聋人及听障人士同样享受到AI技术带来的便利。
据谷歌AI研究团队在官方博客中介绍,SL2T是一款多语言翻译模型,首发搭载于Pixel 11智能手机,为Gboard键盘和Live Transcribe应用提供全新的"手语转文字"听写功能。该模型目前支持将美国手语(ASL)翻译为英文文字,也是同类技术中首个应用于真实消费产品的模型。
近年来,AI语音处理能力已大幅提升,普通用户可以在智能手机、平板或电脑上用数十种语言进行语音听写。然而,依赖200多种手语进行沟通的听障人士却长期被这场技术变革所忽视。谷歌表示,SL2T的推出正是为了弥补这一空白。
SL2T让聋人及听障用户得以用母语与手机进行交互——就像语音AI让用户"说话"代替打字一样,SL2T让用户直接对着手机摄像头打手语,即可完成网页搜索、撰写邮件和短信、编辑文档等多种操作。用户还可以通过手语向Gemini发出指令,完成各类查询和操作任务。在Live Transcribe应用中,用户也可以在面对面通话时直接通过手语输入回应。
谷歌表示,SL2T的训练数据涵盖50余种手语,总时长超过10万小时,其中约四分之一为美国手语内容。尽管首版仅支持ASL,但跨语言训练策略有助于模型学习不同手语之间共有的结构性规律,从而显著超越早期手语识别模型的性能表现。
在隐私保护方面,SL2T采用名为MediaPipe Holistic的端侧计算机视觉模型,通过追踪手语者面部、双手、手臂和躯干的几何姿态坐标,再将这些坐标数据上传至云端服务器进行处理,全程无需上传任何实际视频,兼顾了速度与安全性。
在模型架构上,SL2T直接将手语序列转译为文字,跳过了通常所需的中间注释层(即"词符"标注),从而更准确地捕捉ASL特有的非手部表情和空间语法结构。此外,模型还针对延迟进行了优化,加入了非手语动作的幻觉预防机制,并支持左利手及单手手语输入,用户在单手持机时也能正常使用。
在性能方面,SL2T在FLEURS-ASL基准测试中取得了70 BLEURT的成绩,有扎实的数据支撑。
谷歌表示,由于手语具有独特的词汇系统与语法结构,不能像口语那样直接将声音序列映射为文字,早期技术尝试也往往只关注手部动作,而忽略了头部、面部、手臂和躯干的协同表达。这些因素导致手语AI模型的研发长期滞后。
为推动技术落地与负责任部署,谷歌还联合多个聋人组织及手语专家成立了AI手语咨询委员会,并将与该委员会共同撰写报告,详述SL2T的现有能力与局限性。谷歌未来计划将SL2T扩展至更多手语种类,并进一步研发手语生成模型。
Q&A
Q1:SL2T是什么?它能做什么?
A:SL2T是谷歌DeepMind推出的手语转文字AI模型,全称Sign Language to Text。它能通过手机摄像头识别用户打出的手语,实时将其转换为文字,支持网页搜索、撰写邮件、编辑文档,还可向Gemini发出手语指令。目前首发支持美国手语(ASL)转英文,搭载于Pixel 11手机的Gboard和Live Transcribe应用中。
Q2:SL2T如何保护用户隐私?
A:SL2T采用端侧计算机视觉模型MediaPipe Holistic,在设备本地追踪手语者面部、双手、手臂和躯干的几何姿态坐标,只将这些坐标数据上传至云端,不会上传任何实际视频内容。这种方式既提升了处理速度,也有效保护了用户的视频隐私。
Q3:SL2T目前支持哪些手语?未来会扩展吗?
A:目前SL2T首版仅支持美国手语(ASL)转英文。但谷歌在训练时已涵盖50余种手语、超10万小时的数据,以学习不同手语间的共性结构。谷歌表示未来计划将SL2T扩展至更多手语种类,并开发手语生成模型。
