具身AI公司AGIBOT宣布,其WITA-Omni Preview多模态基础模型在Daily-Omni音视频推理基准测试中取得最高分,超越了阿里巴巴、谷歌和字节跳动的同类模型。
据该公司介绍,WITA-Omni Preview在这一第三方基准测试中的平均准确率达到85.21%,领先于Qwen3.5-Omni-Plus、Gemini 3.1 Pro Preview和豆包Seed 2.0 Lite。
该模型在音视频对齐、比较、事件排序,以及30秒和60秒视频子集等评测项目中均获得最高分,并在8项评测指标中的6项排名第一或并列第一,其中包括在推理能力项目上并列第一。
Daily-Omni旨在评估模型在日常场景中理解和推理音频与视觉信息的能力。该基准测试包含684段真实视频和1197道多项选择题,涵盖音视频对齐、事件排序、推理等六大任务类别。
与主要聚焦于图文理解的基准测试不同,Daily-Omni评估的是AI模型能否将声音与可见事件相关联、理解情境随时间的演变,以及跨多种数据类型进行推理的能力。
AGIBOT表示,这些能力对于在动态环境中运行的具身AI系统尤为重要——机器人需要判断谁在说话、将声音与动作关联、跟踪事件序列,并决定是否响应、何时响应以及向谁响应。
该公司表示,WITA-Omni有别于传统机器人交互系统,其在"思考者-说话者"框架基础上新增了"行动者"模块,将肢体动作和面部表情作为与语音并列的原生输出。
该架构由三个核心部分组成:
思考者作为多模态推理引擎,在共享表示空间内处理文本、图像、音频及音视频组合输入,负责推理和交互决策。
说话者根据思考者的内部状态实时生成语音。
行动者负责生成协调的肢体动作和面部表情。
AGIBOT表示,这一统一的思考者-说话者-行动者架构使感知、推理、语音、动作和面部表情生成能够在共享的模型状态和时间轴内协同运作,使机器人在准备和输出响应的同时,仍能持续观察周围环境。
该公司表示,WITA-Omni在持续训练阶段使用了数千万小时的多模态数据,将模型能力从文本和图像扩展至音频感知与跨模态推理。
为提升真实交互场景中的表现,AGIBOT还构建了一个涵盖数千小时的以人为中心的多模态交互数据集。该数据集保留了音频、视频、语言、肢体动作和面部表情之间的时序关系,帮助模型学习人类交互的自然展开方式。
训练过程分为三个阶段:监督微调、在线策略蒸馏和强化学习。
据AGIBOT介绍,监督微调阶段建立了模型的多模态理解和协调输出能力;在线策略蒸馏阶段将一个能够获取额外上下文信息的教师模型的知识,迁移至无法获取该信息的学生模型;强化学习阶段则专注于优化交互决策,包括响应准确性、响应时机、目标对象选择以及是否应当给出响应等方面。该公司表示采用了群体相对策略优化(GRPO)方法对模型策略进行优化。
AGIBOT表示,该系统不仅能够生成准确的响应,还能判断响应是否恰当、应在何时给出,以及应面向哪位对象。
该公司表示,WITA-Omni Preview是其交互智能平台的基础,该平台正与操作智能和运动智能技术协同开发,共同构成"三智合一"架构。
AGIBOT表示,计划持续推进WITA系列多模态模型的研发,并将该技术集成至其机器人平台,以实现人与具身AI之间更自然、更具情境感知能力的交互。
这家总部位于上海的公司专注于具身AI基础模型和机器人系统的研发,产品涵盖人形机器人、四足机器人、灵巧操作系统和商用清洁机器人。2026年6月,AGIBOT宣布其第15000台机器人正式下线。
Q&A
Q1:WITA-Omni Preview是什么模型?有什么特别之处?
A:WITA-Omni Preview是AGIBOT发布的多模态基础模型,其核心特点是采用"思考者-说话者-行动者"三元架构,能够同时处理文本、图像、音频等多种模态输入,并将语音、肢体动作和面部表情作为协同输出,专为具身AI机器人在动态环境中的自然交互而设计。
Q2:Daily-Omni基准测试是什么?为什么这个成绩值得关注?
A:Daily-Omni是专门评估AI模型在日常场景中音视频理解与推理能力的第三方基准测试,包含684段真实视频和1197道多项选择题。WITA-Omni Preview在该测试中以85.21%的平均准确率排名第一,超越了阿里巴巴Qwen3.5-Omni-Plus、谷歌Gemini 3.1 Pro Preview和字节跳动豆包Seed 2.0 Lite,说明其在跨模态推理能力上具有明显优势。
Q3:WITA-Omni是如何训练出来的?
A:WITA-Omni采用三阶段训练流程:首先通过监督微调建立多模态理解和协调输出能力;其次通过在线策略蒸馏将教师模型的知识迁移至学生模型;最后通过强化学习(使用GRPO方法)优化交互决策,包括响应时机、目标对象选择等。训练数据包括数千万小时的多模态数据及数千小时的人类交互专项数据集。
