智元WITA-Omni Preview登顶全模态理解榜单
智元WITA-Omni Preview以85.21分登顶全模态理解榜单,超越千问、Gemini等模型。
AI 深度解读
国产具身大模型这次不是刷参数榜,而是拿下了更贴近人形机器人真实需求的“音视频联合理解”权威榜单DailyOmni第一,超过千问、Gemini、豆包等国内外一众强手。
- 综合得分85.21分登顶,8项细分指标中拿下6项第一,尤其在声画对应、事件时序推理上领先
- 架构上从“Thinker-Talker”扩展为“Thinker-Talker-Actor”,把物理动作和表情提升为与语音同级的一级输出,而不是把聊天模型硬塞进机器人躯壳
- 中训练阶段用了千万小时级开源加自有多模态数据,把偏文本、视觉的底座升级为能听会看、能做跨模态联合推理的全模态模型
- 核心差异在于自建了以人为中心的高质量交互数据集,完整保留声音、画面、动作、表情之间真实的时序关系,弥补了公开数据缺少轮次切换和响应时机标注的短板
- DailyOmni本身就偏重真实开放环境素材而非常规图文短视频测试,更贴近人形机器人在物理空间中做人机交互所需的核心感知能力
- 这说明具身智能的竞争重心正从“模型有多大”转向“数据和架构有多懂物理世界”,智元这次登顶给国产具身大模型在感知层树立了一个新的对标线。
本内容由 AI 生成,仅供参考,请注意甄别