智元WITA-Omni Preview登顶全模态理解榜单

📡 IT之家2026-07-28 19:08

智元WITA-Omni Preview以85.21分登顶全模态理解榜单,超越千问、Gemini等模型。

AI 深度解读

国产具身大模型这次不是刷参数榜,而是拿下了更贴近人形机器人真实需求的“音视频联合理解”权威榜单DailyOmni第一,超过千问、Gemini、豆包等国内外一众强手。

  • 综合得分85.21分登顶,8项细分指标中拿下6项第一,尤其在声画对应、事件时序推理上领先
  • 架构上从“Thinker-Talker”扩展为“Thinker-Talker-Actor”,把物理动作和表情提升为与语音同级的一级输出,而不是把聊天模型硬塞进机器人躯壳
  • 中训练阶段用了千万小时级开源加自有多模态数据,把偏文本、视觉的底座升级为能听会看、能做跨模态联合推理的全模态模型
  • 核心差异在于自建了以人为中心的高质量交互数据集,完整保留声音、画面、动作、表情之间真实的时序关系,弥补了公开数据缺少轮次切换和响应时机标注的短板
  • DailyOmni本身就偏重真实开放环境素材而非常规图文短视频测试,更贴近人形机器人在物理空间中做人机交互所需的核心感知能力
  • 这说明具身智能的竞争重心正从“模型有多大”转向“数据和架构有多懂物理世界”,智元这次登顶给国产具身大模型在感知层树立了一个新的对标线。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com