李飞飞团队发布多模态世界模型:单图补全 3D 世界并构建机器人训练场

📡 量子位 资讯2026-09-02 09:07

李飞飞团队发布多模态世界模型,能够通过单张图片重构 3D 场景并生成机器人训练环境。

AI 深度解读

李飞飞联合创立的 World Labs 发布空间智能世界模型 Atlas,探索从单张图像重建三维环境并支持机器人仿真训练的能力。

  • Atlas 采用多模态自回归扩散 Transformer 架构,原生统一处理文本、图像、视频与 3D 空间数据输入。
  • 模型支持像素级摄像机轨迹控制,可根据单张或多张参考图片生成长达 1 分钟、分辨率达 1440p 的多视角视频。
  • 具备空间几何重建能力,能从少量视图中推断生成未见区域的三维场景结构,性能超过传统单一视图重建模型。
  • 支持时空动力学建模,可通过视频重构与仿真实现真实世界向仿真环境(Real-to-Sim)的转换,为具身智能与机器人控制提供训练场。
  • 影响/看点:若 Atlas 生成的三维几何与物理动力学具备足够的物理保真度,可能显著缩短机器人策略在仿真环境中的迭代周期,推动具身智能仿真训练的实用化。
  • 资料依据:
  • 量子位(2026-09-02):https://www.qbitai.com/2026/09/482586.html
  • World Labs 官方博客(2026-09-01):https://www.worldlabs.ai/blog/atlas

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手