Wonder:更好的视频世界模型

📡 HuggingFace Daily Papers2026-07-28 08:00

提出通用视频世界模型Wonder,支持实时相机可控的世界探索和交互式导航。

AI 深度解读

Wonder视频世界模型让用户通过移动摄像机在交互式3D世界中实时探索,实现了长期一致的视频生成。

  • 关键技术:引入密集坐标场作为摄像机条件,提供空间对齐的运动和方向线索;稀疏注意力记忆机制实现快速准确的长上下文检索。
  • 蒸馏改进:修正自强制蒸馏管道,增强学生模型遵循控制信号的能力,同时保持生成多样性和长期记忆。
  • 性能指标:能以16 FPS生成分钟级视频,在长距离中保持几何、外观和动态一致性。
  • 应用扩展:自然支持视频条件生成,可实时重新拍摄现有动态场景,为虚拟制片、游戏等提供新工具。
  • 看点:Wonder展示了视频生成从单向生成到交互式世界探索的跨越,是通往通用世界模拟器的重要一步。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com