Wonder:更好的视频世界模型
提出通用视频世界模型Wonder,支持实时相机可控的世界探索和交互式导航。
AI 深度解读
Wonder视频世界模型让用户通过移动摄像机在交互式3D世界中实时探索,实现了长期一致的视频生成。
- 关键技术:引入密集坐标场作为摄像机条件,提供空间对齐的运动和方向线索;稀疏注意力记忆机制实现快速准确的长上下文检索。
- 蒸馏改进:修正自强制蒸馏管道,增强学生模型遵循控制信号的能力,同时保持生成多样性和长期记忆。
- 性能指标:能以16 FPS生成分钟级视频,在长距离中保持几何、外观和动态一致性。
- 应用扩展:自然支持视频条件生成,可实时重新拍摄现有动态场景,为虚拟制片、游戏等提供新工具。
- 看点:Wonder展示了视频生成从单向生成到交互式世界探索的跨越,是通往通用世界模拟器的重要一步。
本内容由 AI 生成,仅供参考,请注意甄别