EditWorld:支持精准编辑与灵活参考的可交互视频世界模型
论文提出视频世界模型EditWorld,通过门控因果注意力和稀疏上下文机制,支持生成过程中的流式精准编辑与参考图引入。
AI 深度解读
研究团队发布了支持流式编辑指令与参考图像的可交互视频世界模型 EditWorld,将世界模型能力从单纯的环境漫游拓展到对生成内容的精确修改。
- 针对现有视频世界模型难以局部精细化控制的问题,EditWorld 在自回归生成流程中支持流式注入编辑文本指令与参考图像。
- 模型引入门控因果注意力机制以解耦并融合时变编辑条件,同时设计稀疏上下文机制维持长时程推理的有界历史表征。
- 采用自回归与双向联合训练配合退火自重采样,并构建了配套的数据合成与标注管线以提供编辑监督信号。
- 论文提出评估基准 WBench-Editing,EditWorld 在该基准上取得 73.8 的综合分和 80.0 的编辑分,在多项编辑指标上优于现有方法。
- 影响/看点:该方法推动了视频世界模型从被动探索向可控创作的演进,若能在连续多轮编辑中稳定维持物体时空一致性并降低显存消耗,有望在虚拟交互与游戏仿真生成中建立实用工作流。
- 资料依据:
- arXiv 论文(2026-09-28):https://arxiv.org/abs/2609.34470
- GitHub 代码库(2026-09-28):https://github.com/leoisufa/EditWorld
本内容由 AI 生成,仅供参考,请注意甄别