Runway探索实时交互式视频生成,支持边提提示词边推流
Runway正基于世界模型GWM-1探索实时流式交互生成视频,允许用户输入提示词时即时获取画面。
AI 深度解读
Runway公布其实时交互式视频生成技术路线,展示了用户边输入提示词边流式生成视频的机制,探索改变传统生成视频需完整等待的离线交互方式。
- 该机制基于 Runway 此前发布的通用世界模型 GWM-1 与 Gen-4.5 架构,采用自回归因果扩散方式进行逐帧生成,支持将镜头轨迹、音频或机器人控制信号作为实时输入条件。
- 针对自回归生成中误差容易逐帧累积并导致画面失真的难点,研究团队通过模型自身输出样本进行训练,促使模型具备自我纠偏能力而非放大前期视觉偏差。
- 实时生成将算力负载从离线等待转移至实时交互阶段,旨在将首帧响应时间压缩至 100 毫秒以内,以减少用户在调整提示词与等待成片过程中的时间消耗。
- 除影视制作与动态界面生成(如 Solaris 界面系统)外,该类实时世界模型还规划应用于自动驾驶与机器人仿真,为具身智能系统提供即时反馈的虚拟测试场景。
- 影响/看点:实时视频流式生成若能在长时推理中维持画面一致性并控制算力开销,可能促使视频大模型从单纯的素材渲染工具演进为实时可交互的物理世界仿真环境。
- 资料依据:
- The Decoder(2026-09-20):https://the-decoder.com/runway-wants-to-turn-ai-video-generation-into-a-live-stream-you-control-in-real-time/
- Runway(2026-03-18):https://x.com/runwayml/status/2034284298769985914
本内容由 AI 生成,仅供参考,请注意甄别