开源视频生成架构 VDN 发布:混合注意力实现近无损实时文生视频
开源视频生成架构VDN发布,采用混合注意力机制实现近无损画质与大幅加速,生成速度超越视频播放速度。
AI 深度解读
开源视频生成框架 Video Delta Net(VDN)正式发布,该研究通过混合注意力机制尝试解决长序列视频生成中的计算开销瓶颈,为提升端到端文生视频推理效率提供了新路径。
- 架构设计采用混合注意力方案,结合局部滑动窗口 Softmax 注意力与全局线性注意力,并配合视频 Delta 注意力(VDA)按帧而非逐 token 更新状态,以契合视频时序结构。
- 性能测试数据显示,VDN-H3 相比原版密集注意力加速 75 至 90 倍,在 8 张 NVIDIA B200 GPU 环境下耗时 11.23 秒(8 步去噪)完成 14.4 秒 768p 分辨率视频生成,生成速率超过播放速率。
- 开源成果包括检查点权重、训练与推理代码及技术文档,支持即插即用的 LoRA 微调适配,但遵循包含部分地区使用限制的 MiniMax H3 社区许可协议。
- 影响/看点:这一方法意味着长视频生成速度瓶颈有望通过结构化注意力设计缓解,但实际落地效果仍取决于开源权重在通用场景下的画质保真度以及硬件部署门槛。
- 资料依据:
- X:马东锡 NLP(2026-09-03):https://x.com/dongxi_nlp/status/2095382936769991110
- GitHub(2026-09-03):https://github.com/OpenVDN/vdn-minimax-h3
本内容由 AI 生成,仅供参考,请注意甄别