DreamX-Creator:面向 2K 分辨率的原生音视频联合生成

📡 HuggingFace Daily Papers2026-08-31 08:00

提出7B参数原生音视频联合生成系统,根据首帧和文本提示同步生成2K视频及音频。

AI 深度解读

研究团队于 2026 年 8 月 31 日在 arXiv 发布开源音视频联合生成系统 DreamX-Creator 1.0,通过 7B 生成器与 2K 分辨率单步细化管线实现音画同步建模。

  • 联合去噪架构:系统基于首帧图像与文本提示,在前半段网络独立处理音视频流,并在后半段通过门控跨模态注意力机制进行特征耦合,增强声画同步关联。
  • 多阶段训练与多模态强化学习:采用两阶段音视频预训练及高质量微调,并结合模态感知反馈机制开展多模态强化学习,将视听反馈路由至对应数据流。
  • 自回归 2K 细化流程:利用自回归单步蒸馏技术,将多步教师模型压缩为每个时间块仅需单次去噪评估的学生模型,支持输出 2K 高分辨率视频。
  • 影响/看点:原生音视频联合建模降低了后置音效合成的不协调性,若其开源 7B 模型在消费级硬件上保持推理效率与生成稳定性,可能促进多模态内容创作者的技术门槛下移。
  • 资料依据:
  • arXiv 论文(2026-08-31):https://arxiv.org/abs/2608.31106
  • HuggingFace Daily Papers(2026-08-31):https://huggingface.co/papers/2608.31106

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手