Mask Forcing:通过双噪声掩码 Rollout 改进自回归视频扩散蒸馏

📡 HuggingFace Daily Papers2026-09-08 08:00

针对自回归视频扩散蒸馏中的模式崩溃与画质退化问题,提出Mask Forcing策略,通过双噪声掩码扰动显著提升生成视频质量。

AI 深度解读

据 arXiv 于 2026 年 9 月 8 日公布的论文,研究人员针对自回归视频扩散蒸馏中的模式坍塌问题提出双噪声掩码策略 Mask Forcing,以改善实时视频生成的视觉质量。

  • 传统分布匹配蒸馏采用逆向 KL 散度,容易导致自回归学生模型坍塌到少数模态,进而产生过度饱和与过度平滑等画质问题。
  • Mask Forcing 在自回归推演中沿空间和时间轴对带噪输入实施随机掩码并注入较干净信号,促使学生模型探索教师分布中未覆盖的区域。
  • 注入的较干净 token 同时为其他高噪声 token 提供去噪先验,减轻了多步推演中的误差累积,且无需引入真实视频或额外后训练阶段。
  • 影响/看点:该策略在不增加外部训练数据的前提下提升了自回归视频蒸馏质量,其实际收益仍受限于基础教师模型的生成能力上限与动态连贯性。
  • 资料依据:
  • arXiv(2026-09-08):https://arxiv.org/abs/2609.09123
  • HuggingFace Daily Papers(2026-09-08):https://huggingface.co/papers/2609.09123

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手