GRACE:面向高效视频生成的生成感知潜空间压缩

📡 HuggingFace Daily Papers2026-10-07 08:00

提出GRACE生成感知潜空间压缩方法,在提高视频压缩率的同时保持重建质量和扩散模型兼容性。

AI 深度解读

论文提出 GRACE,通过保留基础潜变量、学习残差潜变量并对齐生成模型特征,压缩预训练视频自编码器,关注价值在于降低视频生成的计算成本,同时减少重新训练扩散模型的需要。

  • 方法针对高压缩率下重建质量下降以及潜变量分布偏移两个问题设计了两阶段流程。
  • 作者在 Wan2.1-I2V-14B 上将令牌数量减少 8 倍,并报告在 480×832×81 设置下延迟降低 11.1 倍。
  • 论文称,压缩后的系统在 VBench 上达到与压缩前预训练流程相当的生成质量。
  • DiT 适配采用轻量微调和非对称去噪,基础潜变量先于残差潜变量处理。
  • 影响/看点:若质量、延迟和显存占用能在不同分辨率、模型规模及硬件上保持类似趋势,GRACE 可能降低视频生成部署门槛;但当前结论主要基于 Wan2.1-I2V-14B 和 VBench,不能直接推断所有视频模型均有同等收益。
  • 资料依据:
  • GRACE 论文(2026-10-07):https://arxiv.org/abs/2610.10524
  • GRACE DOI 记录(2026-10-07):https://doi.org/10.48550/arXiv.2610.10524

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手