Chimera:混合视觉扩散 Transformer 的设计与 Chinchilla 式扩展
提出混合视觉扩散Transformer Chimera,结合线性注意力与MLA降低长上下文生成成本,并给出Chinchilla式扩展方案
AI 深度解读
一项研究发布 Chimera,一款面向高分辨率图像和长视频生成的混合架构扩散 Transformer,核心目标是解决全注意力机制在长视频、多模态场景下计算量随长度平方增长、成本爆炸的老大难问题。
- 文本、图像、视频 token 被排成同一个一维序列联合处理,且不使用位置编码,架构上做了大胆简化
- 混合三种机制:线性复杂度的 Kimi Delta Attention 负责长程状态跟踪、穿插的多头潜在注意力负责全局直接交互、感知模态的短卷积负责局部时空细节,再叠加稀疏混合专家层扩容而不增加实际激活算力
- 提出 HeteroP 参数迁移方案,按张量的功能性输入规模和网络深度分配超参数,据此拟合出激活参数量、训练 token 数、图像视频数据配比的最优缩放规律
- 训练出的 110 亿参数(20 亿激活参数)模型,在预训练阶段比同等规模的全注意力 Wan-2.1 2B 基线计算效率高 1.7 倍,整体系统效率提升达 7.3 倍
- 仅用 5 秒短视频训练,却能零样本外推生成 30 秒长视频,末尾 5 秒画质仅下降 6.5%
- 这套混合注意力加稀疏专家的方案,为长视频生成模型摆脱算力瓶颈提供了一条可落地的架构范式,也给后来者一套现成的缩放定律可直接套用。
本内容由 AI 生成,仅供参考,请注意甄别