Mage-Flow:高效原生分辨率图像生成与编辑基础模型
Mage-Flow提出高效原生分辨率图像生成与编辑基础模型,含轻量级VAE和原生分辨率多模态扩散Transformer。
AI 深度解读
这篇论文提出了一个名为 Mage-Flow 的高效原生分辨率图像生成与编辑基础模型,在保持竞争力的同时大幅降低了计算成本,值得关注。
- Mage-Flow 是一个 4B 参数规模的紧凑生成栈,由轻量级高保真潜在分词器 Mage-VAE 和原生分辨率多模态扩散 Transformer 组成,通过协同设计实现高效。
- Mage-VAE 采用单步扩散式编解码和锚点潜在正则化,在保持重建质量的同时将分词成本降低一个数量级以上。
- 原生分辨率打包和 CUDA 内核融合支持灵活分辨率训练,端到端训练吞吐量提升约 2.5 倍。
- 模型家族包括 Base、RL 对齐和 Turbo 变体,Turbo 模型通过少步蒸馏和对抗感知指导实现 4 步推理,在单张 A100 GPU 上生成 1024² 图像仅需 0.59 秒,编辑仅需 1.02 秒。
- 在标准基准上,Mage-Flow 和 Mage-Flow-Edit 取得了与更大模型竞争的性能,证明了紧凑模型通过精心设计也能实现高质量生成。
- 影响/看点:Mage-Flow 展示了通过分词器-骨干-系统协同设计,可以在 4B 参数规模内实现高效的高分辨率生成与编辑,为实际交互应用提供了可行方案。
本内容由 AI 生成,仅供参考,请注意甄别