[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"aihot-art-100390":3},{"itemId":4,"vertical":5,"category":6,"source":7,"score":8,"title":9,"summary":10,"analysis":11,"url":12,"coverUrl":13,"direction":13,"marketSignal":13,"publishedAt":14},"100390","ai","论文研究","HuggingFace Daily Papers",58,"Mage-Flow：高效原生分辨率图像生成与编辑基础模型","Mage-Flow提出高效原生分辨率图像生成与编辑基础模型，含轻量级VAE和原生分辨率多模态扩散Transformer。","这篇论文提出了一个名为 Mage-Flow 的高效原生分辨率图像生成与编辑基础模型，在保持竞争力的同时大幅降低了计算成本，值得关注。\n· Mage-Flow 是一个 4B 参数规模的紧凑生成栈，由轻量级高保真潜在分词器 Mage-VAE 和原生分辨率多模态扩散 Transformer 组成，通过协同设计实现高效。\n· Mage-VAE 采用单步扩散式编解码和锚点潜在正则化，在保持重建质量的同时将分词成本降低一个数量级以上。\n· 原生分辨率打包和 CUDA 内核融合支持灵活分辨率训练，端到端训练吞吐量提升约 2.5 倍。\n· 模型家族包括 Base、RL 对齐和 Turbo 变体，Turbo 模型通过少步蒸馏和对抗感知指导实现 4 步推理，在单张 A100 GPU 上生成 1024² 图像仅需 0.59 秒，编辑仅需 1.02 秒。\n· 在标准基准上，Mage-Flow 和 Mage-Flow-Edit 取得了与更大模型竞争的性能，证明了紧凑模型通过精心设计也能实现高质量生成。\n影响\u002F看点：Mage-Flow 展示了通过分词器-骨干-系统协同设计，可以在 4B 参数规模内实现高效的高分辨率生成与编辑，为实际交互应用提供了可行方案。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.19064",null,"2026-07-21 08:00:00"]