AuK 技术报告:开源全能语音生成与编辑基础大模型
开源语音基础大模型AuK,基于海量指令数据与混合扩散架构,通过自然语言指令统一了语音生成、编辑及音频增强等多项任务。
AI 深度解读
研究团队开源了语音生成与编辑基础大模型 AuK, 首次通过统一的自然语言指令与音频上下文接口集成了五类语音处理任务。
- 大规模多任务监督数据:构建了约 30.3 亿条指令音频对及 195 万小时有效监督数据, 涵盖语音生成、内容编辑、增强分离、副语言编辑和声学编辑五大领域。
- 混合整流流架构设计:结合多模态大语言模型、全音频 VAE 以及双流至单流切换的 DiT 模块, 兼顾语义理解与高质量声学特征建模。
- 两阶段训练与后训练对齐:预训练阶段由纯生成预热过渡到生成编辑联合训练, 后训练引入人类偏好优化与基于奖励的强化学习。
- 快速推理蒸馏版本:推出 AuK-Flash 蒸馏模型, 实现无需无分类器引导的 4 步快速推理, 在相同条件下达到全尺寸模型 4.5 倍的生成速度。
- 影响/看点:该工作开源代码与权重可能降低专业音频后期与可控语音合成的开发门槛, 实际应用效果将取决于跨语种与复杂声学噪声环境下的泛化表现。
- 资料依据:
- arXiv 预印本平台(2026-09-08):https://arxiv.org/abs/2609.08936
- Hugging Face 论文精选(2026-09-08):https://huggingface.co/papers/2609.08936
本内容由 AI 生成,仅供参考,请注意甄别