语音生成与编辑开源基础模型 AuK 技术报告发布
研究团队发布开源语音基础模型AuK的技术报告,该模型支持高质量语音生成与精准音频编辑任务。
AI 深度解读
腾讯混元与合作团队于 2026 年 9 月发布开源语音基础模型 AuK 的技术报告与代码权重,通过自然语言指令统一了语音生成与多种音频编辑任务。
- AuK 构建了约 30.3 亿条指令-音频样本及 195 万小时监督数据,覆盖语音生成、内容编辑、增强分离、副语言编辑和声学编辑五大任务族。
- 架构上融合多模态大模型进行语义调节、通用变分自编码器提取声学特征,并采用混合整流流 Transformer 结构完成生成。
- 训练引入人类反馈偏好优化与强化学习后训练,并通过一致性蒸馏推出支持 4 步快速推理且无分类器自由引导(CFG)的 AuK-Flash。
- 项目已在 GitHub 开源全部代码与模型权重,支持零样本与自然语言指令交互。
- 影响/看点:统一接口的多任务音频模型可能简化智能配音与音频后期的工程流水线,但其实际工业可用性仍取决于模型在低信噪比与复杂重叠声学环境下的抗噪稳定性。
- 资料依据:
- arXiv(2026-09-09):https://arxiv.org/abs/2609.08936
- GitHub(2026-09-09):https://github.com/Tencent-Hunyuan/AuK
本内容由 AI 生成,仅供参考,请注意甄别