腾讯混元开源语音基础模型 AuK 及极速推理版 AuK-Flash

📡 腾讯混元2026-09-10 18:33

腾讯混元开源语音模型 AuK 及极速版 AuK-Flash,统一语音生成与编辑,支持零样本 TTS 与音色控制。

AI 深度解读

腾讯混元开源了统一语音生成与编辑的基础模型 AuK 及其极速推理版本 AuK-Flash,通过统一定义多类音频任务提升了开源语音模型的实用价值。

  • AuK 采用自然语言指令结合参考音频的统一样式,支持零样本文本转语音(Zero-shot TTS)、指令控制生成以及语音内容编辑。
  • 模型覆盖语音增强、去噪、消除口音、音色与情感编辑、语速与音高调节、多说话人及音乐分离等多种功能。
  • 同步推出的 AuK-Flash 支持 4 步推理,在相同测试条件下推理速度提升约 4.5 倍。
  • 腾讯混元已同步开源代码、模型权重与演示环境,并公开了相关研究论文。
  • 影响/看点:若多任务统一架构在复杂真实场景下的生成质量与稳定性得到验证,可能加速端到端音频处理流水线的整合。
  • 资料依据:
  • X:腾讯混元(2026-09-10):https://x.com/TencentHunyuan/status/2097996926876795197
  • GitHub:Tencent-Hunyuan(2026-09-10):https://github.com/Tencent-Hunyuan/AuK

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手