基于解耦时域深度扩散Transformer的高效音频合成

📡 Apple Machine Learning Research2026-07-28 08:00

Apple推出内存高效音频合成架构,在设备上实时合成语音。

AI 深度解读

Apple 最新研究提出一种内存高效的音频合成架构,支持 Siri 表情语音在设备上实时生成丰富、可配置的语音,核心是解耦时域深度扩散 Transformer。该架构在 Apple Matrix 协处理器(AMX)的严苛计算与内存预算下,将语义音频令牌转换为高保真音频。

  • 创新地采用解耦时域深度扩散 Transformer 设计,将语义音频令牌转换为残差矢量量化(RVQ)表示,实现高保真合成。
  • 三组件设计包括流式模块,支持实时设备端运行,克服 AMX 资源限制,达到 Siri 表情语音的高质量要求。
  • 该架构是 AFM 3 Core Advanced 的核心能力之一,展示了扩散模型在音频合成中的高效性,尤其适合端侧部署。
  • 为设备上的语音合成提供了新路径,兼顾内存效率与音频质量,可能推动更多实时交互应用落地。
  • 影响/看点:这项研究直接支撑了 Siri 表情语音的商用能力,证明了扩散模型在资源受限设备上的可行性,对未来智能助手的音频生成有重要参考价值。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com