基于解耦时域深度扩散Transformer的高效音频合成
Apple推出内存高效音频合成架构,在设备上实时合成语音。
AI 深度解读
Apple 最新研究提出一种内存高效的音频合成架构,支持 Siri 表情语音在设备上实时生成丰富、可配置的语音,核心是解耦时域深度扩散 Transformer。该架构在 Apple Matrix 协处理器(AMX)的严苛计算与内存预算下,将语义音频令牌转换为高保真音频。
- 创新地采用解耦时域深度扩散 Transformer 设计,将语义音频令牌转换为残差矢量量化(RVQ)表示,实现高保真合成。
- 三组件设计包括流式模块,支持实时设备端运行,克服 AMX 资源限制,达到 Siri 表情语音的高质量要求。
- 该架构是 AFM 3 Core Advanced 的核心能力之一,展示了扩散模型在音频合成中的高效性,尤其适合端侧部署。
- 为设备上的语音合成提供了新路径,兼顾内存效率与音频质量,可能推动更多实时交互应用落地。
- 影响/看点:这项研究直接支撑了 Siri 表情语音的商用能力,证明了扩散模型在资源受限设备上的可行性,对未来智能助手的音频生成有重要参考价值。
本内容由 AI 生成,仅供参考,请注意甄别