阶跃星辰发布 StepAudio 3 系列音频大模型:涵盖 5 款模型并在多项评测中登顶
阶跃星辰发布包含5款模型的StepAudio 3音频大模型系列,在对话动态与语音推理等多项评测中登顶。
AI 深度解读
阶跃星辰于 2026 年 9 月 15 日发布 StepAudio 3 系列共 5 款音频大模型,覆盖实时对话、语音识别与音频生成等全链路场景。
- 模型矩阵包含面向实时语音、语音识别、语音生成、音频生成及音乐创作的 5 款专用模型。
- 在 Artificial Analysis 评测中,其实时语音模型在对话动态性指标达 98.9%,在语音推理指标达 99.7%,均列榜单首位。
- 语音识别模型取得 1.7% 的词错率,在基准测试中与当前行业前列水平持平。
- 针对低延迟双向交互场景进行了针对性优化,支持多模态端到端音频处理。
- 影响/看点:这表明端到端音频模型在交互延迟与多轮推理上取得实质进展,但在真实落地中仍需应对复杂环境噪音干扰与多语种方言泛化的挑战。
- 资料依据:
- 阶跃星辰官方社交账号(2026-09-15):https://x.com/StepFun_ai/status/2099916376274313630
本内容由 AI 生成,仅供参考,请注意甄别