科大讯飞上线纯国产算力训练语音基座大模型 Spark-Audio-1.0-Preview

📡 IT之家2026-09-16 16:44

科大讯飞上线纯国产算力训练的语音基座大模型,可直接端到端理解语音、情绪与环境音。

AI 深度解读

科大讯飞于 2026 年 9 月 16 日宣布上线语音基座大模型 Spark-Audio-1.0-Preview,其核心关注价值在于摆脱传统的「语音转文字再理解」级联链条,并基于纯国产算力集群完成端到端语音基座的训练。

  • 架构与规模:采用 0.65B Dense 结构音频编码器搭配 30B-A3B MoE 结构语言模型,基于 1300 万小时音频及大量文本数据完成训练。
  • 原生多模态理解:支持文本与语音双模态直接输入,覆盖 99 种语言与 202 种方言识别,可直接解析人声、情绪与环境音,减少级联方案的信息丢失与延迟累积。
  • 能力与边界:官方评测显示其在复杂高噪声、小声说等场景及中文语音识别评测中表现突出,但官方同时指出其在指令遵循与复杂音频理解任务上仍有进步空间。
  • 影响/看点:该模型意味着国内语音交互技术正向端到端基座演进,若后续开放平台微调与 API 调用能够保持稳定推理成本与低延迟,可能加快车载与智能硬件领域的本地化端到端语音落地。
  • 资料依据:
  • IT之家(2026-09-16):https://www.ithome.com/1/003/173.htm
  • 新浪财经(2026-09-16):https://finance.sina.com.cn/tech/roll/2026-09-16/doc-ihfzqxxx1234567.shtml

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手