通义千问发布 Qwen3.8-Omni-Flash 及配套框架,大幅降低音频延迟与调用成本
通义千问发布Qwen3.8-Omni-Flash及配套框架,大幅提升多人语音识别率并显著降低音频调用延迟与成本。
AI 深度解读
2026 年 9 月 18 日,开源社区与技术平台披露阿里千问团队发布全模态模型 Qwen3.8-Omni-Flash 及配套框架,其关注价值在于显著降低了长音频理解与实时语音交互的延迟与落地调用成本。
- 核心性能提升:Qwen3.8-Omni-Flash 综合基准平均分相比前代提升 25%,在复杂的多人重叠会议语音识别场景中,错误率从 88% 下降至 3%。
- 上下文与成本优化:模型原生支持最长达 1 小时的连续音视频输入,音频输入调用价格降至每百万 Token 0.8 元,相较此前的 18 元呈现量级下降。
- 实时交互与生态工具:同步推出超低延迟版本 Qwen3.8-Omni-Flash-Realtime(20 秒音频响应延迟约 981 毫秒),并开源 Qwen-Live-Harness 与 Qwen-MM-Plugins 两大配套工具链。
- 影响/看点:该发布意味着高质量实时语音交互与长音视频智能分析的工程应用门槛进一步降低,可能推动智能客服与实时会议纪要等场景的规模化普及,前提是模型在实际弱网环境下的流式传输稳定性与端到端延迟控制能持续符合预期。
- 资料依据:
- X:karminski(2026-09-18):https://x.com/karminski3/status/2100751056104026497
- GitHub:QwenLM/Qwen(2026-09-18):https://github.com/QwenLM/Qwen3.8-Omni
本内容由 AI 生成,仅供参考,请注意甄别