xAI 推出 Grok Voice 2.0,阿里发布 Qwen3.8-Omni-Flash 全模态模型
xAI 推出语音转录 2.0,阿里同步发布全模态模型 Qwen3.8-Omni-Flash。
AI 深度解读
2026 年 9 月 19 日,xAI 与阿里巴巴分别发布了面向语音转录与全模态交互的新模型服务,反映出多模态与语音推理领域在处理速度与成本控制方面的持续迭代。
- xAI 在 Grok Voice API 中上线 Grok Voice Transcribe 2.0,批量处理单价为每小时 0.10 美元,流式处理单价为每小时 0.20 美元。
- 阿里巴巴通义千问团队推出全模态智能体模型 Qwen3.8-Omni-Flash,支持 100 万(1M)Token 的上下文窗口。
- 在计算开销方面,Qwen3.8-Omni-Flash 的视频输入调用成本相比此前的 Qwen3.5-Omni-Plus 降低了约 89%。
- 影响/看点:更低的模态输入成本与更长的上下文支持有助于长视频与实时语音智能体规模化部署,其商业回报取决于应用端在复杂长输入场景下的实际转化效率。
- 资料依据:
- xAI(2026-09-19):https://x.ai/api
- Qwen Team(2026-09-19):https://github.com/QwenLM/Qwen
- X:Testing Catalog(2026-09-19):https://x.com/testingcatalog/status/2101246004255158279
本内容由 AI 生成,仅供参考,请注意甄别