SpaceXAI发布Grok Voice Transcribe 2.0:错误率减半且加量不加价
SpaceXAI发布语音转文本模型Grok Voice Transcribe 2.0,在保持原价的同时将错误率降低约一半。
AI 深度解读
2026 年 9 月 18 日,SpaceXAI(xAI)发布 Grok Voice Transcribe 2.0 语音转文本模型,在维持原有调用价格的同时将转录错误率降低约一半,显示出语音基础模型在实用转录场景中的持续迭代。
- 据 IT之家 2026 年 9 月 19 日报道,该模型基于 Grok Voice 底层音频架构构建,已接入客服电话转录、视频旁白生成以及特斯拉车载语音助手等实际业务场景。
- 官方测试涵盖客服通话、日常英语对话、口述信息(电话、邮箱、地址)及多语种简短指令 4 个内部测试集,其词错误率表现均优于 1.0 版本。
- 在第三方基准测试机构 Artificial Analysis 涵盖 32 款流式模型的榜单中,该模型的转录准确率位列前列。
- 模型保持批量转录每小时 0.10 美元、实时流式转录每小时 0.20 美元的定价,且默认包含说话人分离、时间戳与自定义关键词功能。
- 影响/看点:在控制 API 调用成本的同时降低转录错误率,可能改善客服系统与车载交互在复杂声学环境下的实用性,其实际效果取决于多语种混杂及高噪音环境下的抗干扰能力。
- 资料依据:
- IT之家(2026-09-19):https://www.ithome.com/1/004/534.htm
- Artificial Analysis(2026-09-19):https://artificialanalysis.ai/speech-to-text
本内容由 AI 生成,仅供参考,请注意甄别