Accio 开源真实商业智能体基准 CommerceAgentBench:Qwen3.8-Max 领跑开源模型
Accio 开源商业智能体评测基准 CommerceAgentBench,Qwen3.8-Max 在评测的开源模型中取得最佳整体表现。
AI 深度解读
Accio 开源了面向真实商业运营的智能体基准 CommerceAgentBench,为评估大模型在复杂商业多工具工作流中的综合执行能力提供了标准化测试集。
- 基准涵盖 107 个源自真实商业需求的工作流,测试跨浏览器、API、命令行(CLI)及文件系统的多工具协同操作能力。
- 早期评测结果显示当前最佳整体任务完成率约为 62%,反映出商业智能体在复杂多步长链路任务中仍存在失败率。
- 在参与评测的开源权重模型中,Qwen3.8-Max 在复杂商业工作流综合通过率上取得最高分。
- 影响/看点:真实商业基准的建立有助于量化智能体在生产环境的可用性,但测试集表现能否转化为实际业务效益仍取决于对外部非标接口与异常情况的容错能力。
- 资料依据:
- 通义千问官方发布(2026-09-01):https://x.com/Alibaba_Qwen/status/2094641743056732205
- Accio GitHub 代码仓库(2026-09-01):https://github.com/Accio-org/CommerceAgentBench
本内容由 AI 生成,仅供参考,请注意甄别