OpenAI GPT-6.1 正式上线 Agent Arena 竞技场开启长时程任务盲测
OpenAI GPT-6.1 正式入驻 Agent Arena 评测平台,在包含搜索、终端调用等真实长时程任务中开启盲测。
AI 深度解读
Arena 评测平台于 2026 年 9 月 29 日宣布将 OpenAI 的 GPT-6.1 模型纳入 Agent Arena 竞技场,开启针对真实长时程智能体任务的社区盲测评估。
- GPT-6.1 正式上线 Agent Arena,接受由社区用户提交的真实长链路智能体任务检验。
- 评测任务覆盖数百万个结合网页搜索、文件系统和终端命令调用的复杂工作流。
- 榜单采用因果追踪方法,量化评估模型在多步骤决策和工具协同过程中的执行稳定性。
- 影响/看点:将前沿模型置于多步骤工具调用竞技场中,能更客观地反映长时程智能体在真实开发场景下的执行稳定性,具体表现需待后续社区盲测评分公布后验证。
- 资料依据:
- Arena 官方 X 账号(2026-09-29):https://x.com/arena/status/2105006240363581728
- OpenAI 官方博客(2026-09-29):https://openai.com/index/devday-2026-recap
本内容由 AI 生成,仅供参考,请注意甄别