Arena 官方宣布 Grok 4.7 正式入驻 Agent Arena 长程评测

📡 Arena2026-09-22 00:37

Arena宣布Grok 4.7入驻Agent Arena,将在长周期多工具调用的复杂任务中接受实测与投票。

AI 深度解读

评测平台 Arena 于 2026 年 9 月 21 日宣布 xAI 旗下的 Grok 4.7 正式入驻 Agent Arena 长程智能体评测体系,为衡量该模型在复杂工具链及多步骤任务中的实战水平提供了公开竞技场。

  • Agent Arena 基于数百万项真实长周期任务,允许模型调用网页搜索、文件系统与终端工具,并采用因果追踪方法量化智能体工作流执行能力。
  • xAI 官方同日发布的数据显示,Grok 4.7 经过更长周期的多小时任务强化学习训练,在保持每百万输入 2 美元、输出 6 美元基础费率的同时提升了上下文管理与自我验证能力。
  • 除 Agent 评测外,Grok 4.7 也同步进入 Battle Mode 文本、视觉、代码与文档竞技板块,并在 CursorBench 4.0 长程编程评测中取得 46.3% 的成绩。
  • 该模型采用原生多智能体架构支持与新安全防御栈,重点针对网络安全及生物风险领域的越狱与违规调用进行拦截。
  • 影响/看点:Grok 4.7 加入长程智能体盲测可能推动行业从单轮对话评测转向以终端调用和任务闭环为核心的因果评测,但其真实竞争力仍需在开发者社区的大规模真实复杂任务中持续验证。
  • 资料依据:
  • X:Arena (@arena)(2026-09-21):https://x.com/arena/status/2102074819743453410
  • xAI(2026-09-21):https://x.ai/blog/grok-4-7

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手