Grok 4.5 在 LaurenBench 排行榜上排名第一
Grok 4.5在LaurenBench排行榜上以56.9%得分排名第一,领先多个竞品。
AI 深度解读
Grok 4.5 在 LaurenBench 排行榜上以 56.9% 的得分登顶,领先于 Claude Sonnet 5、GLM 5.2、Kimi K3 等一众强手,展现其在真实世界 AI 智能体任务中的综合实力。
- LaurenBench 评估的是 AI 智能体在对话、工具使用、记忆和安全四个维度的实际表现。
- Grok 4.5 取得 56.9% 的得分,超越第二名 Claude Sonnet 5 数个百分点,差距明显。
- 该基准测试注重真实场景,与单纯比拼知识或推理的榜单形成差异化。
- 这一结果可能推动更多企业将 Grok 作为智能体开发的参考基线。
- 看点:Grok 4.5 的登顶意味着 xAI 在实用型智能体能力上取得突破,AI 竞赛从模型参数转向任务完成能力。
本内容由 AI 生成,仅供参考,请注意甄别