Grok 4.5 领跑 VulcanBench 新编程基准

📡 cb_doge2026-07-20 03:10

Grok 4.5在VulcanBench编程基准中得分91.3%,击败Claude Fable 5和GPT-5.6。

AI 深度解读

Grok 4.5 在 VulcanBench 新编程基准中领跑,得分 91.3%,解决 23 个真实任务中的 21 个,击败 Claude Fable 5 和 GPT-5.6 Sol。

  • VulcanBench 基准涵盖五种编程语言的 23 个真实世界软件任务。
  • Grok 4.5 以 91.3% 的解决率领先,同时占据成本效率前沿。
  • 该成绩表明 Grok 在编程能力上已跻身顶级模型行列。
  • 影响/看点:Grok 4.5 的编程表现进一步巩固了 xAI 在 AI 竞赛中的地位,尤其在代码生成领域。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com