Grok 4.5 领跑 VulcanBench 新编程基准
Grok 4.5在VulcanBench编程基准中得分91.3%,击败Claude Fable 5和GPT-5.6。
AI 深度解读
Grok 4.5 在 VulcanBench 新编程基准中领跑,得分 91.3%,解决 23 个真实任务中的 21 个,击败 Claude Fable 5 和 GPT-5.6 Sol。
- VulcanBench 基准涵盖五种编程语言的 23 个真实世界软件任务。
- Grok 4.5 以 91.3% 的解决率领先,同时占据成本效率前沿。
- 该成绩表明 Grok 在编程能力上已跻身顶级模型行列。
- 影响/看点:Grok 4.5 的编程表现进一步巩固了 xAI 在 AI 竞赛中的地位,尤其在代码生成领域。
本内容由 AI 生成,仅供参考,请注意甄别