Grok 4.5 登顶 VulcanBench 编程基准
Grok 4.5在VulcanBench编程基准测试中取得最高分。
AI 深度解读
Grok 4.5 在 VulcanBench 编程基准中登顶,得分 91.3%,超越 Claude Fable 5 和 GPT-5.6 Sol。
- Grok 4.5 在 VulcanBench 新编程基准中解决 21/23 个真实软件任务,覆盖五种语言。
- 得分 91.3%,同时保持成本效率最优,击败 Claude Fable 5 和 GPT-5.6 Sol。
- 该基准测试实际编码能力,Grok 4.5 的领先显示其在编程领域的竞争力。
- Elon Musk 亲自宣布这一消息,强调 Grok 持续获胜。
- 看点:Grok 4.5 在编程任务上表现突出,xAI 模型在实用场景中追赶并超越对手。
本内容由 AI 生成,仅供参考,请注意甄别