Grok 4.7 发布:基准大幅提升且加量不加价
Grok 4.7 正式发布,在价格与响应速度保持不变的前提下,法律评测与终端操作基准得分大幅跃升。
AI 深度解读
2026年9月21日,xAI 发布 Grok 4.7 模型并在法律与终端操作基准中更新评测数据,其关注价值在于高阶专业智能体场景下的模型基准表现与定价策略。
- 据 xAI 官方公告(2026-09-21),Grok 4.7 在保持与前代 Grok 4.6 相同调用价格与响应速度的前提下完成模型升级。
- 在专业法律智能体基准测试 Harvey Legal Agent Benchmark 中,Grok 4.7 取得 19.6% 的得分记录。
- 在评估终端命令行与工程任务的 Terminal-Bench 4.0 测试中,Grok 4.7 的基准得分较前代实现明显提升。
- 模型重点更新了复杂代码生成、多步骤工具调用与长文本推理维度的基准数据。
- 影响/看点:若第三方独立评测与实际业务场景能够复现该基准成绩,维持原有定价体系的高性能智能体模型可能进一步降低法律与代码自动化工具的落地门槛,但实际价值仍取决于复杂工程环境中对长流程幻觉控制与合规要求的适配程度。
- 资料依据:
- xAI 官方公告(2026-09-21):https://x.ai/blog/grok-4-7
- X:Rohan Paul(2026-09-21):https://x.com/rohanpaul_ai/status/2102107446852592045
本内容由 AI 生成,仅供参考,请注意甄别