xAI 发布 Grok 4.7 模型技术报告:多项基准大幅领先
xAI发布Grok 4.7技术报告,其在终端操作和编程等多项基准测试中较上一代显著提升且价格不变。
AI 深度解读
xAI 团队公开了 Grok 4.7 模型技术报告(Model Card),公布了该模型在多项权威基准测试中的量化评测数据与技术细节。
- 终端指令交互基准 Terminal-Bench 得分由 Grok 4.6 的 20.3% 提升至 38.0%。
- 软件工程长任务基准 SWE-Marathon 得分由 31.9% 提升至 46.0%,显示代码与长任务执行能力的改观。
- 专业领域基准同步提升,其中 HealthBench Pro 医疗基准升至 56.7%,EEBench 电子工程基准升至 66.0%,法律智能体基准升至 19.6%。
- 报告确认模型 API 接口保持与 4.6 版本相同的调用定价,未因基准表现提升而上调价格。
- 影响/看点:量化指标的提升意味着该模型在终端自动化与代码工程等实用场景中具备更强的任务执行潜力,后续价值兑现依赖于实际开发中应对非标准化输入时的泛化表现。
- 资料依据:
- X:Eric Zakariasson(2026-09-21):https://x.com/ericzakariasson/status/2102092784727679127
- xAI(2026-09-21):https://media.x.ai/v1/website/4p7card-5eccc980.pdf
本内容由 AI 生成,仅供参考,请注意甄别