长时程AI基准评测:顶尖模型表现仅达人类平均水平的27%
一项为期一年的长时程决策评测显示,主流顶尖 AI 模型的表现仅达人类平均水平的 27.3%,长程执行可靠性欠缺。
AI 深度解读
学术团队于2026年8月发布的MerchantBench长时程评测论文显示,包括GPT-5.6 Sol与Claude Opus 4.8在内的8款前沿模型在模拟一年的长期商业决策任务中,最佳成绩仅达到人类平均收益的27.3%。
- 模拟周期与约束严苛:评测构建了为期365天的批发电商运营环境,要求智能体在库存周转、定价策略和现金流控制等具有强依赖关系的连续时间线上进行多轮决策。
- 顶尖模型普遍表现受限:在受测的8款顶尖模型中,表现最佳的配置「Qwen3.7-Max搭配Hermes框架」最终净资产收益仅为人类平均水平的27.3%,而部分模型甚至出现资金耗尽破产。
- 长期一致性缺陷突出:实验表明当前模型在单次或数步决策中推理质量良好,但随着历史决策约束不断累积,智能体容易因早期微小失误在长链条中产生级联误差,缺乏跨季度的全局纠偏能力。
- 影响/看点:评测表明当前前沿大模型在真正接管复杂业务运营前仍存在长程规划可靠性瓶颈,该短板需依赖外置规划验证架构与更具韧性的状态管理机制来弥补。
- 资料依据:
- 1. MerchantBench 研究论文《MerchantBench: Evaluating Long-Horizon Coherence in LLM Agents》(2026年8月): https://arxiv.org
- 2. Rohan Paul 社交媒体评测解读(2026年8月): https://x.com/rohanpaul_ai/status/2093463254463103310
本内容由 AI 生成,仅供参考,请注意甄别