长周期智能体基准测试:15 款前沿大模型模拟运营 20 赛季暴露记忆与决策短板

📡 DAIR.AI2026-08-30 01:20

基准测试显示 15 款大模型在长达 20 赛季的运营模拟中暴露出记忆管理退化及无法从隐式反馈中学习的短板。

AI 深度解读

2026 年 8 月发布的 FM-Bench 长周期智能体基准测试显示,在模拟足球俱乐部运营 20 个赛季的任务中,15 款前沿大模型的表现差异主要取决于管理行为,并普遍暴露了记忆管理机制的缺陷。

  • 基准测试要求模型调用 26 个工具完成跨越 20 个游戏年的转会谈判、合同管理和财务决策(涉及 340 至 400 次决策中断),15 款前沿模型均顺利存活,而传统脚本基线大多破产。
  • 测试结果表明,模型的参数规模、调用价格、供应商以及 token 消耗量均无法直接预测最终排名,决定胜负的核心在于现金流控制与投资时机等经营策略。
  • 所有参测模型在长期记忆管理上均出现两种典型失效模式:一种是记忆库演变为只增不减、冗余失控的累积存档;另一种是每个赛季推倒重来、彻底丢失历史因果的周期性重置计划。
  • 此外,各模型均未能建立从被拒绝报价中反推隐藏底价的博弈学习能力,反映出多步复杂环境中的长程归纳推理短板。
  • 影响/看点:这一基准测试表明单纯扩充上下文窗口无法解决长周期复杂任务中的状态追踪问题,长程智能体的性能提升可能依赖于结构化记忆压缩与动态状态更新机制的创新。
  • 资料依据:
  • arXiv 预印本平台(FM-Bench 论文):https://arxiv.org
  • X 平台 DAIR.AI 官方账号:https://x.com/dair_ai/status/2093750534134284613
  • Hugging Face 数据集与模型平台:https://huggingface.co

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手