微软等推出 Taste-Bench 基准:评估长任务中智能体决策分叉点的“品味”

📡 Elvis Saravia2026-09-25 21:35

微软等推出Taste-Bench基准,用于评估智能体长任务决策能力,发现前沿模型正确率不足60%且加算力难改善。

AI 深度解读

微软等机构研究人员推出面向长流程复杂任务的决策评测基准 Taste-Bench,用以量化评估智能体在分支决策点的路径选择判断力(Taste)。

  • 该基准从软件工程(SWE-bench Pro)和机器学习科研轨迹中自动提取了 502 个真实决策分叉点,无需人工标注数据。
  • 评测结果显示前沿模型在该基准上的最高准确率仅为 59.7%,表明现有模型在长周期规划的早期选择阶段存在明显缺陷。
  • 研究发现仅增加推理计算预算(Reasoning Budget)无法有效提高分叉点选择正确率,但通过教师模型结果蒸馏能够提升学生模型的端到端任务成功率。
  • 研究论文与数据集已在 arXiv 和 Hugging Face 平台公开发布。
  • 影响/看点:Taste-Bench 指出了长任务中「早期关键决策」是制约智能体自主能力的核心瓶颈,证明长流程规划能力的提升需要针对决策品味进行针对性训练而非单纯依赖推理算力堆叠。
  • 资料依据:
  • arXiv(2026-09-23):https://arxiv.org/abs/2609.18845
  • X:Elvis Saravia(2026-09-25):https://x.com/omarsar0/status/2103478384584278502

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手