普林斯顿联合 Sierra 推出 τ^τ-Bench:Claude Opus 5 构建端到端客服智能体仅达 23.9% 成功率

📡 DAIR.AI2026-09-08 05:00

普林斯顿与Sierra推出评测构建智能体能力的τ^τ-Bench基准,Claude Opus 5测试成功率仅为23.9%。

AI 深度解读

普林斯顿大学联合 Sierra 推出基准测试 τ^τ-Bench,直接以端到端构建生产级客服智能体为任务检验代码智能体的综合交付能力。

  • τ^τ-Bench 包含 4 个领域的 53 项评估任务,模拟真实客户交付场景,要求开发者智能体利用业务记录、需求对话、生产 API、既有代码库及成本限制构建系统。
  • 评测直接将构建出的客服智能体部署并面对保留的模拟用户进行交互打分,而非仅评估单次代码补丁的正确性。
  • 实验结果显示,在 Claude Code 工具链下运行的 Claude Opus 5 在该基准上的评估通过率为 23.9%,而人类专家基准成绩为 82.2%。
  • 论文指出模型的主要不足在于对业务文档的检索流于表面、与客户的协同沟通不足,以及缺乏对智能体架构与推理成本的充分实验验证。
  • 影响/看点:该基准意味着对编程智能体的评估正从单一代码生成扩展至系统级架构设计与需求协作,为检验 AI 解决复杂工程交付任务提供了量化参照。
  • 资料依据:
  • arXiv 论文预印本(2026-09-07):https://arxiv.org/abs/2609.04611
  • DAIR.AI 论文发布(2026-09-07):https://academy.dair.ai/papers/bench-an-environment-for-end-to-end-realistic-agent-construction-2609.04611

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手