智能体基准评测:Pareto 26.9 混合模型得分追平前沿旗舰,成本直降三分之二
最新智能体评测显示,Pareto 26.9 混合路由模型得分追平前沿旗舰模型,并将任务成本降低约三分之二。
AI 深度解读
在最新的 30 项智能体基准任务评测中,混合架构模型 Pareto 26.9 综合得分追平前沿旗舰模型 GPT-6 Astra,同时显著降低了任务推理成本。
- 架构机制:Pareto 26.9 采用多模型路由调度策略,将用户请求动态分发至多个前沿闭源与开源模型,并通过答案优选机制整合输出。
- 得分与成本:评测数据显示其在 30 项智能体基准任务中的表现与 GPT-6 Astra 并列第一,且单次成功任务的推断成本仅约为后者的三分之一。
- 执行速度表现:Pareto 26.9 的任务完成速度优于 DeepSeek V4 Pro 与 GLM 5.3 Flash;同场测试中 GPT-6 Sol 得分追平 Opus 5.5,单次成功任务成本降至约四分之一。
- 影响/看点: 该测试结果表明多模型动态组合在智能体工程中展现出优异的性价比,可能促使更多企业转向模型路由与集成架构以控制部署成本,但其上限仍受限于所调用的各基础模型能力的物理边界。
- 资料依据:
- X 平台 Elvis Saravia(DAIR.AI)发布(2026-09-24):https://x.com/omarsar0/status/2103199158207484164
- DAIR.AI 官方博客(2026-09-24):https://dair.ai/blog/agent-benchmark-pareto-26-9
本内容由 AI 生成,仅供参考,请注意甄别