后市场AI智能体框架
报告指出AI框架对模型性能影响超过模型本身,同一模型在不同框架下得分差异显著。
AI 深度解读
本文揭示了AI模型的表现很大程度上取决于其运行的“后市场”智能体框架(harness),而非模型本身。这一发现对AI部署和成本优化具有重要启示。
- 同一模型在不同框架下性能差异巨大:例如,OpenAI的GPT-5.5在原生Codex框架中功能正确率为61.5%,而在Cursor框架中升至87.2%;Anthropic的Opus 4.7在Claude Code中为87.2%,在Cursor中达91.1%。这证明框架对模型输出的影响远超模型迭代。
- 输入Token成本是AI推理的主要开销:输入Token占总流量的86-98%,尽管输出Token单价更高,但输入量巨大使其主导账单。智能体框架通过控制上下文选择、缓存重复内容,可节省40-80%成本,并提速13-31%。
- 智能缓存策略是关键:研究发现,仅缓存稳定前缀并将动态内容置于缓存断点之后,能实现线性成本节约。Cursor框架通过动态工具获取、优先级前缀组装和两级缓存,在技术上与Claude Code匹敌。
- 第三方框架可超越原生:GPT-5.5在Cursor中的正确率几乎翻倍,说明模型制造商的原生框架未必最优。智能体框架已成为AI性能的“骑手”,而非简单包装。
- 看点:AI部署者应重视框架选择,它不仅是模型调用层,更是优化成本、提升准确率的杠杆。第三方框架的潜力可能比想象中更大。
本内容由 AI 生成,仅供参考,请注意甄别