实测质疑:基准测试显示RTK并未如宣称般显著节省AI编程Token成本
Quesma发布基准测试报告,实测数据表明RTK并未如宣称的那样显著降低AI编程的Token成本。
AI 深度解读
分析机构 Quesma 于 2026 年 9 月 11 日发布基准测试报告指出,流行终端输出压缩工具 RTK 在实际测试中并未如社区预期般降低 AI 编程成本,揭示了终端输出裁剪与实际 API 计费之间的差异。
- 在 Terminal-Bench 2.1 的 1740 次测试中,Claude Code 搭配 RTK 的总支出减少 5%,而 OpenCode 搭配 DeepSeek V4 Pro 的总支出上升 5%,两者的任务通过率均略微下降 1% 至 2%。
- 按任务等权平均计算,Claude Code 任务成本平均微增 1%,DeepSeek 任务平均成本则上升 17%,表明压缩终端输出可能导致模型需要更多交互轮次来弥补上下文缺失。
- Claude Code 的总支出微降主要由单一特定任务(winning-avg-corewars)的轮次减少引起,剔除该任务后其余测试项目的平均节省不足 1%。
- 报告指出 RTK 自带的收益统计仅依据过滤前后字节差折算 Token 估算值,并不等同于大模型实际调用的结算 Token 数量。
- 影响/看点:这一实测结果意味着裁剪终端输出并不必然带来经济收益,只有当模型在精简上下文下仍能维持单次推理成功率并减少交互轮次时,压缩方案的降本效果才能真正成立。
- 资料依据:
- Quesma(2026-09-11):https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/
本内容由 AI 生成,仅供参考,请注意甄别