Elo-per-token:通过动态算力分配分析大模型智能体的测试期推理策略
为量化智能体在开放任务中的测试期算力分配策略,研究者提出Elo-per-token指标,用于评估不同Token预算下的解题进展。
AI 深度解读
研究人员于2026年9月14日在arXiv发表论文,提出通过Elo-per-token指标量化分析大模型智能体在测试期的算力分配与推理效能衰减规律。
- 研究针对长程开放式任务,利用Bradley-Terry模型将不同任务评分尺度统一映射为随Token消耗变化的Elo动态积分。
- 实验发现智能体在探索初期将算力转化为积分的效率高于独立采样,但随着Token预算增加,边际收益会逐渐衰减并低于独立采样基准。
- 论文据此定义了扩展拐点,即单会话边际收益与独立采样持平的算力临界值。
- 在多边形装箱任务中,将1亿Token算力预算拆分为10个短会话并行执行,所获Elo积分提升优于单一长会话。
- 影响/看点:该研究为长程推理智能体的测试期算力预算分配与并行调度策略提供了量化依据,有助于优化复杂工程搜索场景下的算力使用效率。
- 资料依据:
- arXiv(2026-09-14):https://arxiv.org/abs/2609.15309
- Hugging Face(2026-09-14):https://huggingface.co/papers/2609.15309
本内容由 AI 生成,仅供参考,请注意甄别