利用自适应循环 Transformer 提升测试时计算扩展效率
论文针对循环Transformer在长输出时计算浪费的问题,提出自适应机制TaH2,提升测试时计算扩展效率与生成精度。
AI 深度解读
清华大学等团队在 2026 年 9 月 28 日发布的预印本论文中提出了自适应循环架构 TaH2,聚焦解决循环 Transformer 在测试时计算扩展(Test-Time Scaling)过程中计算分配不均与效率受限的问题。
- 传统循环 Transformer 通过跨层复用参数提升参数效率,但在同等测试计算量下性能往往低于非循环基线,且固定深度循环在所有标记上分配均等计算带来了额外浪费。
- TaH2 引入前瞻深度监督(lookahead depth supervision)联合后训练主干与迭代决策器,使模型能够将循环迭代自适应集中在真正获益的标记上。
- 在 AIME 数学基准测试中,TaH2 将准确率-计算量扩展斜率提升了 53%(2.74 对比 1.79),在同等测试计算量下超越非循环基线峰值准确率约 3.4 个百分点。
- 随着最大迭代深度增加,固定循环模型效果逐渐停滞,而 TaH2 相对非循环基线的领先优势从深度 2 的 +2.8 分持续提升至深度 8 的 +3.9 分。
- 影响/看点:该方案表明动态分配测试时推理深度是释放循环模型扩展潜力的有效机制,其代码已开源,若能与主流推理加速引擎深度整合,可能在复杂推理场景中显著降低参数存储与显存开销。
- 资料依据:
- arXiv(2026-09-28):https://arxiv.org/abs/2609.35748
- GitHub(2026-09-28):https://github.com/thu-nics/TaH
本内容由 AI 生成,仅供参考,请注意甄别