论文提出 TTPO:通过非对称反馈机制实现大模型测试时策略优化
论文提出TTPO框架,通过蒸馏一致输出并惩罚分歧输出的非对称反馈机制,实现无真值标签的测试时策略优化。
AI 深度解读
2026年8月,研究人员提出测试时策略优化方法 TTPO,通过非对称反馈机制在无真实标签条件下实现了大模型在测试阶段的稳定自我优化。
- 传统测试时训练依赖多数投票伪标签,一旦投票错误会导致全序列误导;研究发现与伪标签不一致的生成路径具有更高的固有错误概率,呈现出非对称性。
- TTPO 构建非对称目标函数:对投票一致的路径采用在策略自蒸馏(OPSD),对不一致的路径通过分组强化学习(Grouped RL)施加负向惩罚。
- 算法引入词元级权重筛选,蒸馏阶段降低已收敛位置的权重,强化学习阶段仅惩罚高置信度的错误词元,确保更新稳定性。
- 在无需人工标注的情况下,TTPO 在五项竞赛级基准上达到监督级 OPSD 水平,使 Qwen3-1.7B 模型在测试时训练中的准确率从 38.0% 提升至 45.2%。
- 影响/看点:该技术降低了复杂推理模型在部署端对外部验证器与人工标签的依赖,但其实用化需在推理延迟要求与多分支采样带来的算力开销之间取得平衡。
- 资料依据:arXiv 论文(https://arxiv.org/abs/2608.27448)、HuggingFace Daily Papers(https://arxiv.org/abs/2608.27448)。
本内容由 AI 生成,仅供参考,请注意甄别