微软论文:将推理成本蒸馏为技能,大幅减少 Token 并保持高推理收益

📡 Rohan Paul2026-09-07 01:23

微软提出将模型推理成本蒸馏为技能提示词的新方法,可大幅减少 Token 消耗并保留推理收益。

AI 深度解读

微软研究团队于 2026 年 8 月发表论文提出一种通过被动技能蒸馏将昂贵测试时推理开销摊销为系统提示词的方法,使轻量非推理模型获得接近推理模型的性能。

  • 针对推理模型在单次调用中消耗数倍推理 Token 带来的成本问题,提出仅从 35 至 50 条历史执行轨迹中提取共性失败模式,并自动编译为 40 至 130 行的自然语言技能文档。
  • 将该技能文档直接注入非推理模型的系统提示词中,无需在每次推理时展开深层搜索链。
  • 实验显示,GPT-5.4-mini 在不消耗任何推理 Token 的情况下,恢复了 55% 至 100% 以上对比推理模式的精度差距,同时输出 Token 数量减少至原来的约三分之一到六分之一。
  • 影响/看点:该方法为高频智能体工作流提供了一种低成本替代方案,有望降低推理算力消耗,但其有效性取决于特定任务场景下历史轨迹的代表性与规则能否被准确提炼。
  • 资料依据:
  • Rohan Paul 个人 X 账号(2026-09-06):https://x.com/rohanpaul_ai/status/2096650583537234065
  • arXiv 预印本平台(2026-08-28):https://arxiv.org/abs/2608.18844

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手