NeoHorse-1:基于智能体后训练与路由框架迈向递归自我提升
推出Agent原生模型NeoHorse-1,通过异构模型路由记录真实交互并转化为结构化样本,探索大模型递归自我提升机制。
AI 深度解读
据 arXiv 于 2026 年 9 月 8 日公布的论文,研究团队推出面向智能体后训练的模型家族 NeoHorse-1,通过路由框架与反馈驱动机制探索递归自我提升路径。
- 框架将异构模型池与智能路由相结合,记录每次交互的能力需求与服务层级,并转化为包含交错推理和工具调用的训练样本。
- 引入结构验证、六维语义评估与子场景标注,将路由信号组织为三阶段监督微调课程,并延伸至路由引导的同策略蒸馏。
- 基于能力引导的样本分配将评估反馈闭环注入下一轮训练混合集,在 11 项基准测试中将 4B 模型宏平均分从 58.94 提升至 64.87,显著缩小与 9B 基座模型的差距。
- 影响/看点:该成果表明利用路由机制构建反馈闭环能有效提升小模型智能体性能,但实现持续递归提升仍取决于多轮迭代中数据质量与评估标准的稳定性。
- 资料依据:
- arXiv(2026-09-08):https://arxiv.org/abs/2609.08183
- HuggingFace Daily Papers(2026-09-08):https://huggingface.co/papers/2609.08183
本内容由 AI 生成,仅供参考,请注意甄别