4B 编程智能体 FrogNano 亮相:无需前沿模型蒸馏,SWE-bench 得分达 61.5%

📡 Rohan Paul2026-09-21 16:52

4B 参数编程智能体 FrogNano 亮相,无需前沿模型蒸馏,在 SWE-bench 达 61.5% 分数。

AI 深度解读

微软蒙特利尔研究院 Froggy 团队联合 Mila 与加州大学圣地亚哥分校发布 4B 编程智能体 FrogNano,展示了小参数模型通过纯强化学习实现高难度软件工程任务的能力。

  • 基座与基准表现:基于 Qwen3.5-4B 基座构建,在 SWE-bench Verified 评测集上达到 61.5% 的解决率,并在 SWE-bench Pro 上取得 37.6%。
  • 在线任务合成:研究提出 TaskPilot 流程,从真实代码仓库自动合成约 1500 个任务,并动态筛选模型成功率接近 50% 的“可学习前沿”样本,构建自适应训练课程。
  • 无前沿蒸馏与轻量脚手架:训练过程不依赖前沿大模型的行为蒸馏或人工标注,仅采用 DPPO 强化学习;同时采用极简工具脚手架 Leaf,降低小模型在复杂多轮调用中的指令混淆。
  • 影响/看点:该成果表明小参数端侧模型无需依赖昂贵的闭源模型数据蒸馏,即可通过合成环境强化学习掌握复杂编程逻辑;若该方法在更多工程场景复现,可能促使端侧私有化部署的编码智能体推理成本明显下降。
  • 资料依据:
  • X:Rohan Paul(2026-09-21):https://x.com/rohanpaul_ai/status/2101957605354557806
  • arXiv(2026-09-08):https://arxiv.org/abs/2609.07925

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手