Salesforce 发布企业智能体模型 Koa:基于 Nemotron-3 与 GRPO 强化学习构建

📡 Elvis Saravia2026-09-16 12:34

Salesforce 基于开源模型与 GRPO 强化学习,训练并发布了企业智能体模型 Koa。

AI 深度解读

Salesforce 于 2026 年 9 月 15 日公布企业级智能体推理模型 Koa 并发布技术论文,展示了如何通过合成数据仿真与强化学习优化垂直业务场景中的智能体工具调用能力。

  • 模型架构与训练方法:Salesforce AI Research 基于开源权重模型 Nemotron-3-Super-120B 进行后训练,结合监督微调(SFT)与群体相对策略优化(GRPO),训练过程仅依赖公开数据与合成数据,未引入客户私有数据。
  • 仿真到奖励机制:研发团队利用声明式工作流配置文件 Agent Script 构建了涵盖销售、服务等多角色的多轮业务仿真环境,直接根据工具调用的准确执行结果提供强化学习奖励。
  • 评测表现与能力边界:论文测试结果表明,Koa 在企业级客户关系管理(CRM)基准与多步骤工具调用上的表现优于基础开源模型并超越部分通用模型基线,但与顶尖通用前沿模型相比仍存在一定差距。
  • 影响/看点:Koa 验证了利用领域合成数据与强化学习定向优化企业智能体工具调用的可行性,若其在生产环境能稳定保持低调用错误率,可能帮助企业降低对昂贵通用闭源模型的依赖并提升业务流程自动化水平。
  • 资料依据:
  • X:Elvis Saravia(2026-09-16):https://x.com/omarsar0/status/2100080746056777899
  • arXiv 论文(2026-09-15):https://arxiv.org/abs/2609.15066

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手