Thinking Machines 联合高校打造首个在 Text-to-SQL 任务上超越人类基准的模型
Thinking Machines与UIUC等合作,通过优化RLVR数据清洗与奖励对齐,在Text-to-SQL任务上超越人类基准。
AI 深度解读
2026年8月,Thinking Machines 联合伊利诺伊大学厄巴纳-香槟分校(UIUC)与桥水基金 AIA Labs 发布研究,通过将专家经验融入可验证奖励强化学习(RLVR),训练出在 Text-to-SQL 任务上超越人类基准的模型。
- 团队训练的 ReViSQL-K2.6 模型在经专家校验的 BIRD-Platinum 基准测试中达到 88.55% 的准确率,并在 Spider2 等复杂数据库评测中表现出良好泛化能力。
- 研究证实标准 Text-to-SQL 训练集存在严重标注噪声,纯算法调优无法弥补数据缺陷,前期的专业级数据清洗是保障 RLVR 训练收敛的前提。
- 团队将专家判断融入奖励函数设计,解决了单纯依靠执行结果比对容易产生语义不等价“假阳性”的问题,在保持准确率的同时降低了推理开销。
- 影响/看点:该实践表明高质量专业标注与奖励对齐是领域强化学习突破性能瓶颈的关键,其模式推广取决于垂直领域专家规则构建的高昂初始投入。
- 资料依据:Thinking Machines 官方发布(https://x.com/thinkymachines/status/2093121414656377160)、Thinking Machines 官方技术博客(https://thinkingmachines.ai)。
本内容由 AI 生成,仅供参考,请注意甄别