美团 LongCat 评测前沿模型自主科研能力:仅极少数方案具备真实创新性
美团评测发现前沿模型在自主研发中多表现为工程优化,仅极少数方案具备真实创新性。
AI 深度解读
美团 LongCat 团队发布针对 7 个前沿大模型在 36 项 AI 研发任务中的自主科研能力评测,揭示出当前前沿模型在工程优化上表现突出但在实质性创新方面依然极其匮乏的现状。
- 创新方案比例极低:在评测涵盖的 756 条实验轨迹与 252 个生成方案中,仅有 3 个方案具备真正的学术新颖性,绝大多数模型方案停留在对已知算法和既有代码框架的微调优化。
- 可靠性胜过峰值性能:评测表明,单次实验的峰值得分难以全面反映模型的科研实用水平,执行过程的稳定性与可复现性(可靠性)才是区分顶尖科研智能体的核心指标。
- 经验累积效应与测试框架迁移:模型在多轮交互中的经验积累有时会产生误导性反馈;相比之下,自动化测试框架(harness)层面的通用优化策略能更稳定地迁移至其他任务与模型。
- 影响/看点:评测结果意味着现阶段前沿大模型更适合定位为高效的「工程优化辅助器」而非能够独立探索新理论的「自主科学家」,其科研价值的发挥取决于人类专家对问题边界与评估指标的精确设定。
- 资料依据:
- X:美团 LongCat (@Meituan_LongCat) https://x.com/Meituan_LongCat/status/2093337808278794258
本内容由 AI 生成,仅供参考,请注意甄别