腾讯混元发布 ExplorationBench 探索能力评测基准
腾讯混元发布ExplorationBench,用于评测AI系统的探索能力。
AI 深度解读
腾讯混元团队发布 ExplorationBench,并同步公开代码、论文与演示环境,关注价值在于把“探索未知规则”的智能体能力转化为可验证评测。
- 论文将任务放入两个规则陌生且可执行的虚拟世界,分别测试程序合成与形式证明。
- 论文于 2026-09-24 首次提交、2026-10-08 修订,评测 10 个 AI 系统。
- 官方仓库称评测包含 55 个发现目标、140 个留出任务,答案由解释器或证明检查器判定,不使用语言模型裁判。
- 结果显示,探索反馈可使 AlienCode 任务准确率从最高 15.7% 提升至 89.0%,但不同轨迹差异较大,后续探索也可能造成回退。
- 影响/看点:该基准可能推动模型评测从知识调用转向实验设计与规则归纳,但其结论主要适用于可执行、可精确验证的封闭环境,不能直接等同于现实科研能力。
- 资料依据:
- 腾讯混元 ExplorationBench GitHub 仓库(2026-09-09):https://github.com/Tencent-Hunyuan/ExplorationBench
- arXiv 论文《ExplorationBench: Measuring AI Systems’ Exploration in Verifiable Alien Worlds》(2026-10-08):https://arxiv.org/abs/2609.30199
本内容由 AI 生成,仅供参考,请注意甄别