腾讯混元发布 ExplorationBench 探索能力评测基准

📡 腾讯混元2026-10-09 10:36

腾讯混元发布ExplorationBench,用于评测AI系统的探索能力。

AI 深度解读

腾讯混元团队发布 ExplorationBench,并同步公开代码、论文与演示环境,关注价值在于把“探索未知规则”的智能体能力转化为可验证评测。

  • 论文将任务放入两个规则陌生且可执行的虚拟世界,分别测试程序合成与形式证明。
  • 论文于 2026-09-24 首次提交、2026-10-08 修订,评测 10 个 AI 系统。
  • 官方仓库称评测包含 55 个发现目标、140 个留出任务,答案由解释器或证明检查器判定,不使用语言模型裁判。
  • 结果显示,探索反馈可使 AlienCode 任务准确率从最高 15.7% 提升至 89.0%,但不同轨迹差异较大,后续探索也可能造成回退。
  • 影响/看点:该基准可能推动模型评测从知识调用转向实验设计与规则归纳,但其结论主要适用于可执行、可精确验证的封闭环境,不能直接等同于现实科研能力。
  • 资料依据:
  • 腾讯混元 ExplorationBench GitHub 仓库(2026-09-09):https://github.com/Tencent-Hunyuan/ExplorationBench
  • arXiv 论文《ExplorationBench: Measuring AI Systems’ Exploration in Verifiable Alien Worlds》(2026-10-08):https://arxiv.org/abs/2609.30199

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手