François Chollet 重申 ARC-AGI-3 基准测试的 harness 使用规则
Chollet重申ARC-AGI-3基准规则,禁止针对性定制harness,仅允许对所有API用户开放的通用设置。
AI 深度解读
ARC-AGI 基准测试创始人 François Chollet 再次重申 ARC-AGI-3 测试中「测试工具」(harness)的使用规则,明确划清「专为破解基准而定制的工具」与「对所有 API 用户开放的通用工具」之间的界限,值得关注这对模型能力评测公平性的意义。
- Chollet 强调,任何专门针对 ARC-AGI-3 基准格式或内容知识设计的定制 harness 都不被允许使用,以防止「针对考试作弊」式的刷分行为。
- 而对所有 API 用户平等开放的通用测试设置,则被认定为合规,划定了「优化通用能力」与「优化特定基准」之间的界限。
- 讨论背景提到此前 OpenAI 在模型测试方式上与该基准方存在过反复争议,此次重申被视为双方逐步就规则达成共识的信号。
- 评论指出,不同厂商若使用不同测试设置,可能带来结果之间的不可比性和公平性质疑,但只要清晰披露设置和成本,仍可视为可接受的差异。
- 看点:随着 AI 基准测试逐渐成为模型能力宣传的重要筹码,「怎么测」本身正变得和「测得怎么样」同样重要,权威基准方主动明确规则,是防止评测生态被刷分行为侵蚀的必要动作。
本内容由 AI 生成,仅供参考,请注意甄别