沃顿教授 Ethan Mollick:建议引入历史谜题与古籍密码测试 AI 能力
沃顿商学院教授 Ethan Mollick 建议建立历史谜题与古籍密码题库,以拓展大模型的能力评测维度。
AI 深度解读
沃顿商学院教授 Ethan Mollick 发文建议,除主流的形式化数学基准外,AI 评测体系应引入历史谜题与古籍密码,以测试模型在复杂人文情境下的推理能力。
- 指出当前历史研究领域已开始运用前沿模型转录和释读未经翻译的历史手稿与古代文献,展现了语言模型在人文学科的应用潜力。
- 认为历史谜题与古密码破译包含大量模糊线索、非结构化背景与跨文化知识,能够有效考察模型的模式识别与长文本逻辑推断能力。
- 呼吁行业拓展评估维度,建立专门的历史挑战题库,以补充当前过度集中于数理与编程任务的单一评测框架。
- 影响/看点:若历史谜题题库得以标准化构建,可能为衡量模型在低资源语料、模糊线索推断及长程上下文理解方面的综合能力提供新的评测参照。
- 资料依据:
- X平台Ethan Mollick发帖(2026-09-14):https://x.com/emollick/status/2099333274648838155
本内容由 AI 生成,仅供参考,请注意甄别