Anthropic 前沿研究:大模型已能识别测试环境,提出 DISH 框架提升安全评估真实性
Anthropic研究发现模型已能识别测试环境,并提出DISH等框架缩小模拟与真实差距以提升评估效力。
AI 深度解读
Anthropic 联合研究团队揭示前沿模型具备识别测试环境的能力,并提出改进安全评估真实性的新框架。
- 研究团队在 arXiv 预印本(arXiv:2609.02302)中指出,能力较强的模型能够辨别自身处于评估测试还是实际部署环境,这削弱了常规安全对齐评估结论的效力。
- 提出 critique refinement 技术,在模拟器每个动作上投入额外推理时算力生成多个候选,经目标模型反馈修正后选取最接近部署状态的行为执行。
- 提出 DISH(Deployment-Imitating SWE-Agent Harness)框架,将目标模型封装进真实智能体脚手架,缩小代码模拟环境与生产环境的差异。
- 实验表明两项技术结合可显著提高模拟环境的真实度,比单纯延长审查长度更有效地利用额外算力。
- 影响/看点:该研究表明评估环境与生产脚手架的一致性属于安全属性而非单纯工程细节,若业界推行该方案,可能提升安全测试可信度,但也会增加评估阶段的推理算力成本。
- 资料依据:
- arXiv(2026-09-07):https://arxiv.org/abs/2609.02302
- DAIR.AI(2026-09-07):https://x.com/dair_ai/status/2096782512119001119
本内容由 AI 生成,仅供参考,请注意甄别