埃森哲与 Anthropic 达成合作,协助开展前沿 AI 模型安全与红队评测
埃森哲与 Anthropic 达成合作,将在先进大模型正式上线前协助开展安全与红队攻防测试。
AI 深度解读
Anthropic 官方公告与彭博社报道显示,埃森哲与 Anthropic 于 2026 年 9 月达成合作,由埃森哲旗下 AI 团队 Faculty 派驻人员进入 Anthropic 开展前沿 AI 模型的安全评测与红队测试,探索第三方嵌入式安全评估模式。
- 评测人员获得接近内部员工的访问权限,可介入模型训练过程与部署决策,针对模型防护机制和安全对齐展开红队测试。
- 该合作为非排他性安排,双方计划在未来五年内各投入至少 10 亿美元,用于建设前沿 AI 安全与评测能力。
- 该举措旨在落实 Anthropic 关于引入外部独立评估以提升模型安全可验证性的公开主张。
- 影响/看点:引入常态化嵌入式评测可能为前沿大模型安全治理提供更深入的外部监督样本,其能否真正建立行业公信力取决于评估团队的独立裁量权与报告透明度能否得到制度化保障。
- 资料依据:
- Anthropic(2026-09-18):https://www.anthropic.com/news/partnering-with-accenture-on-embedded-evaluation
- Bloomberg Technology(2026-09-21):https://www.bloomberg.com/news/videos/2026-09-21/accenture-will-help-anthropic-test-ai-model-safety-video
本内容由 AI 生成,仅供参考,请注意甄别