Anthropic联手埃森哲投入20亿美元开展前沿AI安全独立评估
Anthropic与埃森哲计划未来五年各投至少10亿美元,由埃森哲对前沿AI模型开展独立安全与对齐评估。
AI 深度解读
Anthropic 宣布与埃森哲建立合作,双方计划在五年内合计投入 20 亿美元建立前沿人工智能模型的第三方独立评估机制,以应对模型能力提升带来的安全与管控挑战。
- 依据合作计划,两家企业各自承诺出资至少 10 亿美元,由埃森哲旗下 AI 部门主导实施红蓝对抗测试、对齐效果验证及安全防护机制检测。
- 评估采用驻场模式(embedded evaluation),为独立评估人员提供与企业内部员工相近的系统访问权限,以便直接核实安全承诺并排查安全盲区。
- 评估团队将有权上报安全事件并向公众披露相关分析,双方后续还计划联合更多评估机构及 AI 研发厂商推广该评估框架。
- 影响/看点:高额资金支持的深度驻场评估机制若形成行业参照,可能促使前沿大模型安全审计从外部黑盒测试转向常态化白盒审查,其制度效能取决于独立评估方能否在长期合作中保持客观与监督权。
- 资料依据:
- IT之家(2026-09-20):https://www.ithome.com/1/004/894.htm
- Anthropic(2026-09-20):https://www.anthropic.com/news/announcements-accenture-independent-evaluations
本内容由 AI 生成,仅供参考,请注意甄别