同事因安全隐患辞职后,Anthropic 安全主管称 AI 灭绝人类概率超 10%
在同事因安全隐患辞职后,Anthropic 资深安全主管公开警告称本十年末 AI 灭绝人类的概率超过 10%。
AI 深度解读
Anthropic 研究员 Jacob Coxon 宣布因安全顾虑离职,随后对齐科学主管 Evan Hubinger 公开评估十年内 AI 灭绝人类风险超 10%,引发业内对前沿模型竞速与安全对齐脱节的警觉。
- The Verge 于 2026 年 9 月 9 日报道,Anthropic 研究员 Jacob Coxon 在社交媒体公开辞职信,指责公司与 OpenAI 存在忽视安全防护、盲目推进自我改进型超级智能的倾向。
- Anthropic 对齐科学主管 Evan Hubinger 随后在公开讨论中支持了该观点,确认其个人评估未来十年内超级 AI 带来人类生存危机的概率超过 10%,并表示团队目前尚未建立完备的超级智能对齐方案。
- 事件表明,前沿大模型企业在商业竞速与安全治理之间的内部张力正在加剧,研发人员对不可控系统扩散的担忧从理论探讨转变为公开人事变动。
- 影响/看点:内部核心安全人员的公开预警可能推动监管机构加快对前沿超级模型对齐计划与发布门槛的审查,其关键取决于相关机构能否将内部风险披露转化为具备法律约束力的安全测试标准。
- 资料依据:
- The Verge(2026-09-09):https://www.theverge.com/ai-artificial-intelligence/991927/anthropic-ai-kill-all-humans
- Forbes(2026-09-09):https://www.forbes.com/sites/digital-assets/2026/09/09/anthropic-safety-lead-warns-of-existential-risk-after-researcher-resignation/
本内容由 AI 生成,仅供参考,请注意甄别