Base Labs联手Hugging Face与Goodfire启动开源模型安全合作计划
Base Labs联手Hugging Face与Goodfire启动合作计划,共同研发并公开开源权重模型的安全训练与监控方法。
AI 深度解读
AI 推理服务商 Baseten 旗下研究机构 Base Labs 于 2026 年 9 月 17 日宣布与 Hugging Face 及 Goodfire AI 建立安全合作联盟,共同制定开源权重模型的训练与运行期安全基础设施标准。
- 合作旨在应对开源模型安全防护易被去护栏技术(Abliteration)抹除的行业痛点,目前 Hugging Face 平台上此类去除安全对齐的模型已超过 6000 个。
- Base Labs 主张开放性是 AI 安全的天然优势,主张通过公开方法学将安全检测与监控机制深度嵌入模型训练与部署底层,而非依赖事后外挂式限制。
- 模型可解释性初创公司 Goodfire AI 将提供模型决策拆解与内部机制洞察技术,支持在开源模型服务链路中实现透明的安全审计。
- 合作联盟面向全球开发者社区发出倡议,共同构建具备原生防护能力且普惠可用的开源模型生态体系。
- 影响/看点:这一举措尝试在开放生态中建立标准化的内生安全范式,以平衡模型开源与风险防范;但由于开源权重允许完全本地化修改,此类云端部署规范对离线对抗性去护栏行为的实际约束力仍有待检验。
- 资料依据:
- Base Labs(2026-09-17):https://x.com/baselabs/status/2100286099121705396
- TechCrunch(2026-09-17):https://techcrunch.com/2026/09/17/base-labs-launches-an-open-weight-ai-safety-partnership-with-hugging-face-and-goodfire/
本内容由 AI 生成,仅供参考,请注意甄别