Anthropic 恢复对安全拦截请求计费:重点防范模型蒸馏攻击与滥用

📡 Testing Catalog2026-09-25 01:32

Anthropic 恢复对安全护栏拦截的模型蒸馏与逆向请求计费,旨在防御近期针对前沿模型的协同攻击。

AI 深度解读

Anthropic 调整 API 计费策略并恢复对部分被安全拦截的请求收费,标志着前沿大模型厂商正通过经济门槛应对模型蒸馏与滥用风险。

  • 计费范围严格界定:根据 Testing Catalog 于 2026 年 9 月 24 日披露的官方信息,该收费仅适用于误报率极低的生物学风险、模型蒸馏攻击以及前沿大模型开发等高风险类别,普通拦截请求不计入。
  • 提高滥用攻击成本:Anthropic 官方指出近期遭遇了协同式蒸馏攻击,恢复针对性计费旨在通过增加经济成本,遏制通过多账号批量抓取模型推理数据的行为。
  • 误报率与申诉机制:官方测试数据显示,使用 Claude Code、Claude.ai 或 Cowork 的账户中 99.7% 未触发此类拦截,分类器误报率低于 0.1%,若遇误判用户可通过 Claude Code 的 /feedback 指令提交申诉。
  • 影响/看点:该举措表明模型安全正从单纯的技术拦截扩展至商业成本制约,其实际效果取决于分类器在边缘场景下的判定精确度与对正常开发者的误伤控制。
  • 资料依据:
  • X:Testing Catalog (@testingcatalog)(2026-09-24):https://x.com/testingcatalog/status/2103175753839854073
  • Anthropic 官方公告(2026-09-24):https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手