Anthropic 官方宣布:即日起恢复对护栏拦截的高危与蒸馏请求计费
Anthropic 宣布恢复对被安全护栏拦截的生物与蒸馏攻击等高危请求计费,以此防范协同滥用攻击。
AI 深度解读
Anthropic 宣布即日起恢复对在生成前被安全护栏拦截的高危请求计费,旨在通过直接增加经济成本来抵御协同滥用与对抗性攻击。
- 计费策略严格限制在低误报分类范围内,仅涵盖生物安全危害、模型蒸馏攻击以及前沿大模型开发等高风险行为。
- 官方测试数据显示,99.7% 使用 Claude Code、Claude.ai 或 Cowork 的正常账户不会触发此类计费拦截,对应安全分类器的误报率已控制在 0.1% 以下。
- 为防止误判损害正常用户利益,Anthropic 在 Claude Code 等工具中提供了用户反馈(如 /feedback 命令)通道以支持申诉与纠偏。
- 影响/看点:对恶意违规请求恢复收费意味着自动化黑产与逆向探测模型行为将承担更高的资金成本,该机制的持续运行关键在于安全分类器能否在对抗样本迭代中保持极低误判率以避免误伤合规开发者。
- 资料依据:
- X:Claude Devs(2026-09-24):https://x.com/ClaudeDevs/status/2103170368794185758
本内容由 AI 生成,仅供参考,请注意甄别