Cloudflare 推出防 AI 训练抓取功能:允许搜索引擎收录同时禁止模型训练
Cloudflare 推出新设置,允许网站在保持搜索引擎正常收录的同时,禁止爬虫抓取内容用于 AI 模型训练。
AI 深度解读
Cloudflare 宣布推出针对混合用途爬虫的防 AI 训练设置,允许网站内容在保持搜索引擎收录的同时禁止被用于模型训练,为内容发布者在流量获取与数据保护之间提供了精细化控制手段。
- 许多互联网服务商使用同一爬虫同时处理搜索引擎索引与 AI 模型训练,以往网站站长若拦截爬虫,往往面临失去搜索曝光或被迫让渡训练数据的两难。
- Cloudflare 此次推出的设置已获得苹果、谷歌和微软的遵循承诺,上述厂商将在规定时间窗口内遵守该配置。
- 平台网络统计显示,其保护的站点中仅有不足 1% 拦截搜索引擎,但有 17% 启用了防 AI 训练机制,表明站长对两类访问具有截然不同的诉求。
- 该方案通过网络层识别爬虫身份与行为特征并对违规抓取进行阻断,并在 Radar 平台进行数据公开,后续计划于明年初进一步推出针对 AI 摘要的内容比例控制。
- 影响/看点:若主流搜索引擎厂商能持续遵守协议,该机制可能在保护创作者版权利益与维系网站搜索曝光之间建立新平衡,但实际效果取决于未签约中小型爬虫的合规意愿及平台的网络层识别阻断能力。
- 资料依据:
- Cloudflare Blog(2026-09-15):https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/
本内容由 AI 生成,仅供参考,请注意甄别