Cloudflare 的 AI 拦截了八个爬虫,其中没有 C... 笔记

Cloudflare 的 AI 拦截了八个爬虫,其中没有 ChatGPT 的搜索机器人。

最近,r/SEO 社区的一篇帖子指出 Cloudflare 意外封锁了某些 AI 爬虫,导致网站所有者产生困惑。该封锁主要通过 Cloudflare 的“托管 robots.txt"功能进行管理,旨在防止 AI 爬虫访问内容。然而,robots.txt 文件中的具体指令常被误读,从而引发对受影响 AI 服务的错误假设。Cloudflare 的托管 robots.txt 文件明确列出了八个用户代理,并附注指出决定 ChatGPT 引用来源的并非其中之一。尽管该文件提及封锁 GPTBot 以阻止其获取训练数据,但并未禁止 AI 搜索爬虫访问内容。Google-Extended 代理常被误认为控制 AI 概览(AI Overviews),但 Google 明确表示其不影响搜索收录或排名。内容信号行 search=yes, ai-train=no, use=reference 是 Cloudflare 的约定,并不授予生成 AI 摘要的权限。Google 的 AI 概览由标准的片段控制指令(如 nosnippet 或 noindex)控制,而非特定的 AI 爬虫指令。务必通过 curl 或浏览器在网络中检查 robots.txt 文件,因为边缘组装后的文件与磁盘上的文件存在差异。Cloudflare 的托管 robots.txt 由“阻止 AI 机器人”开关激活。该开关于 2025 年 7 月 1 日推出,新域名在入驻期间现会被询问是否允许 AI 爬虫访问。2026 年 9 月 15 日的一次更新将引入新默认设置,封锁带有广告页面的训练类爬虫,影响启用传统“阻止 AI 机器人”选项的多用途爬虫(如 Googlebot)。Bot Fight Mode 是一项独立功能,通过发出挑战而非修改 robots.txt 文件来工作,且独立于 AI 封锁设置运行。Perplexity 已被 Cloudflare 从已验证机器人列表中移除,并通过启发式方法而非 robots.txt 指令进行封锁。用户应留意对 Cloudflare AI 机器人封锁功能的潜在误读,并直接验证其设置。