DEV Community 中文 关注 Cloudflare 的 AI 拦截了八个爬虫,其中没有 ChatGPT 的搜索机器人。 最近,r/SEO 社区的一篇帖子指出 Cloudflare 意外封锁了某些 AI 爬虫,导致网站所有者产生困惑。该封锁主要通过 Cloudflare 的“托管 robots.txt"功能进行管理,旨在防止 AI 爬虫访问内容。然而,robots.txt 文件中的具体指令常被误读,从而引发对受影响 AI 服务的错误假设。Cloudflare 的托管 robots.txt 文件明确列出了八个用户代理,并附注指出决定 ChatGPT 引用来源的并非其中之一。尽管该文件提及封锁 GPTBot 以阻止其获取训练数据,但并未禁止 AI 搜索爬虫访问内容。Google-Extended 代理常被误认为控制 AI 概览(AI Overviews),但 Google 明确表示其不影响搜索收录或排名。内容信号行 search=yes, ai-train=no, use=reference 是 Cloudflare 的约定,并不授予生成 AI 摘要的权限。Google 的 AI 概览由标准的片段控制指令(如 nosnippet 或 noindex)控制,而非特定的 AI 爬虫指令。务必通过 curl 或浏览器在网络中检查 robots.txt 文件,因为边缘组装后的文件与磁盘上的文件存在差异。Cloudflare 的托管 robots.txt 由“阻止 AI 机器人”开关激活。该开关于 2025 年 7 月 1 日推出,新域名在入驻期间现会被询问是否允许 AI 爬虫访问。2026 年 9 月 15 日的一次更新将引入新默认设置,封锁带有广告页面的训练类爬虫,影响启用传统“阻止 AI 机器人”选项的多用途爬虫(如 Googlebot)。Bot Fight Mode 是一项独立功能,通过发出挑战而非修改 robots.txt 文件来工作,且独立于 AI 封锁设置运行。Perplexity 已被 Cloudflare 从已验证机器人列表中移除,并通过启发式方法而非 robots.txt 指令进行封锁。用户应留意对 Cloudflare AI 机器人封锁功能的潜在误读,并直接验证其设置。 Cloudflare's AI block names eight crawlers. None is ChatGPT's search bot dev.to DEV Community 中文 RSS thenote.app
search=yes, ai-train=no, use=reference是 Cloudflare 的约定,并不授予生成 AI 摘要的权限。Google 的 AI 概览由标准的片段控制指令(如 nosnippet 或 noindex)控制,而非特定的 AI 爬虫指令。务必通过 curl 或浏览器在网络中检查 robots.txt 文件,因为边缘组装后的文件与磁盘上的文件存在差异。Cloudflare 的托管 robots.txt 由“阻止 AI 机器人”开关激活。该开关于 2025 年 7 月 1 日推出,新域名在入驻期间现会被询问是否允许 AI 爬虫访问。2026 年 9 月 15 日的一次更新将引入新默认设置,封锁带有广告页面的训练类爬虫,影响启用传统“阻止 AI 机器人”选项的多用途爬虫(如 Googlebot)。Bot Fight Mode 是一项独立功能,通过发出挑战而非修改 robots.txt 文件来工作,且独立于 AI 封锁设置运行。Perplexity 已被 Cloudflare 从已验证机器人列表中移除,并通过启发式方法而非 robots.txt 指令进行封锁。用户应留意对 Cloudflare AI 机器人封锁功能的潜在误读,并直接验证其设置。