Cloudflare AI Crawl Control 教程:内容站怎样设置 AI 爬虫边界

AI 爬虫治理不是简单写一行 Disallow。内容站要先决定开放、声明、拦截三档边界,再用 Cloudflare 的 AI Crawl Control 和 robots.txt 做可回滚配置。

Cloudflare AI Crawl Control 教程:内容站怎样设置 AI 爬虫边界

AI 爬虫治理不是简单写一行 Disallow。内容站要先决定开放、声明、拦截三档边界,再用 Cloudflare 的 AI Crawl Control 和 robots.txt 做可回滚配置。

  1. 01先读摘要,判断是否与你的场景相关。
  2. 02再看来源,保留继续查证的路径。
  3. 03最后看步骤、风险和可复用动作。

摘要:内容站被 AI 爬虫访问时,最危险的不是“有没有被抓”,而是站长没有边界:哪些页面欢迎索引,哪些页面只允许普通搜索,哪些预览页和重复页应该拦截。Cloudflare 的 AI Crawl Control 和 managed robots.txt 可以帮你把边界从口头规则变成可检查配置。

适用场景

这篇适合已经把域名接入 Cloudflare 的个人站、资料站、文档站、课程页、资源站和小型媒体站。你希望让有价值页面被发现,同时避免预览页、重复页、会员页、测试页被 AI 爬虫大量访问。

不适用场景

如果你的网站没有经过 Cloudflare 代理,Cloudflare 的仪表盘功能无法直接生效。若内容本身涉及付费授权、用户隐私或商业合同,单靠 robots.txt 不够,必须增加访问控制、WAF、登录权限或合同条款。若你想阻止所有网络访问,robots.txt 也不是安全边界。

准备材料

  • Cloudflare 账号和已接入的 zone。
  • 当前站点的 robots.txt 内容和 sitemap 地址。
  • 需要开放的页面类型:文章、分类、文档、首页。
  • 需要保护的页面类型:预览、草稿、内部测试、重复参数页。
  • 最近 7 到 30 天服务器日志或 Cloudflare AI Crawl Control 指标。

先分清三档策略

第一档是开放:让搜索引擎和可带来读者的 AI 搜索访问公开内容。第二档是声明:通过 robots.txt 和 Content Signals 表达训练、实时输入、搜索索引的偏好。第三档是拦截:对不遵守规则或访问敏感路径的爬虫使用 Cloudflare 的爬虫管理、AI Crawl Control 或 WAF 规则。不要把三档混成一个“全部封锁”,否则你可能损失正常搜索发现。

步骤一:盘点路径

先列出路径,而不是先动开关。公开文章可写成 /posts/* 或具体分类;站点地图保留 /sitemap.xml;robots.txt 必须开放访问;预览页、参数页、搜索结果页、临时文件夹和旧版镜像页要单独列出。每一类路径旁边写清楚理由:允许发现、只允许普通搜索、要求声明不用于训练,或完全阻断。

步骤二:检查 AI Crawl Control

进入 Cloudflare dashboard 后,查看 AI Crawl Control 的 Overview、Crawlers 或 Metrics。Cloudflare 文档说明,这个功能用于观察 AI 服务访问内容、按爬虫管理访问策略、监测 robots.txt 合规情况,并且所有计划都可用。你要看的不是单日峰值,而是哪些路径被频繁请求,是否集中在预览、旧链接或重复页。

步骤三:启用 managed robots.txt 前先备份

Cloudflare managed robots.txt 会在站点没有 robots.txt 时创建文件;如果源站已有 200 响应的 robots.txt,则会把 Cloudflare 管理内容合并到原文件前面。启用前先保存当前版本,记录 sitemap 行、已有 Disallow 和特殊 user-agent 规则。启用后访问 https://你的域名/robots.txt,确认原有 sitemap 没丢,公开内容没有被误拦。

步骤四:用观察结果决定是否拦截

robots.txt 是声明,不是强制门禁。Cloudflare 文档也明确提醒,爬虫遵守 robots.txt 是自愿的。如果 AI Crawl Control 显示某些爬虫反复访问 Disallow 路径,就把它们放入“待处理”清单:先确认 user-agent 和路径,再决定是保留观察、单独阻断爬虫,还是对某个路径做 WAF 规则。不要因为一两次正常请求就全站封锁。

步骤五:做回滚记录

每次修改都写一条记录:日期、改动人、改动项、影响路径、预期结果、回滚方式。回滚方式必须能被非开发者读懂,例如“关闭 Instruct AI bot traffic with robots.txt”“恢复备份 robots.txt”“删除某条 WAF custom rule”。没有回滚记录,就不要在生产站上连续改多项。

实际例子:内容站的三档边界

一个中文资料站可以这样划分:/article/* 和 /guide/* 允许普通搜索和读者访问;/preview/*、/?p=*preview、/tmp/* 不希望任何爬虫访问;/member/* 通过登录限制而不是 robots.txt 保护;旧参数页保留 canonical,并观察是否被 AI 训练爬虫大量请求。若出现违反 robots.txt 的爬虫访问 /preview/*,才进入 WAF 拦截。

检查清单

  • robots.txt 返回 200,内容没有语法混乱。
  • sitemap 行仍然存在,并指向正确 HTTPS 地址。
  • 公开文章没有被误写入 Disallow。
  • 预览、草稿、临时目录有明确策略。
  • AI Crawl Control 至少查看路径、爬虫、状态码三个维度。
  • WAF 规则只覆盖明确路径或明确爬虫,不做大范围误伤。
  • 启用或关闭开关前后都保存截图或文本记录。

常见坑

一个坑是把 robots.txt 当安全系统。它只能表达偏好,不能保护私密数据。另一个坑是忽略 canonical,导致 AI 训练爬虫和搜索爬虫都访问过期页面。还有一个坑是把所有 AI bot 都视为同一类:AI Search、AI Assistant、AI Crawler 的目的不同,应该按路径和风险处理。

排错路径

如果启用后搜索流量异常,先检查 robots.txt 是否误封 Googlebot 或公开分类。若 AI Crawl Control 没有数据,确认域名是否经过 Cloudflare 代理,且请求确实进入 Cloudflare 网络。若 WAF 拦截后正常页面打不开,查看规则表达式是否覆盖了浏览器或搜索引擎 user-agent。

可复制策略表

表头:路径|内容类型|允许普通搜索|允许 AI 输入|允许训练|robots.txt 规则|Cloudflare 动作|回滚方式|负责人|复查日期。把“允许训练”与“允许搜索”分开写,能避免把内容曝光、流量获取和模型训练混在一起。

更新日期与维护建议

更新日期:2026-06-21。每月检查 Cloudflare AI Crawl Control changelog,特别关注 Directives、Agent Readiness、Redirects for AI Training、Pay Per Crawl 等变化。每次改规则后至少观察一周,再扩大范围。

Sources

  1. Cloudflare AI Crawl Control overview
  2. Cloudflare managed robots.txt setting
  3. Cloudflare AI Crawl Control changelog

订阅更新

输入邮箱,订阅站点更新。

参与讨论

你的邮箱不会公开。 标有 * 的为必填项。