AI 爬虫治理不是简单写一行 Disallow。内容站要先决定开放、声明、拦截三档边界,再用 Cloudflare 的 AI Crawl Control 和 robots.txt 做可回滚配置。
- 01先读摘要,判断是否与你的场景相关。
- 02再看来源,保留继续查证的路径。
- 03最后看步骤、风险和可复用动作。
摘要:内容站被 AI 爬虫访问时,最危险的不是“有没有被抓”,而是站长没有边界:哪些页面欢迎索引,哪些页面只允许普通搜索,哪些预览页和重复页应该拦截。Cloudflare 的 AI Crawl Control 和 managed robots.txt 可以帮你把边界从口头规则变成可检查配置。
适用场景
这篇适合已经把域名接入 Cloudflare 的个人站、资料站、文档站、课程页、资源站和小型媒体站。你希望让有价值页面被发现,同时避免预览页、重复页、会员页、测试页被 AI 爬虫大量访问。
不适用场景
如果你的网站没有经过 Cloudflare 代理,Cloudflare 的仪表盘功能无法直接生效。若内容本身涉及付费授权、用户隐私或商业合同,单靠 robots.txt 不够,必须增加访问控制、WAF、登录权限或合同条款。若你想阻止所有网络访问,robots.txt 也不是安全边界。
准备材料
- Cloudflare 账号和已接入的 zone。
- 当前站点的 robots.txt 内容和 sitemap 地址。
- 需要开放的页面类型:文章、分类、文档、首页。
- 需要保护的页面类型:预览、草稿、内部测试、重复参数页。
- 最近 7 到 30 天服务器日志或 Cloudflare AI Crawl Control 指标。
先分清三档策略
第一档是开放:让搜索引擎和可带来读者的 AI 搜索访问公开内容。第二档是声明:通过 robots.txt 和 Content Signals 表达训练、实时输入、搜索索引的偏好。第三档是拦截:对不遵守规则或访问敏感路径的爬虫使用 Cloudflare 的爬虫管理、AI Crawl Control 或 WAF 规则。不要把三档混成一个“全部封锁”,否则你可能损失正常搜索发现。
步骤一:盘点路径
先列出路径,而不是先动开关。公开文章可写成 /posts/* 或具体分类;站点地图保留 /sitemap.xml;robots.txt 必须开放访问;预览页、参数页、搜索结果页、临时文件夹和旧版镜像页要单独列出。每一类路径旁边写清楚理由:允许发现、只允许普通搜索、要求声明不用于训练,或完全阻断。
步骤二:检查 AI Crawl Control
进入 Cloudflare dashboard 后,查看 AI Crawl Control 的 Overview、Crawlers 或 Metrics。Cloudflare 文档说明,这个功能用于观察 AI 服务访问内容、按爬虫管理访问策略、监测 robots.txt 合规情况,并且所有计划都可用。你要看的不是单日峰值,而是哪些路径被频繁请求,是否集中在预览、旧链接或重复页。
步骤三:启用 managed robots.txt 前先备份
Cloudflare managed robots.txt 会在站点没有 robots.txt 时创建文件;如果源站已有 200 响应的 robots.txt,则会把 Cloudflare 管理内容合并到原文件前面。启用前先保存当前版本,记录 sitemap 行、已有 Disallow 和特殊 user-agent 规则。启用后访问 https://你的域名/robots.txt,确认原有 sitemap 没丢,公开内容没有被误拦。
步骤四:用观察结果决定是否拦截
robots.txt 是声明,不是强制门禁。Cloudflare 文档也明确提醒,爬虫遵守 robots.txt 是自愿的。如果 AI Crawl Control 显示某些爬虫反复访问 Disallow 路径,就把它们放入“待处理”清单:先确认 user-agent 和路径,再决定是保留观察、单独阻断爬虫,还是对某个路径做 WAF 规则。不要因为一两次正常请求就全站封锁。
步骤五:做回滚记录
每次修改都写一条记录:日期、改动人、改动项、影响路径、预期结果、回滚方式。回滚方式必须能被非开发者读懂,例如“关闭 Instruct AI bot traffic with robots.txt”“恢复备份 robots.txt”“删除某条 WAF custom rule”。没有回滚记录,就不要在生产站上连续改多项。
实际例子:内容站的三档边界
一个中文资料站可以这样划分:/article/* 和 /guide/* 允许普通搜索和读者访问;/preview/*、/?p=*preview、/tmp/* 不希望任何爬虫访问;/member/* 通过登录限制而不是 robots.txt 保护;旧参数页保留 canonical,并观察是否被 AI 训练爬虫大量请求。若出现违反 robots.txt 的爬虫访问 /preview/*,才进入 WAF 拦截。
检查清单
- robots.txt 返回 200,内容没有语法混乱。
- sitemap 行仍然存在,并指向正确 HTTPS 地址。
- 公开文章没有被误写入 Disallow。
- 预览、草稿、临时目录有明确策略。
- AI Crawl Control 至少查看路径、爬虫、状态码三个维度。
- WAF 规则只覆盖明确路径或明确爬虫,不做大范围误伤。
- 启用或关闭开关前后都保存截图或文本记录。
常见坑
一个坑是把 robots.txt 当安全系统。它只能表达偏好,不能保护私密数据。另一个坑是忽略 canonical,导致 AI 训练爬虫和搜索爬虫都访问过期页面。还有一个坑是把所有 AI bot 都视为同一类:AI Search、AI Assistant、AI Crawler 的目的不同,应该按路径和风险处理。
排错路径
如果启用后搜索流量异常,先检查 robots.txt 是否误封 Googlebot 或公开分类。若 AI Crawl Control 没有数据,确认域名是否经过 Cloudflare 代理,且请求确实进入 Cloudflare 网络。若 WAF 拦截后正常页面打不开,查看规则表达式是否覆盖了浏览器或搜索引擎 user-agent。
可复制策略表
表头:路径|内容类型|允许普通搜索|允许 AI 输入|允许训练|robots.txt 规则|Cloudflare 动作|回滚方式|负责人|复查日期。把“允许训练”与“允许搜索”分开写,能避免把内容曝光、流量获取和模型训练混在一起。
更新日期与维护建议
更新日期:2026-06-21。每月检查 Cloudflare AI Crawl Control changelog,特别关注 Directives、Agent Readiness、Redirects for AI Training、Pay Per Crawl 等变化。每次改规则后至少观察一周,再扩大范围。