ANSWER BOX · 一句话答案
AI 爬虫必须按用途分开对待:放行搜索类爬虫,你才会被 AI 引用;拦不拦训练类爬虫,只影响未来的模型训练。
截至 2026 年 9 月,Cloudflare 已把 AI 爬虫按 Search、Agent、Training 三类行为重写默认策略,2026 年 9 月 15 日之后接入的新域名默认拦训练与 Agent、放搜索。你站点根目录那个几百字节的 robots.txt,重新变成了决定 AI 可见性的第一道开关。
一个下架了半年的产品页,Google 还在给它导流,用户点进来撞上 404,这是做站的人最熟悉的尴尬。
AI 时代多了一种更安静的尴尬:页面好好的,内容也扎实,只是 ChatGPT 和 Perplexity 从来不知道它存在。
原因往往不在内容,而在一行指令。Disallow: / 这十个字符,可以让全球所有 AI 引擎集体止步于门外,而站长本人毫无察觉。
一、AI 爬虫早已不是一类东西
三年前,爬虫管理只有一个动作:拦住坏蛋,放行 Google。这套逻辑在 2026 年已经失效。
主流 AI 厂商把自己的爬虫拆成了两到三支队伍,各管一件事,各有一个独立的 robots.txt 令牌。
训练类:爬走的是语料,带回来的是零
GPTBot 属于 OpenAI 的训练爬虫,ClaudeBot 与 anthropic-ai 属于 Anthropic 的训练爬虫。
它们把你的页面收进训练数据集。模型权重里不会保留你的 URL,也不会留下你的品牌名,所以这条路从来不带流量回来。
Google-Extended 与 Applebot-Extended 是用途控制项,不是独立爬虫。它们控制的是别家爬虫抓到的内容能不能用于训练,服务器日志里根本不会出现这两个名号。
搜索类:爬走的是索引,带回来的是引用
OAI-SearchBot 决定你能不能出现在 ChatGPT 的搜索答案里,Claude-SearchBot 决定 Claude 检索时会不会引用你,PerplexityBot 决定 Perplexity 的答案卡片里有没有你的链接。
OpenAI 官方文档写得非常直白:站点一旦屏蔽 OAI-SearchBot,就不会出现在 ChatGPT 的搜索答案中,最多还能作为导航链接被提及。
这一层被拦住,前面所有的 GEO 内容投入都归零。
用户代理类:用户点名要看你这一页
ChatGPT-User、Claude-User、Perplexity-User 属于实时取页。
采购经理把你的产品页链接丢进对话框,让 AI 读一遍再给结论,触发的是这一类爬虫。
它们被拦住,AI 只能凭记忆和第三方描述来猜你的产品参数,猜错的概率不低。
| 爬虫令牌 | 归属 | 行为分类 | 拦住它,你会失去什么 |
|---|---|---|---|
| OAI-SearchBot | OpenAI | 搜索 | 从 ChatGPT 搜索答案中消失 |
| GPTBot | OpenAI | 训练 | 内容不进训练集,不影响当下引用 |
| ChatGPT-User | OpenAI | 用户取页 | AI 无法实时读取指定页面 |
| Claude-SearchBot | Anthropic | 搜索 | Claude 检索时收录与可见性下降 |
| ClaudeBot | Anthropic | 训练 | 内容不进 Claude 训练集 |
| Claude-User | Anthropic | 用户取页 | 用户点名访问时取不到内容 |
| PerplexityBot | Perplexity | 搜索 | 答案卡片里不再出现你的链接 |
| Googlebot | 搜索 | Google 搜索与 AI Overviews 同时受损 | |
| Google-Extended | 用途控制 | Gemini 训练与 grounding,不影响搜索排名 | |
| CCBot | Common Crawl | 训练语料 | 公共数据集里减少你的页面,波及多家模型 |
二、每爬几万页,才回馈一次访问
Cloudflare Radar 从 2025 年起持续追踪一个指标:爬取与回访比(crawl-to-refer ratio)。
它统计的是,平台每给网站送回一位真实访客,同时在背后抓走了多少页面。比例越高,说明这家平台越是只取不予。
Cloudflare 记录到的真实落差
2025 年 1 月,Anthropic 的比值是 286,930 比 1,到 7 月降到 38,066 比 1,改善超过八成,依然是主要玩家中最重的。
OpenAI 同期稳定在千级,Perplexity 从 54 比 1 涨到 195 比 1,Google 则长期保持在个位数。
| 平台 | 2025年1月 | 2025年7月 | 区间变化 |
|---|---|---|---|
| Anthropic | 286,930 : 1 | 38,066 : 1 | 下降 86.7% |
| OpenAI | 1,217 : 1 | 1,091 : 1 | 下降 10.4% |
| Perplexity | 54.6 : 1 | 194.8 : 1 | 上升 256.7% |
| Microsoft | 38.5 : 1 | 40.7 : 1 | 上升 5.7% |
| 3.8 : 1 | 5.4 : 1 | 上升 43% |
数据来源:Cloudflare Radar 爬取与回访比,2025 年 1 月至 7 月。
这个比例对 B2B 独立站意味着什么
表面看,Anthropic 每爬三万八千页才送回一位访客,这笔账怎么算都亏。但工业品的生意从来不按 PV 计算。
如果 Claude 在回答「中国有哪些可靠的谐波减速器供应商」时引用了你的页面,那一位读者的价值高于三万次泛流量。他带着预算和明确需求而来。
真正的问题不是爬得多,而是只爬不引用。放行搜索类爬虫,是让这笔账从亏变平的前提。
拦爬虫的成本,落在谁头上
中小站最常见的动作是一键全拦,因为它看起来最省事。
省下的是带宽和日志噪音,付出的代价是在 AI 世界里彻底不存在。这笔账没人会替你算。
三、robots.txt 的分离式写法
任务目标很清楚:训练归训练,搜索归搜索,两笔账分开记。
三类行为,三组指令
下面这份配置把搜索类与用户取页类显式放行,训练类留给品牌自己决定。文件名照旧是 robots.txt,放在站点根目录。
# ===== AI 搜索与用户取页:放行 ===== User-agent: OAI-SearchBot Allow: / User-agent: Claude-SearchBot User-agent: Claude-User Allow: / User-agent: PerplexityBot Allow: / User-agent: ChatGPT-User Allow: / # ===== AI 训练:按品牌策略决定 ===== User-agent: GPTBot Allow: / User-agent: Google-Extended Allow: / # ===== 通用规则:别在顶部写 Disallow: / ===== User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php
三种最常见的错误写法
第一种,文件顶部一条 User-agent: * 加 Disallow: /,所有 AI 爬虫一起被关在门外,而站长以为自己只是屏蔽了垃圾爬虫。
第二种,只维护通用规则,从不给 AI 爬虫写独立分组。路径一旦收窄,AI 爬虫跟着一起被收窄。
第三种,把 robots.txt 当安全边界。它是 RFC 9309 定义的一份协议声明,是请求而不是强制拦截,愿意遵守的遵守,不愿意的照样进来。
文件之外还有一层
这一点最容易被忽略:robots.txt 放行了,请求却可能根本到不了源站。
CDN 与 WAF 面板里的爬虫策略、浏览器质询、地区限制,都会在文件之前把 AI 爬虫挡回去。文件层和网络层必须同时检查。
四、Cloudflare 的默认立场已经变了
2026 年夏天,Cloudflare 把爬虫管理从「是不是 AI」改成了「它来干什么」。
9 月 15 日之后的新默认
按 Cloudflare 官方文档的说明,2026 年 9 月 15 日起,新接入的域名会启用新默认:训练类与 Agent 类爬虫在展示广告的页面上被拦截,搜索类保持放行。
同时生效的还有一条更隐蔽的规则:混合用途爬虫,也就是同时承担搜索与训练的那一批,会被所有「拦截 AI 训练」的配置一并拦住,包括已经用了一年多的一键 Block AI bots 开关。
对于不靠广告变现的 B2B 站点,真正需要确认的不是要不要拦,而是拦完之后,OAI-SearchBot 与 PerplexityBot 是否还在通行名单上。
一键全拦会误伤什么
一键开关省下的是判断成本,代价是把搜索类爬虫一起送走。
Cloudflare 已经把这套策略做成面板里的三项预设:Search、Agent、Training,还支持把策略同步写回 robots.txt。工具在替你写配置文件,你至少要清楚文件里写了什么。
老域名也要复查
新默认针对新接入域名,老域名沿用旧设置,不代表旧设置是对的。
建议的节奏是每季度复查一次:面板状态、robots.txt 文本、最近七天日志,三处对齐。
五、AI Overviews 的放大器效应:先能爬,才可能被引用
AI 引擎的工作顺序是固定的:先抓取,再索引,然后在回答问题时从索引里挑候选。
引用份额会自我强化
被抓住的页面进入候选池,被引用的页面拿到下一次更大权重的考量。
这是一条正反馈曲线:越被引用,越容易被引用。反过来,从未被抓取的页面永远不进这张牌桌。
被拦住的时候,AI 不会通知你
这是最难受的地方。站点被拦,AI 不会告诉你它没读到,也不会显示任何错误。
它只是安静地把名额给了别人,而你在后台看到的数据一切正常。
六、信源平权:放行这件事,不看预算
GEO 领域有一个对中小工厂友好的事实:通行证的发放不看广告预算。
免费的通行工具
robots.txt、Sitemap、llms.txt 是公开标准,OpenAI 与 Anthropic 也都公开了各自爬虫的 IP 段,用来核验请求真假。
一个二十人的工厂和一个万人集团,拿到的工具清单完全一样。
大站在收,中小站可以放
Cloudflare 曾公开表示,其多数发布商客户已转向默认拦截 AI 爬虫,因为他们做的是内容授权生意,被白拿就是损失。
制造业的逻辑不同。你的产品页不需要授权收费,你需要被采购经理找到。于是同一条策略,在大站是资产保护,在中小 B2B 站是主动关门。
七、三个可验证的校验杠杆
放行不是喊口号,三件事都能在半小时内验证完。
杠杆一:robots.txt 分组合规性
访问「域名斜杠 robots.txt」,确认训练、搜索、用户取页三类各有独立分组,没有全局 Disallow: /。
再把文件丢进 Google Search Console 的 robots.txt 测试工具,验证 Googlebot 侧的读取结果。eastdigi.com 自身当前拆成十二组规则,训练类与搜索类全部放行,可以直接作为写法的参照样本。
杠杆二:日志核验爬虫的真实身份
用户代理字符串可以伪造,来源 IP 段不能。核验分两步,先在访问日志里筛出 AI 爬虫的请求:
grep -Ei 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-SearchBot|Claude-User|PerplexityBot' access.log | awk '{print $1, $9, $7}' | sort | uniq -c | sort -rn | head -30
拿到 IP 之后,对照厂商公开的 IP 清单核验:OpenAI 公开 searchbot.json 与 gptbot.json,Anthropic 公开其爬虫 IP 列表。对不上的,就是冒充者在偷内容。
杠杆三:状态码与正文完整性
爬虫到了,还要拿到 200 和完整正文。
把日志里的状态码列出来,如果 AI 爬虫拿到的是 403、429 或质询页,说明文件层放行了,网络层还在拦。Anthropic 官方也特别提示:不要用封 IP 的方式代替 robots.txt,因为那样爬虫读不到你的规则文件,反而失去控制。
八、隽永东方跨境策略
我们为什么先查爬虫通行
隽永东方(EastDigi)观察:我们给客户做 GEO 改造时,第一步从来不是写文章,而是确认 AI 爬虫进不进得来。十六年里见过太多站点,内容扎实、结构清楚,却在一行 Disallow 上把门锁死。爬虫通行是 GEO 的地基,地基没通,上层所有内容投入都会漏水。赫境 HermeZen AI 工作台 把站点诊断、GEO 与 AEO 监控、爬虫访问核验收在同一块面板里,就是为这类地基问题准备的。
把判断交给流程,而不是手感
想让门开着,也要让门开得对。通行名单、规则文件、面板预设、日志状态码,四样东西对齐之后,GEO 的内容投入才不会空转。
这件事不需要灵感和运气,需要的是一份能每季度重跑一次的检查清单。这个流程我们做了十六年,已经很熟。
九、结语:通行证握在自己手里
AI 不会敲第二次门。它来的时候,你放行,它记住你;你拦截,它安静地走开,然后永远不再回来。
今天就能做的三件事
第一,打开 robots.txt,确认三类爬虫各有独立分组,顶部没有全局 Disallow。
第二,进 CDN 或 WAF 面板,确认训练、Agent、搜索三项预设的当前状态,别让一键开关替你做了决定。
第三,拉最近七天的访问日志,确认 AI 爬虫拿到的是 200 和完整正文,而不是质询页。
延伸阅读
如果你还没给 AI 引擎准备入口文件,可以先看 llms.txt 完全指南:一个 500 字节文件如何决定 AI 搜索引擎对你的认知。
爬虫通了之后,内容策略怎么接上,见 2026 海外独立站 GEO 优化完全指南。
想知道各家 AI 引擎的取舍差异,可以对照 2026 AI 搜索引擎排名机制深度对比。