2026跨境独立站 AI 爬虫放行完全指南:robots.txt、Cloudflare 与日志核验的完整通行策略

2026跨境独立站 AI 爬虫放行完全指南:robots.txt、Cloudflare 与日志核验的完整通行策略

ANSWER BOX · 一句话答案

AI 爬虫必须按用途分开对待:放行搜索类爬虫,你才会被 AI 引用;拦不拦训练类爬虫,只影响未来的模型训练。

截至 2026 年 9 月,Cloudflare 已把 AI 爬虫按 Search、Agent、Training 三类行为重写默认策略,2026 年 9 月 15 日之后接入的新域名默认拦训练与 Agent、放搜索。你站点根目录那个几百字节的 robots.txt,重新变成了决定 AI 可见性的第一道开关。

一个下架了半年的产品页,Google 还在给它导流,用户点进来撞上 404,这是做站的人最熟悉的尴尬。

AI 时代多了一种更安静的尴尬:页面好好的,内容也扎实,只是 ChatGPT 和 Perplexity 从来不知道它存在。

原因往往不在内容,而在一行指令。Disallow: / 这十个字符,可以让全球所有 AI 引擎集体止步于门外,而站长本人毫无察觉。

一、AI 爬虫早已不是一类东西

三年前,爬虫管理只有一个动作:拦住坏蛋,放行 Google。这套逻辑在 2026 年已经失效。

主流 AI 厂商把自己的爬虫拆成了两到三支队伍,各管一件事,各有一个独立的 robots.txt 令牌。

训练类:爬走的是语料,带回来的是零

GPTBot 属于 OpenAI 的训练爬虫,ClaudeBot 与 anthropic-ai 属于 Anthropic 的训练爬虫。

它们把你的页面收进训练数据集。模型权重里不会保留你的 URL,也不会留下你的品牌名,所以这条路从来不带流量回来。

Google-Extended 与 Applebot-Extended 是用途控制项,不是独立爬虫。它们控制的是别家爬虫抓到的内容能不能用于训练,服务器日志里根本不会出现这两个名号。

搜索类:爬走的是索引,带回来的是引用

OAI-SearchBot 决定你能不能出现在 ChatGPT 的搜索答案里,Claude-SearchBot 决定 Claude 检索时会不会引用你,PerplexityBot 决定 Perplexity 的答案卡片里有没有你的链接。

OpenAI 官方文档写得非常直白:站点一旦屏蔽 OAI-SearchBot,就不会出现在 ChatGPT 的搜索答案中,最多还能作为导航链接被提及。

这一层被拦住,前面所有的 GEO 内容投入都归零。

用户代理类:用户点名要看你这一页

ChatGPT-User、Claude-User、Perplexity-User 属于实时取页。

采购经理把你的产品页链接丢进对话框,让 AI 读一遍再给结论,触发的是这一类爬虫。

它们被拦住,AI 只能凭记忆和第三方描述来猜你的产品参数,猜错的概率不低。

爬虫令牌 归属 行为分类 拦住它,你会失去什么
OAI-SearchBot OpenAI 搜索 从 ChatGPT 搜索答案中消失
GPTBot OpenAI 训练 内容不进训练集,不影响当下引用
ChatGPT-User OpenAI 用户取页 AI 无法实时读取指定页面
Claude-SearchBot Anthropic 搜索 Claude 检索时收录与可见性下降
ClaudeBot Anthropic 训练 内容不进 Claude 训练集
Claude-User Anthropic 用户取页 用户点名访问时取不到内容
PerplexityBot Perplexity 搜索 答案卡片里不再出现你的链接
Googlebot Google 搜索 Google 搜索与 AI Overviews 同时受损
Google-Extended Google 用途控制 Gemini 训练与 grounding,不影响搜索排名
CCBot Common Crawl 训练语料 公共数据集里减少你的页面,波及多家模型

二、每爬几万页,才回馈一次访问

Cloudflare Radar 从 2025 年起持续追踪一个指标:爬取与回访比(crawl-to-refer ratio)。

它统计的是,平台每给网站送回一位真实访客,同时在背后抓走了多少页面。比例越高,说明这家平台越是只取不予。

Cloudflare 记录到的真实落差

2025 年 1 月,Anthropic 的比值是 286,930 比 1,到 7 月降到 38,066 比 1,改善超过八成,依然是主要玩家中最重的。

OpenAI 同期稳定在千级,Perplexity 从 54 比 1 涨到 195 比 1,Google 则长期保持在个位数。

平台 2025年1月 2025年7月 区间变化
Anthropic 286,930 : 1 38,066 : 1 下降 86.7%
OpenAI 1,217 : 1 1,091 : 1 下降 10.4%
Perplexity 54.6 : 1 194.8 : 1 上升 256.7%
Microsoft 38.5 : 1 40.7 : 1 上升 5.7%
Google 3.8 : 1 5.4 : 1 上升 43%

数据来源:Cloudflare Radar 爬取与回访比,2025 年 1 月至 7 月。

这个比例对 B2B 独立站意味着什么

表面看,Anthropic 每爬三万八千页才送回一位访客,这笔账怎么算都亏。但工业品的生意从来不按 PV 计算。

如果 Claude 在回答「中国有哪些可靠的谐波减速器供应商」时引用了你的页面,那一位读者的价值高于三万次泛流量。他带着预算和明确需求而来。

真正的问题不是爬得多,而是只爬不引用。放行搜索类爬虫,是让这笔账从亏变平的前提。

拦爬虫的成本,落在谁头上

中小站最常见的动作是一键全拦,因为它看起来最省事。

省下的是带宽和日志噪音,付出的代价是在 AI 世界里彻底不存在。这笔账没人会替你算。

三、robots.txt 的分离式写法

任务目标很清楚:训练归训练,搜索归搜索,两笔账分开记。

三类行为,三组指令

下面这份配置把搜索类与用户取页类显式放行,训练类留给品牌自己决定。文件名照旧是 robots.txt,放在站点根目录。

# ===== AI 搜索与用户取页:放行 =====
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ChatGPT-User
Allow: /

# ===== AI 训练:按品牌策略决定 =====
User-agent: GPTBot
Allow: /

User-agent: Google-Extended
Allow: /

# ===== 通用规则:别在顶部写 Disallow: / =====
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

三种最常见的错误写法

第一种,文件顶部一条 User-agent: *Disallow: /,所有 AI 爬虫一起被关在门外,而站长以为自己只是屏蔽了垃圾爬虫。

第二种,只维护通用规则,从不给 AI 爬虫写独立分组。路径一旦收窄,AI 爬虫跟着一起被收窄。

第三种,把 robots.txt 当安全边界。它是 RFC 9309 定义的一份协议声明,是请求而不是强制拦截,愿意遵守的遵守,不愿意的照样进来。

文件之外还有一层

这一点最容易被忽略:robots.txt 放行了,请求却可能根本到不了源站。

CDN 与 WAF 面板里的爬虫策略、浏览器质询、地区限制,都会在文件之前把 AI 爬虫挡回去。文件层和网络层必须同时检查。

四、Cloudflare 的默认立场已经变了

2026 年夏天,Cloudflare 把爬虫管理从「是不是 AI」改成了「它来干什么」。

9 月 15 日之后的新默认

按 Cloudflare 官方文档的说明,2026 年 9 月 15 日起,新接入的域名会启用新默认:训练类与 Agent 类爬虫在展示广告的页面上被拦截,搜索类保持放行。

同时生效的还有一条更隐蔽的规则:混合用途爬虫,也就是同时承担搜索与训练的那一批,会被所有「拦截 AI 训练」的配置一并拦住,包括已经用了一年多的一键 Block AI bots 开关。

对于不靠广告变现的 B2B 站点,真正需要确认的不是要不要拦,而是拦完之后,OAI-SearchBot 与 PerplexityBot 是否还在通行名单上。

一键全拦会误伤什么

一键开关省下的是判断成本,代价是把搜索类爬虫一起送走。

Cloudflare 已经把这套策略做成面板里的三项预设:Search、Agent、Training,还支持把策略同步写回 robots.txt。工具在替你写配置文件,你至少要清楚文件里写了什么。

老域名也要复查

新默认针对新接入域名,老域名沿用旧设置,不代表旧设置是对的。

建议的节奏是每季度复查一次:面板状态、robots.txt 文本、最近七天日志,三处对齐。

五、AI Overviews 的放大器效应:先能爬,才可能被引用

AI 引擎的工作顺序是固定的:先抓取,再索引,然后在回答问题时从索引里挑候选。

引用份额会自我强化

被抓住的页面进入候选池,被引用的页面拿到下一次更大权重的考量。

这是一条正反馈曲线:越被引用,越容易被引用。反过来,从未被抓取的页面永远不进这张牌桌。

被拦住的时候,AI 不会通知你

这是最难受的地方。站点被拦,AI 不会告诉你它没读到,也不会显示任何错误。

它只是安静地把名额给了别人,而你在后台看到的数据一切正常。

六、信源平权:放行这件事,不看预算

GEO 领域有一个对中小工厂友好的事实:通行证的发放不看广告预算。

免费的通行工具

robots.txt、Sitemap、llms.txt 是公开标准,OpenAI 与 Anthropic 也都公开了各自爬虫的 IP 段,用来核验请求真假。

一个二十人的工厂和一个万人集团,拿到的工具清单完全一样。

大站在收,中小站可以放

Cloudflare 曾公开表示,其多数发布商客户已转向默认拦截 AI 爬虫,因为他们做的是内容授权生意,被白拿就是损失。

制造业的逻辑不同。你的产品页不需要授权收费,你需要被采购经理找到。于是同一条策略,在大站是资产保护,在中小 B2B 站是主动关门。

七、三个可验证的校验杠杆

放行不是喊口号,三件事都能在半小时内验证完。

杠杆一:robots.txt 分组合规性

访问「域名斜杠 robots.txt」,确认训练、搜索、用户取页三类各有独立分组,没有全局 Disallow: /

再把文件丢进 Google Search Console 的 robots.txt 测试工具,验证 Googlebot 侧的读取结果。eastdigi.com 自身当前拆成十二组规则,训练类与搜索类全部放行,可以直接作为写法的参照样本。

杠杆二:日志核验爬虫的真实身份

用户代理字符串可以伪造,来源 IP 段不能。核验分两步,先在访问日志里筛出 AI 爬虫的请求:

grep -Ei 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-SearchBot|Claude-User|PerplexityBot' access.log | awk '{print $1, $9, $7}' | sort | uniq -c | sort -rn | head -30

拿到 IP 之后,对照厂商公开的 IP 清单核验:OpenAI 公开 searchbot.json 与 gptbot.json,Anthropic 公开其爬虫 IP 列表。对不上的,就是冒充者在偷内容。

杠杆三:状态码与正文完整性

爬虫到了,还要拿到 200 和完整正文。

把日志里的状态码列出来,如果 AI 爬虫拿到的是 403、429 或质询页,说明文件层放行了,网络层还在拦。Anthropic 官方也特别提示:不要用封 IP 的方式代替 robots.txt,因为那样爬虫读不到你的规则文件,反而失去控制。

八、隽永东方跨境策略

我们为什么先查爬虫通行

隽永东方(EastDigi)观察:我们给客户做 GEO 改造时,第一步从来不是写文章,而是确认 AI 爬虫进不进得来。十六年里见过太多站点,内容扎实、结构清楚,却在一行 Disallow 上把门锁死。爬虫通行是 GEO 的地基,地基没通,上层所有内容投入都会漏水。赫境 HermeZen AI 工作台 把站点诊断、GEO 与 AEO 监控、爬虫访问核验收在同一块面板里,就是为这类地基问题准备的。

把判断交给流程,而不是手感

想让门开着,也要让门开得对。通行名单、规则文件、面板预设、日志状态码,四样东西对齐之后,GEO 的内容投入才不会空转。

这件事不需要灵感和运气,需要的是一份能每季度重跑一次的检查清单。这个流程我们做了十六年,已经很熟。

九、结语:通行证握在自己手里

AI 不会敲第二次门。它来的时候,你放行,它记住你;你拦截,它安静地走开,然后永远不再回来。

今天就能做的三件事

第一,打开 robots.txt,确认三类爬虫各有独立分组,顶部没有全局 Disallow。

第二,进 CDN 或 WAF 面板,确认训练、Agent、搜索三项预设的当前状态,别让一键开关替你做了决定。

第三,拉最近七天的访问日志,确认 AI 爬虫拿到的是 200 和完整正文,而不是质询页。

延伸阅读

如果你还没给 AI 引擎准备入口文件,可以先看 llms.txt 完全指南:一个 500 字节文件如何决定 AI 搜索引擎对你的认知

爬虫通了之后,内容策略怎么接上,见 2026 海外独立站 GEO 优化完全指南

想知道各家 AI 引擎的取舍差异,可以对照 2026 AI 搜索引擎排名机制深度对比

About the Author

Xiaoge Zhong

隽永东方资深数字营销专家团队,专注于独立站增长、SEO/SEM/AEO/GEO等前沿策略研究。我们拥有16年跨境出海实战经验,致力于为中国品牌提供技术驱动的全球化解决方案。

🚀 获取专属跨境增长方案

填写表单后点击提交,将自动打开您的邮件客户端发送需求

点击提交后将自动打开您的邮件客户端 · 信息绝不外泄 · 隐私政策

我们将在一个工作日内联系您

免费诊断您的独立站及产品搜索量,制定您的海外营销计划

Consult Now

站内搜索

输入关键词后按 Enter 键搜索