根据 2026 年的一项分析,前 107 个网站中有 44.9% 至少屏蔽了一个 AI 爬虫。这其中的风险不仅在于流量流失,还在于可能从用户获取信息的新渠道中消失。
问题范围
Robots.txt 一直是告知 Googlebot 和其他传统搜索引擎爬虫哪些页面可以索引的首选文件。现在,一个类似的文件控制着 AI 爬虫——这些软件代理通过阅读网页内容,为 ChatGPT、Claude 和 Perplexity 等工具生成答案。研究发现,在受调查的网站中,有 44.9% 的网站刻意禁止了其中至少一种机器人。OpenAI 模型使用的爬虫 GPTBot 位居被屏蔽代理名单的首位。
令人惊讶的是,很大一部分屏蔽来自于 Cloudflare 等服务的“一键设置”,网站所有者在试图加强安全性时,可能会无意中拒绝了 AI 的访问。
“AI 可爬取性”的真正含义
可爬取性(Crawlability)是指机器人获取页面的能力。对于 AI 而言,可爬取性决定了当用户提出问题时,模型能否提取出有关品牌、产品或服务的最新事实。如果一个网站不可爬取,AI 就没有可以引用的来源,品牌也会从答案流中消失。
旧的 SEO 策略侧重于让 Googlebot 爬取页面,以便它们能在链接列表中获得排名。AI 可爬取性改变了目标:结果不再是排名,而是在对话式回答中的推荐。
训练机器人 vs. 回答机器人
并非所有的 AI 爬虫都服务于相同的目的。
- 训练机器人 (Training bots) —— 例如 GPTBot、ClaudeBot 和 Google-Extended。它们抓取互联网的大量内容,以喂养驱动底层语言模型的海量数据集。如果网站所有者希望将其专有内容排除在未来的模型训练之外,可以屏蔽这些机器人。
- 回答机器人 (Answer bots) —— 例如 OAI-SearchBot、Claude-SearchBot 和 PerplexityBot。它们实时运行,提取特定的片段来回答用户的查询。屏蔽回答机器人意味着即使同一个页面仍被传统搜索引擎索引,网站的内容也永远不会出现在对话式回复中。
分析显示,许多网站将两者混为一谈,最终采取了“屏蔽所有 AI”的笼统规则,这在没有保护任何实际知识产权(IP)的情况下损害了可见性。
为什么会被错误地屏蔽
以下几个因素解释了这种配置错误:
- 默认安全预设 —— 提供单一“屏蔽 AI”开关的平台通常会将其应用于所有已知的爬虫,包括网站实际上希望其访问的回答机器人。
- 缺乏意识 —— 大多数网站管理员了解用于 Googlebot 的 robots.txt,但对较新的 AI 特定指令并不熟悉。
- 对数据滥用的担忧 —— 所有者担心训练机器人会将他们的内容纳入未来的模型中,这是一个合理的担忧,但对于仅按需获取数据的回答机器人来说并不适用。
如何取得平衡
- 编辑 robots.txt —— 明确允许你希望其访问的回答机器人。例如,使用一行
User-agent: OAI-SearchBot\nAllow: /可以让 OpenAI 的回答机器人爬取整个网站,同时仍保持其他代理被屏蔽。 - 决定训练数据 —— 如果保护专有材料是首要任务,请为 GPTBot、ClaudeBot 和类似的训练代理保留
Disallow规则。 - 采用 llms.txt —— 这一新兴标准允许发布者突出显示对 AI 消费最重要的页面,从而加快回答机器人的发现过程。
- 审计第三方设置 —— 检查任何可能自动屏蔽 AI 爬虫的安全或 CDN 配置,并手动调整规则。
你必须权衡的利弊
允许回答机器人可以提高品牌在 AI 驱动的对话中的曝光率,但也意味着内容可能会在面向用户的回答中被逐字复制。屏蔽训练机器人可以保护数据不被整合到未来的模型权重中,但它并不能阻止回答机器人抓取相同的公开页面。
如果一家公司的核心价值是对其知识产权的严格控制,那么采取更严格的屏蔽措施可能是合理的,但代价是在许多用户现在开始进行研究的渠道中减少了存在感。相反,一个依靠产品发现而繁荣的电子商务网站,从具备 AI 可爬取性中获得的收益,可能比承担少量引用片段带来的边际风险要大得多。
下一步值得关注的内容
- llms.txt 的采用 – 随着该标准的普及,解析该文件的工具可能成为 AI 回答机器人定位高价值内容的主要方式。
- AI 提供商的政策转变 – OpenAI、Anthropic 等公司可能会完善其爬虫政策,并可能提供更细粒度的选择性加入 (opt-in) 机制。
- 关于 AI 训练数据的法律指导 – 关于抓取的公开内容是否可用于模型训练的持续辩论,可能会影响网站选择直接屏蔽训练机器人的程度。
归根结底:如果一个品牌想要在用户越来越多地通过提问而非输入关键词进行搜索的地方保持可见度,它必须使其网站具备 AI 可爬取性。第一步是简单的 robots.txt 编辑;第二步是明确决定哪些数据是其愿意与下一代搜索分享的。忽视训练机器人与回答机器人之间的区别,可能会使公司在这一正在重塑信息获取方式的领域中变得“隐形”。
