所有 GEO 洞察

AI 爬虫访问:分别处理搜索发现、模型训练和用户请求的访问

AI 访问并非单一设置。各供应商的控制可分别处理自动搜索抓取、可能用于未来模型训练的内容,以及因用户请求而进行的访问。Google-Extended 也涵盖指定的 Gemini grounding 用途。robots 指令不是身份验证;抓取记录或政策设置均不保证出现在搜索结果、获得引用,或从已训练模型中移除。

本文导航

网站所有者能否分别控制 AI 爬虫的搜索、训练和用户请求访问?

不少供应商会分别记录自动搜索抓取、可能用于模型训练或 grounding 的内容,以及用户触发的检索控制。控制效果因供应商而异:例如,OpenAI 分别说明 OAI-SearchBot、GPTBot 和 ChatGPT-User;Google 则表示 Google-Extended 控制指定的未来 Gemini 训练和 grounding 用途,但不影响 Google 搜索收录或排名。robots.txt 提供爬虫指令,并非访问授权。应分别核对相关供应商规则和实际页面传送情况;这些控制均不保证收录、引用、从已训练模型中删除内容,或获得所有爬虫遵守。

一次页面访问,不能回答所有访问问题

供应商可能为自动搜索发现、可能用于模型开发的内容,以及由个人发起的检索,使用不同爬虫或产品 token。这些用途各不相同,不应把其中一项控制当作通用的 AI 访问开关。Google-Extended 有一项重要区别:Google 说明它用于控制未来 Gemini 模型训练及指定的 grounding 用途,而不是控制 Google 搜索收录或排名。

访问观测与回答结果应分别处理。抓取、检索、提及、引用、推荐和引流是不同的观测;其中一项的证据不能证明另一项,插图也不是有保证的流程。

六个独立图格分别标有「抓取」、「检索」、「提及」、「引用」、「推荐」和「引流」,呈现不同的 AI 可见度观察。
抓取、检索、提及、引用、推荐和引流,是不同的观察。看到其中一项,不代表已出现其他项目。概念示意图。查看完整尺寸示意图

信息来源: Overview of OpenAI Crawlers; Does Anthropic crawl data from the web, and how can site owners block the crawler?; List of Google common crawlers; AI features and your website

供应商控制及其已说明的界限

下表概括各项控制所述的用途,并非适用于所有爬虫或网站的通用规则。HTTP 请求中的 user-agent 字符串,不一定等同 robots.txt 组所用的产品 token。Google-Extended 有 robots.txt 控制 token,但没有独立的 HTTP 请求 user-agent。应按相关主机和用途核对供应商文档;各项已记录的选择及例外不能互换。

已记录的控制及重要限制

横向滚动以阅读全部列。

供应商控制已说明的用途重要界限
OpenAI OAI-SearchBot供 ChatGPT 搜索功能自动发现网站内容。OpenAI 表示,拒绝 OAI-SearchBot 的网站不会出现在 ChatGPT 搜索回答中,但仍可能以导航链接形式出现。
OpenAI GPTBot抓取可能用于训练 OpenAI 基础模型的内容。OpenAI 说明 GPTBot 与 OAI-SearchBot 相互独立。禁止 GPTBot 表示内容不应用于这项训练用途;但不能据此确定内容已从已训练模型中移除。
OpenAI ChatGPT-User因 ChatGPT 或 Custom GPT 用户操作而发生的部分访问;并非自动网络抓取。OpenAI 表示,robots.txt 规则可能不适用于这些由用户发起的请求。此控制不管理搜索退出设置;OAI-SearchBot 才是已说明的搜索控制。
Anthropic Claude-SearchBot改善用户搜索的结果质量及索引。Anthropic 表示,停用它会阻止为搜索优化而索引内容,并可能降低网站在用户搜索结果中的可见度或准确度。
Anthropic ClaudeBot收集可能用于模型训练的网页内容。Anthropic 表示,限制访问意味着未来资料应排除在其 AI 模型训练数据集之外;这并非对已训练模型的声明。
Anthropic Claude-User根据用户查询获取网页内容。Anthropic 表示,停用它会阻止这类检索,并可能降低网站在用户主导的网络搜索中的可见度。Anthropic 说明其爬虫会遵守 robots.txt 指令。
Google GooglebotGoogle 搜索抓取,包括 AI Overviews 和 AI Mode。Google 指明 Googlebot 是搜索访问控制。如果把它当作只控制训练,也会影响搜索抓取;允许抓取本身不保证页面会出现在搜索结果。
Google Google-Extended控制已抓取内容能否用于未来 Gemini 模型训练,以及 Gemini Apps 和 Vertex AI 的 Grounding with Google Search 中指定的 grounding 用途。它不影响 Google 搜索收录或排名,也没有独立的 HTTP 请求 user-agent。Google 说明此 token 控制未来用途,并非将内容从已训练模型中移除。

信息来源: Overview of OpenAI Crawlers; Does Anthropic crawl data from the web, and how can site owners block the crawler?; List of Google common crawlers; AI features and your website

robots.txt 是爬虫指令,不是门锁

Robots Exclusion Protocol 要求自动爬虫遵守有关路径访问的规则。RFC 9309 明确指出,这些规则并非访问授权。robots.txt 文件可供公众读取;列出敏感路径可能让路径更容易被发现,而不是让其保密。如果内容需要限制访问,应使用身份验证等应用层访问控制。

应分别检查政策文本、身份验证和实际传送情况。即使 robots 规则允许访问,主机或 CDN 设置仍可能阻止爬虫读取页面;robots 指令本身也不会阻止请求发出。供应商文档会说明特定的遵守方式,但不应把指令视为所有客户端都会遵守的保证。请求中的爬虫名称本身,不能证明其身份。

信息来源: RFC 9309: Robots Exclusion Protocol; List of Google common crawlers; Overview of OpenAI Crawlers; Does Anthropic crawl data from the web, and how can site owners block the crawler?

修改设置前的检查流程

按以下顺序厘清拟议修改的用途。此流程不会更改网站设置,也不能判定页面会否出现在搜索结果或回答中。

  1. 列明内容和用途

    指出具体的公开页面,以及目标涉及搜索发现、可能的训练用途、grounding,还是用户请求的检索。不要把「AI 访问」视为单一用途。

  2. 核对相应的供应商规则

    阅读供应商文档,以及相关主机的 robots.txt 组。先检查现有规则,不要照抄全面封锁指令;并核对已说明的控制是 HTTP user-agent 还是 robots 产品 token。

  3. 分别检查实际传送和保护措施

    检查相关页面和 robots.txt 是否实际可供读取,包括主机或 CDN 的限制。私人或仅供账户使用的资料应以适当访问控制保护;robots 规则不能替代这些措施。

  4. 记录实际观测,不要记录推测

    记录已检查的规则和实际观测到的访问结果。曾被获取不代表已收录于搜索结果或获得引用。训练退出信号不代表内容已从已训练模型中删除;一家供应商所述的遵守方式也不代表普遍适用。

信息来源: RFC 9309: Robots Exclusion Protocol; AI features and your website; Overview of OpenAI Crawlers; Does Anthropic crawl data from the web, and how can site owners block the crawler?

信息来源

阅读对应 JSON 数据

延伸阅读

按用途检查控制,不要只看「AI」一词

先列明公开内容,以及具体的搜索、训练或 grounding 用途,再核对供应商现行文档和适用的主机规则。把 robots 指令与身份验证、实际页面传送分别处理。抓取记录只能证明曾有访问,不代表已收录或获得引用。

检查我的品牌