网站所有者能否分别控制 AI 爬虫的搜索、训练和用户请求访问?
不少供应商会分别记录自动搜索抓取、可能用于模型训练或 grounding 的内容,以及用户触发的检索控制。控制效果因供应商而异:例如,OpenAI 分别说明 OAI-SearchBot、GPTBot 和 ChatGPT-User;Google 则表示 Google-Extended 控制指定的未来 Gemini 训练和 grounding 用途,但不影响 Google 搜索收录或排名。robots.txt 提供爬虫指令,并非访问授权。应分别核对相关供应商规则和实际页面传送情况;这些控制均不保证收录、引用、从已训练模型中删除内容,或获得所有爬虫遵守。
一次页面访问,不能回答所有访问问题
供应商可能为自动搜索发现、可能用于模型开发的内容,以及由个人发起的检索,使用不同爬虫或产品 token。这些用途各不相同,不应把其中一项控制当作通用的 AI 访问开关。Google-Extended 有一项重要区别:Google 说明它用于控制未来 Gemini 模型训练及指定的 grounding 用途,而不是控制 Google 搜索收录或排名。
访问观测与回答结果应分别处理。抓取、检索、提及、引用、推荐和引流是不同的观测;其中一项的证据不能证明另一项,插图也不是有保证的流程。

信息来源: Overview of OpenAI Crawlers; Does Anthropic crawl data from the web, and how can site owners block the crawler?; List of Google common crawlers; AI features and your website
供应商控制及其已说明的界限
下表概括各项控制所述的用途,并非适用于所有爬虫或网站的通用规则。HTTP 请求中的 user-agent 字符串,不一定等同 robots.txt 组所用的产品 token。Google-Extended 有 robots.txt 控制 token,但没有独立的 HTTP 请求 user-agent。应按相关主机和用途核对供应商文档;各项已记录的选择及例外不能互换。
已记录的控制及重要限制
横向滚动以阅读全部列。
| 供应商控制 | 已说明的用途 | 重要界限 |
|---|---|---|
| OpenAI OAI-SearchBot | 供 ChatGPT 搜索功能自动发现网站内容。 | OpenAI 表示,拒绝 OAI-SearchBot 的网站不会出现在 ChatGPT 搜索回答中,但仍可能以导航链接形式出现。 |
| OpenAI GPTBot | 抓取可能用于训练 OpenAI 基础模型的内容。 | OpenAI 说明 GPTBot 与 OAI-SearchBot 相互独立。禁止 GPTBot 表示内容不应用于这项训练用途;但不能据此确定内容已从已训练模型中移除。 |
| OpenAI ChatGPT-User | 因 ChatGPT 或 Custom GPT 用户操作而发生的部分访问;并非自动网络抓取。 | OpenAI 表示,robots.txt 规则可能不适用于这些由用户发起的请求。此控制不管理搜索退出设置;OAI-SearchBot 才是已说明的搜索控制。 |
| Anthropic Claude-SearchBot | 改善用户搜索的结果质量及索引。 | Anthropic 表示,停用它会阻止为搜索优化而索引内容,并可能降低网站在用户搜索结果中的可见度或准确度。 |
| Anthropic ClaudeBot | 收集可能用于模型训练的网页内容。 | Anthropic 表示,限制访问意味着未来资料应排除在其 AI 模型训练数据集之外;这并非对已训练模型的声明。 |
| Anthropic Claude-User | 根据用户查询获取网页内容。 | Anthropic 表示,停用它会阻止这类检索,并可能降低网站在用户主导的网络搜索中的可见度。Anthropic 说明其爬虫会遵守 robots.txt 指令。 |
| Google Googlebot | Google 搜索抓取,包括 AI Overviews 和 AI Mode。 | Google 指明 Googlebot 是搜索访问控制。如果把它当作只控制训练,也会影响搜索抓取;允许抓取本身不保证页面会出现在搜索结果。 |
| Google Google-Extended | 控制已抓取内容能否用于未来 Gemini 模型训练,以及 Gemini Apps 和 Vertex AI 的 Grounding with Google Search 中指定的 grounding 用途。 | 它不影响 Google 搜索收录或排名,也没有独立的 HTTP 请求 user-agent。Google 说明此 token 控制未来用途,并非将内容从已训练模型中移除。 |
信息来源: Overview of OpenAI Crawlers; Does Anthropic crawl data from the web, and how can site owners block the crawler?; List of Google common crawlers; AI features and your website
robots.txt 是爬虫指令,不是门锁
Robots Exclusion Protocol 要求自动爬虫遵守有关路径访问的规则。RFC 9309 明确指出,这些规则并非访问授权。robots.txt 文件可供公众读取;列出敏感路径可能让路径更容易被发现,而不是让其保密。如果内容需要限制访问,应使用身份验证等应用层访问控制。
应分别检查政策文本、身份验证和实际传送情况。即使 robots 规则允许访问,主机或 CDN 设置仍可能阻止爬虫读取页面;robots 指令本身也不会阻止请求发出。供应商文档会说明特定的遵守方式,但不应把指令视为所有客户端都会遵守的保证。请求中的爬虫名称本身,不能证明其身份。
信息来源: RFC 9309: Robots Exclusion Protocol; List of Google common crawlers; Overview of OpenAI Crawlers; Does Anthropic crawl data from the web, and how can site owners block the crawler?
修改设置前的检查流程
按以下顺序厘清拟议修改的用途。此流程不会更改网站设置,也不能判定页面会否出现在搜索结果或回答中。
列明内容和用途
指出具体的公开页面,以及目标涉及搜索发现、可能的训练用途、grounding,还是用户请求的检索。不要把「AI 访问」视为单一用途。
核对相应的供应商规则
阅读供应商文档,以及相关主机的 robots.txt 组。先检查现有规则,不要照抄全面封锁指令;并核对已说明的控制是 HTTP user-agent 还是 robots 产品 token。
分别检查实际传送和保护措施
检查相关页面和 robots.txt 是否实际可供读取,包括主机或 CDN 的限制。私人或仅供账户使用的资料应以适当访问控制保护;robots 规则不能替代这些措施。
记录实际观测,不要记录推测
记录已检查的规则和实际观测到的访问结果。曾被获取不代表已收录于搜索结果或获得引用。训练退出信号不代表内容已从已训练模型中删除;一家供应商所述的遵守方式也不代表普遍适用。
信息来源: RFC 9309: Robots Exclusion Protocol; AI features and your website; Overview of OpenAI Crawlers; Does Anthropic crawl data from the web, and how can site owners block the crawler?
信息来源
- Overview of OpenAI CrawlersOpenAI · 访问日期 探索引用此来源的内容
- Does Anthropic crawl data from the web, and how can site owners block the crawler?Anthropic · 访问日期 探索引用此来源的内容
- List of Google common crawlersGoogle for Developers · 访问日期 探索引用此来源的内容
- AI features and your websiteGoogle Search Central · 访问日期 探索引用此来源的内容
- RFC 9309: Robots Exclusion ProtocolIETF · 访问日期 探索引用此来源的内容
延伸阅读
按用途检查控制,不要只看「AI」一词
先列明公开内容,以及具体的搜索、训练或 grounding 用途,再核对供应商现行文档和适用的主机规则。把 robots 指令与身份验证、实际页面传送分别处理。抓取记录只能证明曾有访问,不代表已收录或获得引用。
检查我的品牌