AI 爬虫和搜索引擎爬虫不一样
搜索引擎爬虫把内容抓去建索引,用户通过搜索进入你的网站。AI 爬虫把内容抓去回答问题,用户可能永远不点进你的页面,但你的内容成了答案的一部分。
这让「被引用」成为新的流量和品牌指标。
主流 AI 爬虫
GPTBot(OpenAI)、OAI-SearchBot(ChatGPT 搜索)、ClaudeBot(Anthropic)、PerplexityBot、Google-Extended(AI 训练与生成)、Bingbot 等。它们在 robots.txt 里用各自的 User-agent 声明。
不同爬虫用途不同:有的用于搜索回答,有的用于模型训练,可以分别决策。
- GPTBot:OpenAI 网页爬虫
- OAI-SearchBot:ChatGPT 搜索
- ClaudeBot:Anthropic 爬虫
- PerplexityBot:Perplexity 搜索
- Google-Extended:Google AI 相关用途
放行还是屏蔽
如果你的网站希望被 AI 搜索引用,放行搜索类爬虫。如果担心内容被无授权使用,可以屏蔽训练类爬虫,或用站点条款明确使用边界。
屏蔽前想清楚:你的内容是否已经通过其他渠道被 AI 获取?屏蔽 robots 并不能阻止所有抓取,只是表达意图。
和 llms.txt 配合
robots.txt 负责通行,llms.txt 负责导览。放行 AI 爬虫的站点,应该同时提供结构化摘要,让 AI 用最低成本理解你的站点。
AI 时代的内容可见性,是策略问题,不是技术问题。
建立自己的抓取日志
服务器日志里可以看到 GPTBot、ClaudeBot、PerplexityBot 是否真的来过、抓了哪些页面。定期查看,能发现内容是否被遗漏、目录是否被爬虫访问。
抓取日志和 llms.txt 配合,等于给 AI 访问做一次体检。
常见的 robots 配置误区
第一个误区是只屏蔽了部分 AI 爬虫,漏掉新增的 User-agent。第二个误区是屏蔽目录过于宽泛,把内容页也挡住了。第三个误区是写完 robots 从不复查,站点结构调整后规则早已过时。
建议每半年审一次 robots.txt,并在改动后检查爬虫日志确认生效。
配置策略的关键不是「放行还是屏蔽」的一刀切,而是按爬虫用途分别决策。
AI 爬虫的带宽成本
高频抓取会带来带宽和服务器压力,尤其大型站点。可以通过缓存、限速和内容分发网络缓解,而不是简单屏蔽所有爬虫。
观察抓取日志里的频率:正常爬虫有礼貌地限速,异常高频的抓取才需要单独处理。
成本可控时,开放给 AI 带来的曝光价值通常高于带宽成本。