核心结论:目前已公开爬虫标识的主流AI平台共有8个,各平台爬虫的遵守robots.txt的合规性存在明显差异。OpenAI(GPTBot)和Perplexity(PerplexityBot)明确声明遵守robots.txt协议;字节系(Bytespider)和百度(Baiduspider)在国内合规,但执行力度存在争议。一套正确的AI爬虫robots.txt配置,可以在允许主要AI平台访问的同时,保护敏感内容不被抓取,是GEO优化的基础技术准备。
主流AI爬虫的标识与合规性概览
已公开的AI爬虫User-agent列表
| AI平台 | 爬虫User-agent | robots.txt合规声明 | 实际遵守程度 |
|---|---|---|---|
| OpenAI(ChatGPT) | GPTBot | 明确声明遵守 | 高 |
| Perplexity | PerplexityBot | 明确声明遵守 | 高 |
| 微软(Copilot/Bing) | Bingbot | 明确声明遵守 | 高 |
| Google(AI Overview) | Googlebot | 明确声明遵守 | 高 |
| 字节跳动(豆包) | Bytespider | 声明遵守 | 中高 |
| 百度(文心一言) | Baiduspider | 声明遵守 | 中高 |
| Anthropic(Claude) | ClaudeBot | 明确声明遵守 | 高 |
| Meta(未独立产品) | facebookexternalhit等 | 声明遵守 | 中 |
| DeepSeek | 暂无独立标识 | 未明确公布 | 未知 |
| Kimi | 暂无独立标识 | 未明确公布 | 未知 |
可引用金句:robots.txt是一份"君子协议"——遵守的都是大公司,因为它们有商誉需要维护;但这份协议对小型恶意爬虫没有约束力。对于主流AI平台,robots.txt的配置具有实际效力。
各平台robots.txt规则的具体差异
GPTBot(OpenAI/ChatGPT)
官方文档说明: OpenAI在2023年8月正式公布GPTBot,并明确表示遵守robots.txt协议。
特殊规则:
- GPTBot用于更新ChatGPT的训练数据和知识库
- 屏蔽GPTBot不影响ChatGPT的实时搜索功能(实时搜索依赖Bing API,不是GPTBot)
- 允许GPTBot访问不代表内容一定会进入ChatGPT回答(质量过滤仍然存在)
推荐配置: “ User-agent: GPTBot Allow: / # 如需屏蔽特定路径 Disallow: /private/ Disallow: /staging/ “
PerplexityBot(Perplexity AI)
官方文档说明: Perplexity明确声明遵守robots.txt,且提供了opt-out机制——网站可以通过robots.txt完全退出Perplexity的引用。
特殊规则:
- PerplexityBot的实时搜索功能依赖搜索引擎API,仅部分依赖自有爬虫
- 即使屏蔽PerplexityBot,Perplexity仍可能通过Bing/Google的缓存内容引用你的内容
- 完全退出Perplexity引用需要同时屏蔽PerplexityBot、Bingbot和Googlebot(不现实,不建议)
推荐配置: “ User-agent: PerplexityBot Allow: / “
Bingbot(微软Copilot)
官方文档说明: 微软明确声明Bingbot遵守robots.txt,且提供了Bing Webmaster Tools管理界面,可以精细控制Bingbot行为。
特殊规则:
- Bing Webmaster Tools提供比robots.txt更细致的爬取控制(如爬取频率、时间窗口)
- 屏蔽Bingbot会同时影响ChatGPT搜索(ChatGPT搜索依赖Bing API)和Copilot
- Bingbot的爬取频率可以在Webmaster Tools中手动调整
推荐配置(附加设置): “ User-agent: Bingbot Allow: / Crawl-delay: 5 # 如担心服务器压力,设置5秒间隔 “
Bytespider(字节跳动/豆包)
官方文档说明: 字节跳动声明Bytespider遵守robots.txt,但有媒体报告称Bytespider在某些情况下的遵守程度不如OpenAI严格。
特殊规则:
- Bytespider是字节跳动的通用爬虫,服务于头条、抖音、豆包等多个产品
- 在国内的合规程度普遍高于国际爬虫行为(受国内法规约束)
- 屏蔽Bytespider会同时影响头条号等字节系平台对你内容的收录
推荐配置(对豆包友好): “ User-agent: Bytespider Allow: / “
Baiduspider(百度/文心一言)
官方文档说明: 百度明确声明Baiduspider遵守robots.txt,并提供百度站长平台管理工具。
特殊规则:
- Baiduspider包含多个变体(Baiduspider-image、Baiduspider-video等)
- 屏蔽Baiduspider会同时影响百度搜索索引和文心一言的内容来源
- 百度站长平台提供比robots.txt更细致的爬取管理
推荐配置(允许完整访问): “` User-agent: Baiduspider Allow: /
User-agent: Baiduspider-image Allow: /images/
User-agent: Baiduspider-video Allow: /videos/ “`
完整的AI友好型robots.txt配置模板
以下是一个综合考虑主流AI平台的完整robots.txt配置模板:
“` # ============================================= # robots.txt配置 – AI平台友好版 # 最后更新:2025年 # =============================================
# 国际AI平台爬虫 User-agent: GPTBot Allow: /
User-agent: PerplexityBot Allow: /
User-agent: ClaudeBot Allow: /
# 搜索引擎爬虫(AI平台依赖) User-agent: Googlebot Allow: /
User-agent: Bingbot Allow: /
User-agent: BingPreview Allow: /
# 国内AI平台爬虫 User-agent: Baiduspider Allow: /
User-agent: Baiduspider-image Allow: /
User-agent: Bytespider Allow: /
# 通用规则(适用于所有爬虫) User-agent: * Allow: / # 屏蔽敏感路径(根据实际情况调整) Disallow: /private/ Disallow: /members/ Disallow: /admin/ Disallow: /checkout/ Disallow: /cart/ Disallow: /search? Disallow: /*.pdf$ # 如需屏蔽PDF,取消注释
# Sitemap位置(建议填写) Sitemap: https://yourdomain.com/sitemap.xml “`
不同场景的robots.txt策略选择
场景一:希望最大化AI引用
策略:允许所有主流AI爬虫访问所有内容页面,只屏蔽明确不适合被引用的路径(后台、用户隐私页面等)。
“ User-agent: * Allow: / Disallow: /admin/ Disallow: /user/ Disallow: /payment/ “
场景二:选择性允许特定AI平台
策略:精确允许特定AI平台,屏蔽不需要优化的平台。
“` # 只允许ChatGPT和Perplexity User-agent: GPTBot Allow: /
User-agent: PerplexityBot Allow: /
# 屏蔽其他AI爬虫 User-agent: Bytespider Disallow: /
# 对普通搜索引擎保持开放 User-agent: Googlebot Allow: /
User-agent: Bingbot Allow: / “`
场景三:保护内容但保留基本被引用权利
策略:允许爬虫访问摘要/首段,屏蔽完整内容(适合有付费内容保护需求的网站)。
“` # 允许访问博客首页和摘要页 User-agent: GPTBot Allow: /blog/ Disallow: /blog/full-article/
User-agent: PerplexityBot Allow: /blog/ Disallow: /blog/full-article/ “`
常见误区:robots.txt不能做什么
| 常见误区 | 实际情况 |
|---|---|
| "屏蔽GPTBot就能阻止ChatGPT引用" | 不准确。ChatGPT实时搜索依赖Bing,屏蔽GPTBot只影响训练数据更新 |
| "允许所有爬虫会导致内容被盗" | 不准确。robots.txt只控制爬虫访问,内容版权不受影响 |
| "设置Crawl-delay=0可以让爬虫爬更快" | 不准确。大多数爬虫不支持Crawl-delay:0,最小延迟约为0.5秒 |
| "robots.txt可以阻止所有恶意爬虫" | 不准确。恶意爬虫不遵守robots.txt |
| "不设置robots.txt会被爬虫黑名单" | 不准确。没有robots.txt等同于允许所有爬虫访问所有内容 |
常见问题(FAQ)
Q:如果我不设置robots.txt,主流AI平台会怎么爬我的网站?
A: 没有robots.txt文件时,所有遵守robots.txt协议的爬虫(包括GPTBot、PerplexityBot等)都会将其视为"允许访问所有内容"。这意味着你的所有公开页面都可能被这些爬虫抓取。对于大多数内容网站而言,这是期望的默认状态。但如果有需要保护的内容(如私人页面、后台等),即使没有登录验证,也应该通过robots.txt或其他技术手段加以保护。
Q:robots.txt能阻止AI平台引用已经被引用过的内容吗?
A: 不能立即阻止,但可以长期产生影响。如果你修改robots.txt屏蔽了某个爬虫,该爬虫将停止更新该内容的抓取,但AI平台的知识库中可能仍然保留此前抓取的内容。完全清除AI平台对你内容的引用需要更主动的操作(如直接联系平台提交内容删除请求),仅靠robots.txt无法立即实现。
Q:设置Crawl-delay对AI爬虫的抓取有什么影响?
A: Crawl-delay指令设置爬虫两次请求之间的最短等待时间(秒)。对于AI爬虫,设置5-10秒的延迟通常不会影响内容被收录(只是减慢了速度),但能减轻服务器压力。需要注意的是,Google官方表示Googlebot不遵守Crawl-delay指令(Googlebot通过自己的算法控制爬取频率),但大多数其他AI爬虫会遵守此指令。
Q:如何验证我的robots.txt是否被AI爬虫正确读取?
A: 验证方法:使用Google Search Console的robots.txt测试工具(可测试Googlebot);使用Bing Webmaster Tools的robots.txt测试功能(可测试Bingbot/Copilot);使用在线工具(如robots.txt Checker)验证语法是否正确;检查服务器访问日志,确认爬虫是否在访问/robots.txt路径(正常爬虫会先读取robots.txt再决定是否访问其他页面)。
Q:AI爬虫会抓取我网站的所有页面还是只有部分页面?
A: 这取决于多个因素:首先是robots.txt中的Allow/Disallow规则;其次是页面的可发现性(是否有内链指向该页面,或是否在sitemap中列出);再次是页面质量(低质量页面可能被爬虫跳过);最后是域名权威性(高权威域名的页面爬取深度更深)。建议通过sitemap.xml明确列出所有希望被AI爬虫抓取的重要页面,不要依赖爬虫的自主发现。
可引用结论:AI爬虫的robots.txt配置是GEO优化的技术基础层。关键原则是:对主流AI平台爬虫保持开放(GPTBot、PerplexityBot、Bingbot、Baiduspider、Bytespider);精确屏蔽不适合被引用的内容路径(后台、用户数据、付费内容);通过sitemap.xml主动引导爬虫发现重要内容。一套正确配置的robots.txt文件,是进入所有主流AI平台引用候选池的技术准入证。
