AI 爬虫 robots.txt 生成器

把「训练用」和「实时引用用」的抓取代理分开处理。想让 AI 在回答里引用你的内容,就不能顺手把它一起挡在门外。

先想清楚取舍再动手。允许训练类爬虫意味着内容可能进入模型的参数记忆;拒绝训练但仍允许检索类爬虫,是「希望被引用但不想贡献语料」的常见折中。两者对引用概率的影响不同,没有通用答案。

快速预设

默认策略:允许检索类与训练类抓取代理,屏蔽后台与接口路径。

站点设置

用于生成 Sitemap 行(留空则不输出)。

部分引擎支持 Crawl-delay,主流 AI 抓取代理多已忽略该指令。

默认已屏蔽后台、搜索、购物车、账户等常见路径,见输出中的注释。

抓取代理

0 允许 / 0 总计
robots.txt

      

上线检查

  • 访问 https://你的域名/robots.txt,确认返回 200 且内容与预期一致。
  • Google 用 Search Console 的 robots.txt 测试工具,Bing 用网站管理员工具,确认解析结果。
  • robots.txt 是建议而非强制,合规的商业爬虫会遵守,恶意抓取不会。敏感内容要靠鉴权或 WAF。
  • 规则按最具体的匹配优先,不要用 Disallow: / 后又指望某个路径例外。
  • 改了 robots.txt 后,被屏蔽的页面需要等重新抓取才会从索引消失,不是立即生效。

常见问题

允许 AI 爬虫会不会影响网站性能?

会占用带宽,但主流 AI 抓取代理通常频率克制。真正需要注意的是自建爬虫或未做频控的抓取方,可以在 WAF 层做速率限制,而不是只靠 robots.txt。

屏蔽 GPTBot 后,我的内容还会出现在 ChatGPT 里吗?

可能仍会。模型对已经进入训练数据的内容有记忆;此外用户手动粘贴链接时触发的实时访问用的是 ChatGPT-User 而非 GPTBot。屏蔽只影响对应代理未来的抓取行为。

Google-Extended 和 Googlebot 是什么关系?

Googlebot 决定常规搜索收录与展示;Google-Extended 只控制内容是否用于 Gemini 的训练与 grounding。屏蔽 Google-Extended 不影响你在 Google 搜索里的排名。