官网robots.txt配错了,AI爬虫来了发现啥都不让看直接走了

今年上半年有个客户来找我,说他公司做了GEO优化,官网改版花了两万多,内容也更新了几十篇行业文章,结果三个月过去了,用DeepSeek和ChatGPT搜公司名字,完全搜不到。他百思不得其解,以为内容质量不够好,又花钱请人写了一批文章,还是没用。

我让他把官网的技术配置发给我看看。打开robots.txt文件一看,问题一目了然。文件里赫然写着 Disallow: / ,这一行代码的意思是禁止所有爬虫抓取全站所有页面。一问才知道,官网是去年底找外包公司开发的,开发阶段为了防止搜索引擎收录未完成的页面,在robots.txt里写了全站禁止。开发完了上线的时候,外包团队忘了把这行删掉,robots.txt里一直留着Disallow: /。

说白了,这行代码就是一个”禁止入内”的牌子。传统搜索引擎的爬虫看到它绕道走,AI搜索引擎的爬虫看到它也绕道走。你的网站写得再好,内容再丰富,爬虫压根不进来,怎么可能收录你?今天我就把robots.txt这个容易被忽视的文件讲清楚,别让一行代码毁了你的GEO布局。

这种低级错误我碰过不止一次,很多企业官网都有类似的配置问题。下面我从几个角度说说。

robots.txt到底是什么东西

robots.txt是放在你网站根目录下的一个纯文本文件,它的作用是告诉爬虫哪些页面可以抓取、哪些不可以抓取。你可以把它理解成网站大门的告示牌,爬虫来了先看告示牌,告示牌上写”禁止入内”它就不进去,写了”可以参观”它才进来抓取内容。

这个文件的规则其实很简单。每条规则由两个部分组成,一个是User-agent,指定这条规则对哪个爬虫生效;另一个是Disallow或Allow,指定禁止或允许抓取哪些路径。比如你想允许所有爬虫抓取所有页面,就写 User-agent: * 然后 Disallow: 留空就行。你想禁止所有爬虫抓取全站,就写 Disallow: / 斜杠代表根目录下所有内容。

问题往往出在开发阶段。很多开发者为了防止测试环境被搜索引擎收录,会在robots.txt里写 Disallow: / 把全站屏蔽掉。等网站正式上线了,如果开发者记得改回来还好,忘了改的话这个”禁止入内”的牌子就一直挂着。传统搜索引擎的爬虫可能还会通过其他渠道发现你的网站,但AI搜索引擎的爬虫更依赖robots.txt的许可,看到禁止直接走人。

我那个客户的robots.txt就是这种情况。外包团队在开发阶段写了全站禁止,上线后没删。我帮他检查的时候,这个文件已经挂着半年了,意味着半年里没有一个爬虫能正常抓取他的网站内容。他之前做的所有GEO优化,写文章、改标题、加结构化数据,全是白费功夫,因为爬虫根本进不来。

AI搜索引擎的爬虫和传统爬虫有什么不同

你可能会问,百度的爬虫不是一直能来吗?为什么AI搜索引擎的爬虫不来了?这里有个关键区别。

传统搜索引擎比如百度和Google,它们的爬虫会通过多种渠道发现你的网站。你提交了网址、别人外链了你的页面、你做了sitemap提交,百度爬虫就会来。就算robots.txt配了某些限制,百度的爬虫有时候还是会在索引层面做处理,不一定完全不收录你。所以有些客户的网站robots.txt配错了,百度上还能搜到,他们就没当回事。

但AI搜索引擎的爬虫不一样。ChatGPT用的爬虫叫GPTBot,Perplexity用的叫PerplexityBot,Claude用的叫ClaudeBot,还有Google的AI爬虫叫Google-Extended。这些爬虫对robots.txt的遵从度非常高,你在robots.txt里没有明确允许它们进来,它们就不来。不像百度爬虫有时候还会”不请自来”,AI爬虫是典型的”不见邀请函就不进门”。

更关键的一点是,AI搜索引擎目前不会通过sitemap提交来发现你的网站。传统搜索引擎你可以在百度站长平台提交sitemap,主动告诉爬虫你的页面列表。但AI搜索引擎目前没有统一的sitemap提交入口,它们主要靠自主爬取和第三方数据源来发现内容。这意味着如果你的robots.txt挡住了AI爬虫,你几乎没有任何补救手段让AI知道你的内容存在。

我那个客户之前百度的收录还在,他就以为网站没问题。但用AI搜索引擎搜公司名字搜不到,他才开始着急。一查robots.txt才发现根本原因。这个错误让他白白浪费了三个月的内容投入和GEO优化费用。

robots.txt常见的配置错误有哪些

Disallow: / 这种全站禁止是最极端的错误,但还有一些更隐蔽的配置问题也会影响AI收录。

一种是部分路径禁止。比如有些网站把Disallow: /admin/ 配上了,这本身没问题,后台管理目录本来就不该让爬虫抓。但有的开发者在配置的时候路径写宽了,写成了 Disallow: /a 结果把所有以a开头的路径全禁了。还有一种是把Disallow的路径写成了动态参数,比如 Disallow: /*? 本意是禁止带参数的页面,但实际上把很多正常的内容页也禁掉了。

另一种是没有为AI爬虫单独配置Allow规则。有些网站的robots.txt默认是禁止所有爬虫的,但单独为百度和Google开了白名单。比如写了 User-agent: Baiduspider 然后下面的Disallow留空,表示允许百度爬虫。但没有写GPTBot、PerplexityBot这些AI爬虫的规则。AI爬虫看到User-agent列表里没有自己,又看到默认规则是禁止,就不来了。

还有一种更难发现的,是服务器返回了错误的robots.txt状态码。正常情况下访问 yourdomain.com/robots.txt 应该返回200状态码和文件内容。但有些网站配置问题导致访问robots.txt返回404或者500错误。AI爬虫拿不到有效的robots.txt,有些会选择保守策略直接不抓取,有些会按”无限制”处理。不同爬虫的处理策略不一样,但404肯定不是你想要的结果。

我帮客户排查的时候还碰到过一个很无语的情况。网站的robots.txt文件存在,内容也没问题,但是服务器对robots.txt设置了noindex的响应头。爬虫虽然能读到文件内容,但响应头告诉它不要索引,结果还是不收录。这种配置层面的冲突需要查看服务器的HTTP响应头才能发现,普通企业老板根本想不到去查这个。

怎么检查和修复robots.txt问题

如果你怀疑自己的官网也有robots.txt问题,我教你几个检查方法。

先直接访问。在你的浏览器地址栏输入你的域名加上 /robots.txt,比如 www.yourcompany.com/robots.txt。如果你看到 Disallow: / 单独一行,那恭喜你中招了,这就是全站禁止。如果你看到的内容是正常的 Allow 或者 Disallow 后面跟的是具体路径而不是单独一个斜杠,那基本没问题。如果你访问这个地址返回404,说明你的网站根本没有robots.txt文件,这种情况下大部分爬虫会按”无限制”处理,但建议你还是创建一个标准的robots.txt。

再检查AI爬虫规则。在你现有的robots.txt里看看有没有为AI爬虫写明确的允许规则。理想的配置是这样的:为GPTBot、PerplexityBot、ClaudeBot、Google-Extended分别写一段 User-agent 然后下面 Disallow 留空表示全站允许。或者如果你不想写这么细,就在 User-agent: * 的默认规则里把 Disallow 留空,表示对所有爬虫开放全站。但如果你有需要保护的路径比如后台管理目录,就在默认规则里单独配 Disallow: /admin/ 这类。

还有一个检查点容易被忽略,就是确认你的robots.txt文件能够被正确返回。你可以用浏览器的开发者工具看网络请求的响应状态码,确认返回的是200。如果返回301重定向,看看重定向到的地址是否能正常返回200内容。有些网站的robots.txt被重定向到了首页,爬虫拿到的其实是HTML页面而不是robots.txt文本,这种配置也会导致爬虫行为异常。

我那个客户修复了robots.txt之后,大约两到三周,AI搜索引擎开始抓取他的网站内容了。GPTBot是最早来的,大概修复后第10天就开始抓取。PerplexityBot稍晚一些,第三周才开始来。ClaudeBot来得最慢,将近一个月才出现。AI爬虫的抓取频率和收录速度比传统搜索引擎慢不少,需要你多一点耐心。但前提是robots.txt必须配对,否则等再久也没用。

说到底,robots.txt是GEO布局的地基。你的内容再好、结构化数据做得再规范、文章写得再专业,如果robots.txt这一行代码配错了,AI爬虫根本不进来,后面的一切都是零。我建议每个做了GEO优化的企业都先检查一下自己网站的robots.txt,特别是找外包公司做的网站,开发阶段的临时配置忘了删的情况太常见了。一行 Disallow: / 就能让你的GEO投入全部打水漂。如果你不确定自己的robots.txt配得对不对,可以先免费咨询一下,几分钟就能帮你看出来。


需要相关服务?联系我们免费咨询

九五星球企服提供公司注册、代理记账、商标注册、财税咨询、高新申报、网站开发等一站式企业服务。可以先免费咨询看看,觉得合适再合作,不推销。

官网:www.95planet.com

免费小工具推荐:

联系方式:

  • 电话/微信:18910232032
  • 扫码添加专业经营合规顾问,免费咨询 ↓
扫码添加微信免费咨询