前两天写过一篇:AI 不推荐你的公司,原因可能在三个层面——它不认识你、它没检索到你、它检索到了但没选你。
今天讲第二层的具体查法,而且是唯一能拿到硬证据的一层:去服务器日志里,看 AI 的爬虫到底来没来过。
这件事的价值在于:前面所有关于”AI 怎么看你”的判断都是间接推测,只有服务器日志是直接证据——谁来了、来了多少次、抓了哪些页面、有没有被你自己挡在门外,全都白纸黑字记着。
我们昨天照着查了自己的站,查出两个问题,其中一个是把所有搜索引擎和 AI 爬虫都影响到的配置错误,而且已经存在了一段时间没人发现。下面把查法和这两个坑一起讲。
第一步:统计各家爬虫的抓取量
找运维或建站方要一份网站访问日志(通常在服务器上,文件名类似 网站域名.log),然后按爬虫标识统计条数就行。
常见的爬虫标识:
- 搜索引擎:
Baiduspider(百度)、Googlebot、bingbot、Sogou(搜狗)、YisouSpider(神马)、360Spider - AI / 大模型相关:
Bytespider(字节系)、GPTBot与OAI-SearchBot(OpenAI)、ClaudeBot、PetalBot(华为)
重点看两件事:哪些完全是 0,以及各家之间的量级差距。某一家长期为 0,说明它根本没在收录你——那么在那个平台上,你做什么内容优化都是空转。
提醒一个容易搞错的地方:统计前先确认日志的时间跨度。我们最初看到某家爬虫只有几十条,以为量很低,后来发现那份日志只有三个小时——折算下来其实是每天几百次,完全正常。拿绝对数字下结论前,先除以时间。
第二步:看爬虫拿到的是什么状态码
这一步是查”有没有被自己挡住”。把每家爬虫的请求按状态码分组:
| 状态码 | 含义 | 要不要紧 |
|---|---|---|
| 200 / 304 | 正常抓到 | 正常,应占绝大多数 |
| 301 / 302 | 跳转 | 少量正常;大量出现要查是不是链接结构有问题 |
| 404 | 页面不存在 | 少量正常;大量意味着它在按错的地址找你 |
| 403 / 444 / 429 | 被拒绝、被限流 | 红灯:你把爬虫挡了,立刻查防护规则 |
| 5xx | 服务器错误 | 爬虫来的时候你的站是坏的,会影响评价 |
如果你像很多公司一样装了防火墙、CDN 或安全插件,这一步是必查的——因为这些防护很容易把高频访问的爬虫当成扫描器。我们之前就差点把搜索引擎的爬虫封掉,靠的是上线拦截规则前先跑了一轮”只记录不拦截”才发现。
第三步:看它抓的是不是”该抓的页面”
这一步最容易被跳过,但很有用:把某家爬虫抓取的地址列出来,看看它把精力花在哪。
我们查自己站的时候发现:某家 AI 爬虫抓的大多是图片、旧文章和一些边缘页面,而我们最近专门优化过的”公司简介”页,它一次都没碰。
这说明一件事:爬虫能进来,不等于它看了你想让它看的东西。如果你刚做完重要页面的优化,却发现爬虫从没抓过那一页,那这次优化在 AI 那边就还没生效——需要通过站点地图和主动提交去引导它。
我们查出的第一个坑:robots 文件里的站点地图全是坏的
顺着上一步往下查”为什么关键页没被抓”,我们去看了 robots.txt——这是每个爬虫进站第一件事就要读的文件,里面会告诉它站点地图在哪。
结果发现里面列了 6 个站点地图地址,全部是失效的:每一个都会跳转,而跳转之后返回的是网站首页的 HTML,根本不是站点地图。
更要命的是:网站真正有效的那个站点地图,压根没有被写进去。
这意味着:每一个来访的爬虫——搜索引擎的、AI 的——读完 robots 文件,拿到的是 6 个无效地址,然后什么有用的都没得到。它只能自己一层层爬链接去发现页面,效率天差地别,而且很容易漏掉新内容和没有内链指向的页面。
这个问题已经存在一段时间了。没有任何报警、网站访问完全正常、后台一切正常——只有主动去查才会发现。
自查方法非常简单,一分钟:浏览器打开 你的域名/robots.txt,把里面每一个 Sitemap: 后面的地址逐个点开。正确的结果应该是一片 XML 代码;如果打开的是网页,那这条就是坏的。
第二个坑:爬虫在按早就不存在的地址找你
我们还发现某搜索引擎爬虫产生了大量 404,把这些地址归类后看出规律——它们是一套完全不属于现在这个网站的地址结构(某种旧的分类和商品页格式)。
这种情况通常有几个来源:网站早年改过版或换过程序、域名以前被别人用过、或者某处还留着指向老地址的链接。
影响:爬虫每天的抓取配额是有限的,它把配额花在一堆不存在的地址上,留给你真实内容的份额就少了。处理办法:量大的话,在站长平台提交死链、或者对这类地址做规范的处理,别让它一直空转。
最后一步:主动去”请”爬虫,别干等
查完之后如果发现某家 AI 或搜索引擎的抓取量偏低,除了修上面这些问题,还可以主动提交。
- 主流搜索引擎都有站长平台,可以提交站点地图、推送新链接、看抓取频次和索引量。
- 做 AI 曝光的,别漏了大模型厂商自家的搜索平台。很多 AI 助手在联网时,用的是自家体系的搜索能力——在那个体系里提交和被收录,比在别处使劲更直接。
- 这类平台大多支持扫码登录,验证站点通常是放一个文件或加一段代码,让技术配合一次即可,之后就能长期用。
顺序上建议:先把 robots 和站点地图修对,再去提交。否则你把爬虫请进来了,它还是拿不到那份”目录”。
十分钟自查清单
| 查什么 | 怎么查 | 正常应该是 |
|---|---|---|
| 站点地图有没有列对 | 打开 域名/robots.txt,逐个点开 Sitemap 地址 |
打开是 XML 代码,不是网页 |
| 哪些爬虫来过 | 让运维按爬虫标识统计日志条数 | 主流搜索引擎与 AI 爬虫都有记录,不该有长期为 0 的 |
| 有没有被自己挡 | 按爬虫分组统计状态码 | 以 200 为主;出现 403/429 立刻查防护规则 |
| 抓的是不是关键页 | 列出某爬虫抓取的地址 | 公司简介、主营服务等重点页应在其中 |
| 404 多不多 | 统计爬虫请求里 404 的占比与地址规律 | 占比低;成规律的大量 404 要处理 |
几个常见疑问
Q:我没有服务器权限,怎么查?
A:找建站方或运维要一份最近的访问日志即可,这是很常规的请求。如果对方给不了,退一步用各家站长平台的抓取统计也能看到大概,只是没有日志那么全。
Q:爬虫抓得多是好事吗?会不会拖慢网站?
A:正常范围内是好事,说明它在积极收录你。如果确实造成压力,正确做法是在站长平台调整抓取频次,而不是用防火墙去封——封了就等于自断收录。
Q:robots 文件里的地址错了,自己能改吗?
A:它就是网站根目录下的一个文本文件,让技术改一下即可,几分钟的事。改完记得再打开确认一次——很多问题就出在”改了但没验证”。
Q:多久查一次?
A:建议每月一次,另外换过主题/插件、迁过服务器、动过防护规则之后必须查。这几个动作最容易在你不知情的时候改变爬虫的访问结果。
想知道 AI 和搜索引擎的爬虫,到底有没有正常抓到你的网站?
思文力得为北京及周边中小企业做官网与 SEO/GEO 内容获客运营:从服务器日志核对各家爬虫的抓取量、状态码与抓取路径,把 robots、站点地图、防护误拦这些”不报警但一直在漏”的问题修好,再到各家站长平台做提交与监测,按月出对照报告。文中这两个坑,就是我们照着这套流程在自己站上查出来的。访问 siwenlide.com 或拨 400-686-2011 聊聊。





