抓取、索引和排名是三件先后发生但彼此独立的事:抓取是搜索引擎的爬虫请求了你的网址;索引是搜索引擎把页面内容存入可供检索的数据库;排名是用户搜索某个词时,页面出现在结果中的位置。判断三者,最直接的办法是分别找证据——抓取看服务器日志和爬虫访问记录,索引看站内页面能否被搜到,排名看具体查询词下的实际位置。三者不会自动同步,抓取成功不等于被索引,被索引也不等于有排名。
抓取阶段,搜索引擎只做了“取回内容”这个动作。它可能取回了页面,也可能因为服务器返回错误、robots 规则、超时等原因没取到。索引阶段,搜索引擎要判断这个页面是否有价值、是否重复、是否应该进入可检索集合。排名阶段,则是在已经索引的页面里,针对某个查询词做相关性排序。
这意味着一个常见现象完全合理:日志里天天有爬虫来,但站内搜索页面标题却找不到;或者页面能被搜到,但搜目标词时排在第 5 页。前者是抓取与索引脱节,后者是索引与排名脱节。判断起点不同,后面的动作就完全不同。
抓取层面的检查项最硬,因为它有原始记录可查。可以按下面的顺序做:
验收信号是:目标 URL 在日志中有明确记录,且返回 200。如果只有首页被抓、内页从没出现,那问题在抓取入口或链接结构,不在排名。如果返回 5xx,先修服务器;如果返回 404,先确认 URL 是否写错或页面已删除。这一步的判断结果只有“抓到了”和“没抓到”两类,不要和收录混在一起看。
索引层面的检查,核心是回答“这个页面是否在可检索集合里”。可行做法:
site: 加具体 URL 做查询,观察返回的是目标页本身,还是只返回了首页或近似页面。验收信号是:搜索独特文字时,目标 URL 直接出现在结果中。如果日志显示抓取正常,但站内搜索始终找不到,优先排查是否被 robots 的 noindex 规则挡住、是否与已有页面高度重复、是否缺少内链导致长期不被重新处理。索引不是即时动作,判断时要给页面留出重新处理的时间,但不要用“再等等”掩盖明确的 noindex 或重复问题。
排名必须绑定具体查询词才有意义。脱离词谈排名,等于没有结论。可执行的检查步骤:
验收信号是:对某个确定的词,目标页稳定出现在自然结果的前若干位,而不是偶尔出现又消失。如果页面已被索引但目标词下完全找不到,问题在相关性或竞争度;如果位置在几十名之外,说明页面已进入排序池但竞争力不足。排名波动是常态,单次观察不足以判断趋势,应记录多次结果再下结论。
遇到“页面没流量”这类问题时,按抓取、索引、排名的顺序排查,可以避免在错误环节上浪费动作:
这套顺序的适用条件是:你有一个明确的目标 URL 和至少一个明确的查询词。没有目标词时,只能判断抓取和索引,无法判断排名。判断结果也要分开记录,不要用“没收录”概括“没排名”,这两者的修复方向完全不同。
下一步:挑一个你最关心的页面,先查它最近一周的爬虫日志记录,再用页面里的独特短句做一次站内搜索,最后固定一个查询词记录当前位置。三个结果分别写下来,就能确定当前卡在哪个环节。