用网站收录查询工具时,先分清两件事:访问抓取是搜索引擎爬虫来读取了页面,索引结果才是页面被写入可检索的数据库。前者只说明“来过”,后者才说明“能出现在搜索结果里”。判断时,抓取看日志和抓取统计,索引看站点查询与页面级状态,两者不能互相替代。
在动手查之前,先确定你面对的是哪类问题,因为两种方案的适用条件不同。
判断依据是:抓取是索引的前置条件,但不是充分条件。抓取成功不等于一定被索引,索引出现也不代表每次抓取都成功。把两者混在一起看,容易误判。
最关键的一步是把“抓取证据”和“索引证据”分开记录,不要用同一个数字下结论。
site: 配合具体 URL 做粗查,再进入页面级检查工具看该 URL 的索引状态。粗查可能受查询方式影响,页面级状态更接近单页判断。<meta name="robots"> 是否写了 noindex,检查 HTTP 响应头中的 X-Robots-Tag。noindex 会阻止索引,但不一定阻止抓取。假设一个页面日志里有大量 200 抓取记录,但页面级状态显示未索引。此时不能断言“抓取没问题所以是内容问题”,因为还可能是 noindex、规范化指向了别的 URL、页面内容与主站高度重复,或该页面被判定为低价值。需要逐项排除,而不是只归因于一个原因。
验证时把抓取和索引做成对照,比只看一个指标可靠。
robots.txt 的抓取限制不等于可靠的索引移除。被 robots.txt 禁止抓取的 URL,如果已被其他页面引用,仍可能以无摘要形式出现在结果中。站点地图不保证收录,它只帮助发现 URL。HTTPS 不保证安全无漏洞,也不直接保证排名。不同搜索引擎的支持情况须分别核查,不能用一个平台的结果推断另一个平台。
抓取与索引的状态会随页面改版、服务器调整和规则变化而改变。维护时固定三件事:定期抽样查看日志中的爬虫返回码;对重要 URL 保留页面级索引状态记录;每次修改 robots.txt、canonical 或 noindex 后,重新验证一次抓取与索引,而不是改完就假定生效。
下一步:挑一个当前有疑问的 URL,先记录它的最近抓取状态码,再查它的页面级索引状态,把两项结果并排写下来,再决定是修抓取还是修索引。