核对抓取限制,不是先改 robots.txt,而是先确认搜索引擎到底能不能、有没有、愿不愿意抓取你的页面。第一次接触这个问题时,最容易踩的坑是:看到页面没排名,就怀疑内容质量,却忽略了抓取环节早已被拦住。正确的起点是:用搜索引擎官方提供的抓取工具,分别检查“是否允许抓取”“是否已抓取”“抓取后是否被索引”三个环节,再决定下一步动作。
很多人把“排名优化”直接等同于改标题、加关键词、发外链。但如果页面从未被抓取,后续所有优化都不会生效。抓取限制可能来自多个层面:服务器返回错误状态码、robots.txt 规则拦截、页面设置了 noindex、内链结构太深导致爬虫到不了。这些原因中,只有 robots.txt 和 noindex 属于“人为限制”,服务器错误和链接深度属于“技术障碍”。判断时要区分:前者是主动屏蔽,后者是被动阻断,处理方式完全不同。
以常见搜索引擎为例,可以在其站长平台找到“网址检查”或“抓取测试”类工具。输入目标 URL 后,工具会返回该页面对应爬虫的抓取状态。重点看三项:
noindex 标签或 X-Robots-Tag 响应头。如果这三项都正常,说明“允许抓取”这一关已通过。如果 robots.txt 显示屏蔽,但你不记得设置过,需要检查是否有插件、CDN 或服务器配置自动生成了限制规则。假设某页面在 robots.txt 中被 Disallow: /private/ 覆盖,而该页面恰好放在 /private/ 目录下,就会被拦截。此时要么移动页面路径,要么修改规则并重新测试。
允许抓取不等于已经被抓。可以在站长平台的“已编入索引”或“抓取统计”报告中查看该 URL 的状态。常见状态包括:
如果状态是“已发现,尚未抓取”,不要急着改内容。可以先检查内链:是否有其他已收录页面链接到该 URL?如果没有,爬虫可能缺少发现路径。可以手动在站长平台提交该 URL 请求抓取,观察几天后的状态变化。注意,提交抓取只是“请求”,不保证一定被抓或一定被索引。
下面这份清单可以帮助你逐项排除,避免把索引问题误判为抓取问题:
curl -I 或浏览器开发者工具查看响应头。/robots.txt 核对规则。<meta name="robots" content="noindex">?查看源代码搜索 noindex。X-Robots-Tag: noindex?在开发者工具的 Network 面板查看。这份清单的适用条件是:你已经确认页面内容本身没有质量问题,且网站没有被整体惩罚。如果站点大面积不收录,需要先排查服务器稳定性和整体 robots.txt 规则,而不是逐个页面检查。
解除抓取限制后,不要只看第二天有没有排名。抓取和索引的恢复需要时间,且排名变化受搜索需求、季节波动、竞争对手更新等因素影响。比较时至少看两个维度:一是站长平台中该 URL 的状态是否从“已屏蔽”变为“已编入索引”;二是该页面在搜索中的展现量是否从零开始出现。如果状态变了但排名没动,说明抓取环节已解决,下一步才轮到内容与链接优化。
下一步建议:打开你所用搜索引擎的站长平台,找到网址检查工具,输入一个你认为有排名问题但不确定是否被抓的页面,记录它的 robots.txt 状态、响应码和索引状态。根据返回结果,对照上面的清单决定是修改规则、提交抓取,还是转向内容优化。