改版或迁移时,搜索引擎抓取最需要先核对的是:旧地址是否还能被正常访问、新地址是否允许被抓取、以及页面之间的指向关系是否清楚。时间和人手有限时,不要先看排名或流量变化,而应优先保证抓取通道不出错。因为一旦抓取被阻断,后续的收录、索引和流量恢复都无从谈起。建议按“观察—判断—处理—复查”的顺序,把有限的人力放在影响面最大的问题上。
迁移后最先要确认的是搜索引擎能否实际请求到页面。可以在服务器日志中查看来自搜索引擎的请求记录,观察它们请求的是旧地址还是新地址,返回状态码是什么。重点看三类结果:
200:正常返回,说明抓取通道基本通畅。301或302:跳转,需要确认跳转目标是否正确、是否为永久跳转。403、404、5xx:可能阻断抓取,需要优先排查。如果日志里几乎看不到搜索引擎的请求,可能是服务器防火墙、CDN或安全策略拦截了抓取,也可能是robots.txt禁止了抓取。注意,robots.txt的限制只影响抓取,不等于可靠的索引移除;即使禁止抓取,旧页面仍可能因外部链接而出现在结果中。
观察之后要区分“主动设置”和“意外阻断”。改版时常见的误伤包括:测试环境的robots.txt被同步到生产环境、页面头部残留noindex、新站启用了登录验证或IP白名单。判断方法是逐项核对:
robots.txt,确认没有误写Disallow: /。<meta name="robots" content="noindex">。200而不是跳转到登录页。如果发现限制是有意保留的,比如某些后台或搜索结果页本就不希望被抓取,可以保留;如果是误伤,应立即处理。
人手有限时,按影响面排序处理:先修复全站级别的阻断,再处理模板级别的错误,最后处理单页问题。全站级别的问题包括robots.txt误封、全站noindex、服务器持续返回5xx。模板级别的问题包括旧模板的跳转规则写错、分页或筛选参数生成大量无效地址。单页问题则包括个别页面返回404却没有跳转。
处理跳转时,旧地址到新地址应尽量使用301永久跳转,并确保跳转目标返回200。避免跳转链过长,比如A跳到B、B再跳到C,这会增加抓取成本。对于已经删除且没有替代页面的地址,返回410或404比跳转到无关首页更清楚。
处理完成后,需要再次观察日志和抓取测试结果。复查项包括:
200为主。robots.txt和页面noindex是否已恢复为预期状态。复查周期取决于站点规模和改版幅度,可以从几天到几周不等。不要因为短期没有收录就反复修改规则,频繁变动反而会干扰抓取判断。如果使用了HTTPS,也要确认证书有效、页面可正常访问;但HTTPS不保证安全无漏洞,也不直接保证排名。
建议把上述观察、判断、处理、复查四项做成一张可重复使用的检查表,每次改版或迁移后按顺序勾选。最先勾选的是robots.txt、全站noindex、服务器状态码和跳转规则这四项,因为它们直接决定搜索引擎抓取能否到达新页面。完成这些之后,再去看收录和流量变化,判断才有可靠依据。