搜索引擎抓取,改版或迁移时应核对什么

📍 WDQWDWQD987AAAAA:216.73.217.135
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /0670af77c326.html
📄

搜索引擎抓取,改版或迁移时应核对什么

改版或迁移时,搜索引擎抓取最需要先核对的是:旧地址是否还能被正常访问、新地址是否允许被抓取、以及页面之间的指向关系是否清楚。时间和人手有限时,不要先看排名或流量变化,而应优先保证抓取通道不出错。因为一旦抓取被阻断,后续的收录、索引和流量恢复都无从谈起。建议按“观察—判断—处理—复查”的顺序,把有限的人力放在影响面最大的问题上。

先观察:抓取是否还能到达新页面

迁移后最先要确认的是搜索引擎能否实际请求到页面。可以在服务器日志中查看来自搜索引擎的请求记录,观察它们请求的是旧地址还是新地址,返回状态码是什么。重点看三类结果:

如果日志里几乎看不到搜索引擎的请求,可能是服务器防火墙、CDN或安全策略拦截了抓取,也可能是robots.txt禁止了抓取。注意,robots.txt的限制只影响抓取,不等于可靠的索引移除;即使禁止抓取,旧页面仍可能因外部链接而出现在结果中。

再判断:哪些限制是有意设置的,哪些是误伤

观察之后要区分“主动设置”和“意外阻断”。改版时常见的误伤包括:测试环境的robots.txt被同步到生产环境、页面头部残留noindex、新站启用了登录验证或IP白名单。判断方法是逐项核对:

  1. 打开robots.txt,确认没有误写Disallow: /。
  2. 抽查新页面源代码,确认没有<meta name="robots" content="noindex">。
  3. 用抓取测试工具或直接请求,确认返回的是200而不是跳转到登录页。
  4. 确认站点地图中的地址都是可访问的新地址,但站点地图不保证收录,它只是辅助发现。

如果发现限制是有意保留的,比如某些后台或搜索结果页本就不希望被抓取,可以保留;如果是误伤,应立即处理。

处理:优先修复阻断抓取的项

人手有限时,按影响面排序处理:先修复全站级别的阻断,再处理模板级别的错误,最后处理单页问题。全站级别的问题包括robots.txt误封、全站noindex、服务器持续返回5xx。模板级别的问题包括旧模板的跳转规则写错、分页或筛选参数生成大量无效地址。单页问题则包括个别页面返回404却没有跳转。

处理跳转时,旧地址到新地址应尽量使用301永久跳转,并确保跳转目标返回200。避免跳转链过长,比如A跳到B、B再跳到C,这会增加抓取成本。对于已经删除且没有替代页面的地址,返回410或404比跳转到无关首页更清楚。

复查:确认抓取恢复且没有新的阻断

处理完成后,需要再次观察日志和抓取测试结果。复查项包括:

复查周期取决于站点规模和改版幅度,可以从几天到几周不等。不要因为短期没有收录就反复修改规则,频繁变动反而会干扰抓取判断。如果使用了HTTPS,也要确认证书有效、页面可正常访问;但HTTPS不保证安全无漏洞,也不直接保证排名。

下一步:把核对结果落成一张检查表

建议把上述观察、判断、处理、复查四项做成一张可重复使用的检查表,每次改版或迁移后按顺序勾选。最先勾选的是robots.txt、全站noindex、服务器状态码和跳转规则这四项,因为它们直接决定搜索引擎抓取能否到达新页面。完成这些之后,再去看收录和流量变化,判断才有可靠依据。

图1 图2

nginx