蜘蛛搜索引擎改版或迁移时应核对什么:抓取、索引与旧URL的逐项检查

📍 WDQWDWQD987AAAAA:216.73.216.221
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /a0c85b3d5d8e.html
📄

蜘蛛搜索引擎改版或迁移时应核对什么:抓取、索引与旧URL的逐项检查

改版或迁移时,蜘蛛搜索引擎最需要你核对的是三件事:旧URL是否还能把蜘蛛带到新内容、新页面是否允许被抓取和索引、以及旧地址的权重与流量是否被正确转移。不要只看页面能否打开,而要把“蜘蛛看到什么”和“用户看到什么”分开验证。

先观察:蜘蛛实际访问了哪些地址

改版后出现流量下滑,常见原因不是新页面质量差,而是蜘蛛仍停留在旧URL、旧参数或旧目录上。此时先收集服务器访问日志,筛选主流搜索引擎蜘蛛的User-Agent,观察它请求的URL、返回状态码和请求频率。

日志只能说明蜘蛛来过,不能直接证明收录结果。还需要在搜索引擎的站长平台分别查看各搜索引擎的抓取统计与索引状态,不同搜索引擎的支持和反馈并不一致。

判断:重定向、canonical与robots是否互相矛盾

迁移时最容易出问题的地方,是多个信号指向不同地址。核对时按优先级逐项确认:

  1. 旧URL是否用301跳转到最对应的新URL,而不是全部跳首页。
  2. 新URL的canonical是否指向自己,而不是仍指向旧域名。
  3. robots.txt是否误屏蔽了新目录或整站。
  4. 页面meta robots是否误写成noindex。
  5. 站点地图是否只包含新URL,并返回200。

其中要特别注意:robots.txt的抓取限制不等于可靠的索引移除。被robots.txt禁止抓取的页面仍可能因外链等原因出现在索引中,只是蜘蛛无法读取页面内容。若确实要移除旧页面,应优先用301或410,而不是只靠robots.txt。

另外,站点地图不保证收录,它只是帮助蜘蛛发现URL。HTTPS也不保证安全无漏洞或排名提升,它只是迁移时应当保持一致的协议条件之一。

处理:按页面类型建立映射并逐条替换

不要用一条全站规则处理所有旧URL。先导出旧站可访问URL清单,再按栏目、文章、产品、标签页分类,建立“旧URL→新URL”的一对一映射表。对没有对应新内容的旧URL,明确返回410还是保留并更新。

内链和导航也要同步替换。蜘蛛发现新URL的主要路径是站内链接,如果导航仍指向旧地址,蜘蛛会沿着旧地址反复抓取,新地址的发现速度就会变慢。检查项包括:

假设一个旧栏目页 /old-category/ 迁移到 /new-category/,正确做法是让旧地址301到新栏目页,并让新栏目页canonical指向自身。如果旧地址301到首页,蜘蛛和用户都得不到对应内容,这个迁移信号就是失败的。

复查:用状态码、抓取和索引结果交叉验证

处理完成后不要立即下结论。按以下顺序复查,并记录每次结果:

  1. 用curl -I或浏览器开发者工具检查旧URL返回的状态码和Location。
  2. 确认新URL返回200,页面内容、标题和canonical正确。
  3. 在站长平台提交新站点地图,观察蜘蛛对新URL的抓取量。
  4. 用站点搜索指令或站长平台索引工具,抽查旧URL是否仍被索引、新URL是否进入索引。
  5. 对比迁移前后同一批URL的展现与点击变化,区分是抓取问题、索引问题还是内容竞争问题。

如果旧URL仍被索引,先确认它返回的是301还是200。返回301时,索引更新需要时间;返回200时,说明旧页面仍在参与索引,需要检查canonical和内部链接是否把它当作有效页面。不同搜索引擎处理速度不同,不能用一个平台的结果推断全部。

下一步:从访问日志中导出最近七天的蜘蛛请求,按状态码分组,先处理返回200的旧URL和返回404但仍有外链的旧URL,再提交更新后的站点地图并持续观察抓取与索引变化。

图1 图2

nginx