排查重复页面,核心是先用 site: 查询、抓取日志和页面源码比对,确认重复的具体形态——是完全相同的URL参数、还是内容高度相似的不同路径,再决定用 canonical、重定向还是参数处理。不要一上来就批量提交删除,先收集证据,否则容易误伤有排名的正常页面。
“重复页面”在实操中至少对应三种情况,判断错了,后续动作全是白费。
www、带与不带结尾斜杠、大小写不同。特征是页面源码几乎逐字一致,只有地址不同。?page=2、?sort=price、?utm_source=。内容主体相同,只有排序或筛选结果略有差异。判断依据是“打开两个地址,正文是否实质相同”。如果只是部分模块相同(比如页头、页脚、侧边栏),不算重复页面问题,属于模板共性,不需要处理。
以下步骤按顺序做,每一步都能缩小范围。
site:你的域名 加一段正文里的独特句子,看返回多少条结果。返回多条指向不同 URL,说明确实存在索引层面的重复。<link rel="canonical">。如果每个页面都指向自己,说明 canonical 没有起到合并作用;如果缺失,说明根本没声明首选版本。<title> 和 <h1>。完全一致往往意味着程序模板直接复用了同一套字段。curl -I 查看状态码。如果两个地址都返回 200,属于并存;如果一个 301 到另一个,说明已经做过处理,只需确认方向是否正确。假设某商品页可以从 /product/123 和 /category/shoes/product/123 两个地址访问,两者都返回 200 且 canonical 各自指向自己。这就是典型的路径重复,需要把其中一个设为首选,另一个 301 或加 canonical 指向首选。
不同手段的代价和适用条件差别很大,选错会浪费抓取预算甚至丢失权重。
选择顺序建议是:先判断重复 URL 是否有独立搜索需求。有需求就做差异化或 canonical;没有需求且不应被访问,就用 301;只是参数变体,优先用参数规则处理,不动正文。
处理完重复页面后,不要用一两天的数据判断效果。搜索需求本身会随季节波动,节假日、促销期、行业淡旺季都会影响展现和点击。数据采集口径也可能变化,比如统计工具对过滤流量的定义调整。比较时应固定同一时间段长度、同一设备类型、同一地区,并同时观察抓取频次和索引数量,而不是只看排名或流量数字。
如果处理两周后索引中重复 URL 数量没有下降,先回到第一步重新确认 canonical 是否被正确输出、重定向是否返回 301 而非 302,再考虑是否需要调整策略。下一步可以从抓取日志中导出最近一个月被频繁抓取的参数 URL 列表,逐条核对它们是否还有存在的必要。