检查重要页面是否被发现,核心是确认搜索引擎爬虫有没有实际抓取过这些URL。最直接的做法有两种:一是查服务器日志,看爬虫是否访问过;二是在站内给目标页面建立可爬取的入口链接,观察后续是否被抓取。两者不是互相替代,而是先看日志定位现状,再用站内入口解决“没被发现”的问题。
被发现指爬虫至少访问过一次该URL;被收录指搜索引擎把它放进索引并可被检索。日志里出现抓取记录,说明页面已被发现,但不等于一定收录。反过来,页面能被搜到,基本说明它已被发现和收录。检查时先确认你要解决的是哪一个,否则容易把收录问题误判成发现不了。
适合已有一定流量、能拿到访问日志的电商站。执行步骤:
Googlebot、Bingbot 的记录。200 表示正常抓取,404、301、403 分别指向页面不存在、跳转、被拒绝。判断结果:日志里有 200 记录,说明该页面已被发现;完全没有记录,可能是入口太深、链接不可爬或被规则拦截,需要进一步排查。代价是日志分析需要一定技术门槛,且只能反映过去,不能保证未来。
适合新页面、改版页面,或日志里找不到记录的情况。执行步骤:
<a> 标签能到达的路径,避免只靠JavaScript跳转。nofollow 或 robots.txt 屏蔽。判断结果:抓取测试能正常返回页面内容,且站内路径通畅,说明具备被发现的条件;若测试返回异常,先修复技术问题再谈发现。代价是主动提交不等于一定被抓取,仍需结合站内链接结构。
如果你能拿到日志且页面已上线一段时间,先用方案一,成本低、结论直接。如果是刚上线的新页面,或日志里完全没有目标URL,先用方案二补齐入口,再用方案一验证。选择步骤可以简化为:
比较时要注意,改动前后对比要考虑季节和搜索需求变化,不能只看单日数据波动。假设某分类页在日志中连续两周无抓取,同时站内入口被 nofollow 屏蔽,那么优先解除屏蔽并恢复链接,而不是反复提交URL。
200,而非跳转或错误页。robots.txt 是否允许抓取该路径。nofollow 或脚本事件替代。下一步:挑一个你最重要的商品或分类页,先查最近七天的日志记录;如果没有抓取痕迹,再检查它的站内入口链接是否可点击、是否被屏蔽。