判断采集是否遗漏,不能只看总流量高低,而要把同一批页面在站内统计、搜索引擎报告和第三方估算中的数量与结构对齐。若某个栏目、模板或参数页面在站内统计里明明有访问,却在采集结果中缺失,或者报告中的页面总数明显少于实际可访问页面数,就应优先怀疑采集遗漏。更稳妥的做法是:先确定“应该采到哪些页面”的完整清单,再用可复现的比对方法逐项核验。
遗漏判断的前提是有一个基准清单。这个清单不应来自采集工具自身,而应来自站点可枚举的来源,例如:
把这三类来源合并去重后,得到“预期页面集合”。如果采集结果只是其中一部分,缺失的部分就是遗漏候选。需要说明的是,站点地图和站内统计的口径不同:前者是声明,后者是实际发生,两者都不能单独代表完整范围。
第三方估算流量、搜索引擎报告与站内统计的口径差异很大,直接比总数容易误判。更可靠的是比结构:按栏目、页面模板、URL参数类型分组,看各组页面数量是否成比例。例如,站内统计显示某栏目有200个页面产生访问,而采集结果只覆盖30个,且缺失集中在带分页参数的URL上,这就指向分页采集遗漏,而不是整体流量下降。
可执行的检查项:
如果差集中的URL手动访问正常,却从未出现在采集结果里,遗漏基本可以确认。如果手动访问返回错误或跳转,则属于失效页面,不应计入遗漏。
确认遗漏后,通常有两种处理路径:补采缺失URL,或调整采集规则后整体重采。选择哪一种,取决于遗漏的分布和采集成本。
假设某站点预期页面集合为1000个,采集结果只有850个,差集150个全部集中在带?page=参数的分页URL上。这种情况下补采这150个URL即可,不需要整体重采。反之,如果差集分散在文章页、列表页和标签页中,且每个模板都有缺失,就应检查采集入口是否只覆盖了首页链接,而忽略了站内搜索或标签聚合入口。
要判断采集是否遗漏,最终要落到可验收的交付物上。建议在采集任务开始前就明确:
需要提醒的是,任何单一指标都不能还原搜索算法的完整逻辑,也不能保证采集结果与搜索引擎实际索引完全一致。判断遗漏的依据应是可核对的URL清单和访问记录,而不是流量总数的涨跌。
下一步,先导出站内统计中产生过页面流量的URL列表,与采集结果做一次差集比对,按路径前缀分组查看缺失分布,再决定是补采还是调整规则重采。