判断采集是否遗漏,核心不是看抓取总量,而是把“已知应存在的URL集合”与“实际采集到的URL集合”做差集。最直接的做法是:用站内链接、站点地图、日志和数据库各生成一份URL清单,两两对比,差集就是疑似遗漏。时间和人手有限时,优先处理差集中被内链指向、返回200状态码、且与核心业务相关的URL。
没有基准清单,就无法谈遗漏。网站资产分析里,基准来源至少要有三类,互相补位:
查法:分别导出为纯文本,每行一个URL,统一去掉参数、锚点和末尾斜杠后再比较。结果说明:如果某个URL只在数据库里出现,站内链接和站点地图都没有,它很可能从未被采集发现。
站点地图和链接清单是“声明”,日志才是“实际发生过什么”。在网站资产分析中,日志是判断采集遗漏最硬的证据。
判断结果:差集中的URL如果返回200、有内链、且不在robots禁止范围内,却从未出现在日志里,才属于高优先级疑似遗漏。若日志显示被请求但状态码异常,问题在可访问性,不在采集覆盖。
很多遗漏不是采集方漏掉,而是入口被自己挡住。逐项核对:
robots.txt是否禁止了目录或参数。noindex。查法:对差集中的URL逐一查看HTML源码中的meta robots、canonical和链接形式。结果说明:若发现noindex或robots禁止,先确认这是有意设置还是配置错误,再决定是否放开。技术示例中提到的标签应写成<meta name="robots">这类转义形式核对,而不是直接复制到页面。
同一现象可能有多种解释,不能只凭一个指标下结论。日志里出现过、后来消失的URL,可能是采集后因内容质量、重复或状态变化被移除;从未出现过的URL,更可能是发现环节遗漏。判断方法:
结果说明:只有“应存在、可访问、有内链、从未被请求”的URL,才应排在最前面处理。
人手有限时,不要平均用力。给差集中的URL打分,优先处理同时满足以下条件的:
满足越多,越可能是真正的采集遗漏。反之,孤立页面、低价值参数页可以延后。下一步:从差集中挑出得分最高的20条URL,逐条检查入口、状态码和robots设置,确认后补充内链或调整站点地图,再观察日志中是否出现新的请求记录。