把已发现页面和未发现页面按“同一批生成逻辑”配对,只改一个变量,才能判断是模板、内链还是内容质量问题。若你手里有一份批量生成的页面清单,先不要按URL顺序抽样,而是按生成批次、模板类型和入口深度分成三组,每组保留已发现和未发现各若干条,再逐组对比差异。
“被发现”至少可能指三种情况:抓取工具访问过URL、页面进入过待抓取队列、或者页面已经出现在索引中。三者不是同一件事。若你只看到抓取日志里有记录,不能直接推断页面会被索引;反过来,抓取量下降也不能单独证明页面被放弃。合理的替代解释包括:抓取预算被其他目录占用、服务器在特定时段返回错误、站点地图更新后尚未被重新读取,或者URL参数导致同一内容被合并处理。
因此划分对照组之前,先固定一个可观察的判定口径。例如以“服务器日志中是否出现过该URL的GET请求”为发现标准,以“站内搜索该标题能否返回该页面”为索引标准。两个口径分开记录,不要混在一张表里。
批量页面通常来自同一套模板或同一批数据导入。如果只按目录分,很容易把“同一模板下的已发现页”和“另一模板下的未发现页”放在一起比较,结论会失真。更稳妥的做法是:
这样做的目的是让“是否被发现”成为组内差异,而不是组间差异。若某一批全部未发现,而另一批全部已发现,那更像是批次级问题,而不是单页级问题。
同一批页面里,已发现和未发现的差异常常出现在入口深度上。入口深度指从首页出发,经过多少次内部链接点击才能到达该页面。你可以手动记录每条对照页的入口深度,并观察以下信号:
如果未发现页全部缺少站内入口,而站点地图里又有它们,那么下一步不是继续提交站点地图,而是先补一条可抓取的内部链接路径。站点地图不保证收录,它只是提示,不能替代站内链接结构。执行这个动作后,观察下一轮抓取记录中是否出现这些URL;若出现,说明入口深度是主要遗漏条件;若仍未出现,再回到模板或内容层面继续对照。
在划分对照组时,先把明显被规则挡住的页面剔除,否则它们会污染结论。检查两件事:
假设你有一批100条页面,其中30条未发现。检查后发现其中12条被robots.txt禁止,8条在抓取时段返回503。那么真正需要对照的未发现页只剩10条。把这10条与已发现页按同模板、同批次配对,才能得到更干净的比较基础。
对照完成后,你会得到一张表:每条未发现页对应一条已发现页,并记录模板、批次、入口深度、状态码、是否有站内链接。根据差异集中在哪里,选择不同动作:
每次只改一个变量,并保留改动前的对照表。下一轮观察时,如果未发现组开始出现抓取记录,说明该变量可能是遗漏条件;如果两组仍然没有分化,说明还有未纳入对照的因素,需要扩大配对范围。不要因为某一轮抓取量归零就断定处理正确,抓取量变化还可能来自时段、日志采样或服务器限流。把对照表保留到至少两轮观察之后,再决定是否继续扩大处理范围。