先给结论:中断后不要凭“扫到第几页”或“跑了多久”判断覆盖范围,而要把扫描对象拆成可枚举的清单,再用已产出的记录反推哪些清单项确实出现过。只有清单项与产出记录能一一对应,覆盖范围才成立;对不上的部分应视为未覆盖,重新安排一次小范围补扫,而不是直接续跑整站。
这里说的前提是:你已经在用百度推广工具做一次面向全站的批量扫描或批量查询,任务中途被停止、超时或主动打断。关键变化在于,全站扫描从“一次跑完”变成“分段跑完”,判断逻辑也必须从看进度条改为看清单对账。
最常见的困惑是:任务运行时间已经不短,导出文件也有不少行,但拿去做后续分析时,仍感觉关键对象缺失。这通常有两种解释。
这两种解释对应完全不同的下一步:前者只需补齐导出或去重口径,后者必须重新规划扫描范围。
能区分上述解释的核心证据,是“对象清单”和“产出记录”的对应关系。做法是:
如果缺失对象集中在清单尾部或某个分组,更支持“队列未跑完”的解释;如果缺失对象分散且无规律,同时产出文件里存在字段空白或重复合并,更支持“产出被截断或去重”的解释。这个判断不依赖任何具体工具的按钮位置,只依赖两份清单本身。
实际动作:先做一次小范围补扫,只针对缺失最集中的那一组对象。补扫结果如果与已有记录能拼成完整清单,说明原扫描只是未跑完;如果补扫后仍大量缺失,说明问题出在产出或口径,而不是扫描进度。
假设某账户理论上应覆盖 200 个关键词,中断后导出记录为 120 条。若缺失的 80 条全部集中在最后两个单元,且这两个单元在扫描顺序中排在后段,那么“未跑完”的可能性更大,下一步应只补扫这两个单元。若缺失的 80 条分散在所有单元中,且导出文件里同一关键词出现多次,那么更可能是去重或字段截断问题,下一步应先核对导出口径,而不是重跑全站。以上数字仅为说明比较方法,不代表任何真实账户的规模。
请求量、抓取量或导出条数归零,都不能单独证明扫描已经覆盖完整。归零还可能来自:任务被限流、账号权限变化、对象本身为空、导出条件设置过窄。反过来,导出条数很多也不等于覆盖完整,因为同一对象可能被重复记录。判断覆盖范围时,应把“数量”当作线索,把“清单对账”当作依据。
上述方法适用于对象可以被枚举、且每个对象有稳定标识的场景。如果扫描对象本身是动态变化的,例如扫描期间账户结构被修改,那么中断前后的清单可能已经不一致,此时应先固定一份扫描时点的对象清单,再判断覆盖范围。若无法固定清单,覆盖范围只能给出近似结论,并需要在后续分析中标注这一限制。
具体工具当前支持哪些导出字段、是否保留中断前的部分结果,需要以你实际使用的版本和账户权限为准,不能凭通用描述推断。判断覆盖范围时,先对账、再补扫、最后确认口径,比直接续跑整站更可靠。