先给结论:中断后不要凭“跑到第几页”或“还剩多少条”判断覆盖范围,而要回到扫描前定义的输入清单,逐项标记状态,再用抽样复核确认边界。工具推荐在这里的意义不是换一个更强的工具重跑,而是选一个能把输入清单、完成状态和已产出结果分开保存的工具,让中断点可核对。
假设一次全站扫描在运行中途被中断。操作者看到进度条停在某个位置,认为大部分页面已经处理;审核者打开结果文件,却发现大量条目缺失,认为覆盖远远不够。两人都没有说谎,分歧来自各自盯住的指标不同。
这类分歧在多人协作中很常见:一方按任务进度理解覆盖,另一方按结果完整度理解覆盖。如果不把两者拆开,后续无论补跑还是直接使用结果,都会建立在错误前提上。
第一种解释是中断发生在采集阶段。工具还没来得及请求或解析那部分输入,因此结果里根本没有对应条目。这种情况下,缺失是真实的,补跑必须从输入清单的未处理项开始。
第二种解释是中断发生在写入或导出阶段。工具已经完成采集,但结果尚未落盘、去重或合并,于是进度显示靠前,结果文件却偏少。这种情况下,缺失是表面现象,重新采集可能重复消耗资源,正确动作是先找回中间产物。
两种解释对应的补救方向相反:前者要补采集,后者要补写入。判断错方向,要么白跑一遍,要么留下永久缺口。
能区分这两种解释的证据,不是进度百分比,而是输入清单的逐项状态。扫描前如果已经把待处理对象拆成可枚举的条目,例如按栏目、按站点地图分段或按词表分批,中断后就可以逐项标记“已完成、处理中、未开始”。
抽样复核是第二层证据。从已标记完成的输入项中抽取若干条,回到结果文件里查找对应输出;再从结果文件中反向抽取若干条,确认它们能对应到输入清单。正向和反向都能对上,覆盖判断才成立。只做单向核对,容易把“结果里有”误当成“输入都处理过”。
面对关键词挖掘工具推荐,很多清单只比较词库规模或导出格式。但对中断场景来说,更该比较的是可恢复性:是否保留输入清单、是否区分任务状态与结果状态、中断后能否从断点继续而不是整批重来。具体工具是否具备这些能力,需要以实际版本和实际配置为准,不能凭类别印象推断。
一个可操作的判断方法是:在正式全站扫描前,先用一小段输入做一次中断演练。主动停止任务,然后检查三件事——输入清单还在不在、已完成项能否识别、结果文件是否与已完成项一致。演练结果决定下一步:如果三项都能核对,正式扫描可以放心分段执行;如果只能看到进度条,就应该先调整流程,把输入清单和结果文件分开保存,再开始正式任务。
多人对同一事实理解不同时,有效的做法不是争论谁记得更准,而是把分歧写成可勾选的项目:输入条目清单、每项状态、结果文件对应关系、抽样复核记录。中断后的覆盖范围,最终由这些项目共同决定,而不是由任何一个人的印象决定。完成这一步之后,补跑范围、是否复用中间结果、是否需要更换工具,都会变成有依据的选择。