先给结论:报告页数通常不等于实际对象数量,因为一个对象可能跨页、被重复抓取,或按不同粒度(域名、URL、关键词)各计一次。去重的正确起点不是改报告,而是先定义“一个对象”在本次查询里指什么,再用稳定标识逐层比对,而不是用页码或行号当唯一依据。
报告页数由分页机制决定,受每页条数、排序方式和导出批次影响;对象数量由你定义的统计单位决定。两者本来就不该相等,出现不一致并不必然代表工具出错。
常见的三种合理解释:
如果只盯着页数去重,会把上述三种原因混在一起,越改越乱。因此第一步是确认你真正想数的对象是哪一层。
以下为假设情境,仅用于说明比较方法,不代表任何真实项目结果。假设你导出三页数据,每页 50 行,共 150 行,但你认为自己只查了 120 个 URL。差出的 30 行需要解释,而不是直接删掉。
这一步的实际动作是:先算唯一标识数量,再决定删哪些行。如果重复集中在跨页边界,说明是分页重叠;如果重复分散且每行关键词不同,说明是粒度混计。两种结论对应完全不同的下一步。
数量对不上只是现象,位置才是指纹。可以用下面这组可核对证据区分:
只有把重复位置和字段差异对上,才能判断是工具侧的分页问题,还是你自己口径没统一。若证据同时支持两种解释,应优先按更保守的口径重算一次,再比较差异是否收敛。
去重不是简单删行,而是决定保留哪一条代表记录。建议保留规则:
执行后你会得到两个数:唯一对象数和原始行数。两者的差额应当在后续查询中保持稳定;若每次差额都在变,说明分页或查询时点仍在影响结果,此时应先固定查询条件再谈去重。
如果你的目标是看关键词覆盖广度,那么“关键词加 URL”的组合本身就是对象,重复行是正常信息,不该删。反之,如果目标是评估有多少个页面参与排名,就应以 URL 为唯一对象。先明确用途,再决定去重粒度,否则会把有用信息当成噪声清掉。
对具体工具的分页上限、导出字段和去重能力,不同版本可能不同,需要以你实际使用的界面和导出文件为准逐项核对,不要默认它与某种通用规则一致。把口径写下来、固定标识、记录差额变化,这三步做完,页数与对象数量不一致就从异常变成了可解释的常态。