合并两个答案相近的页面,目标通常不是把两份内容拼成一份更长的文档,而是让合并后的页面覆盖原来两个页面各自能回应的搜索意图。判断独有信息是否值得保留,可以按一个顺序做:先列出两页各自独有的可验证信息,再判断这些信息是否服务于同一批搜索需求,最后决定是并入主页面、改写成独立段落,还是迁移到另一个更合适的页面。下面用一个假设情境把决策过程拆开。
假设一个站点有两个页面,A页讲“某类设备日常维护”,B页讲“同类设备故障排查”。两页有大约六成段落高度相似,都提到清洁周期、检查项和常见异常。A页独有一段讲“不同使用环境下的维护间隔差异”,B页独有一段讲“异常出现后先做哪三项检查”。如果直接把B页内容全部并入A页,再301跳转,合并后的页面会同时承载维护和排查两个方向,可能让原本清晰的段落结构变乱。此时更值得追问的是:这两段独有信息是否回答同一类问题?如果不是,合并本身可能不是最优动作。
可区分的原因大致有三类。第一类,独有信息是同一问题的条件分支。例如维护间隔随环境变化,这仍然属于“日常维护”意图,适合并入主页面,放在维护周期段落之后。第二类,独有信息是另一个动作阶段。例如故障出现后先检查什么,这更接近“故障排查”意图,强行并入维护页会让读者在维护语境里突然进入排查流程。第三类,独有信息只是表述差异或同义改写,没有新增判断依据,这类内容合并时可以舍弃,不必为了保留字数而保留。
一个实际动作是:把两页的独有段落各写成一句话摘要,再分别问“用户搜索哪类词时会需要这句话”。如果两句话指向同一组搜索词,合并后放在同一页面是合理的;如果指向两组不同搜索词,保留两个页面或把其中一段迁移到更匹配的页面,通常比硬合并更稳妥。这个动作的结果会直接影响下一步:指向同一意图时,下一步是设计合并后的段落顺序;指向不同意图时,下一步是决定保留、改写还是迁移,而不是继续合并。
如果确认两页属于同一意图,可以按以下顺序处理独有信息,避免在合并过程中丢失。
其中第三步是关键动作:当独有信息找不到合适小节时,不要为了“不浪费”而新开一个勉强的小节。更合理的做法是把它迁移到真正匹配的页面,或者在主页面中用一句限定说明带过。这个判断会影响后续是否还需要保留另一个页面。
个别样本中,合并相似页面后主页面表现变好,容易被总结成“相似页面都应该合并”。但这个结论有边界。如果两个页面各自有独立的外部链接、独立的内链锚文本,或者分别对应不同阶段的搜索需求,合并后可能损失原有入口的多样性。此时更稳妥的做法是先保留两个页面,分别明确各自意图,再通过内链让它们形成互补,而不是直接合并。
另一个边界是样本量。单个页面的合并结果不能证明整套站点的处理方式正确。如果只观察到一个页面合并后点击量上升,还需要看同批处理的其他页面是否出现相反情况。请求量、抓取量或某项统计归零,也不能单独证明合并动作正确,因为还可能是采集周期、页面改版或搜索需求变化造成的。
面对两个答案相近的页面,可以按这个顺序决定是否合并以及怎样保留独有信息:
这样处理的核心不是保住某个页面,而是让合并后的页面仍然能回应原来两个页面各自覆盖的搜索需求。只有独有信息在新页面中有明确位置,合并才可能同时满足内容整合和权重集中的目的;如果独有信息找不到位置,保留或迁移往往比硬合并更合适。