排查重复页面,核心是找出内容高度相似、但URL不同的页面集合,再判断它们是否因参数、大小写、结尾斜杠、打印版或分页等原因被重复收录。对第一次处理这个问题的人来说,起点不是立刻改代码,而是先做一次可复核的URL与内容对照,确认重复范围后再决定合并、重定向还是保留。
要查的是:同一篇内容是否存在多个可访问URL。怎么查:从站内搜索、导航或日志中抽取一批页面,手动替换以下变量后逐一访问,观察是否返回相同正文。
/Page 与 /page 是否都能打开。/a 与 /a/ 是否同时返回200状态。?id=1、?from=home 是否产生同一内容页。http 与 https、带 www 与不带 www 是否都可达。结果说明什么:如果多个变体都返回200且正文一致,它们就构成重复页面候选。此时要判断哪个是规范版本,其余应通过301或规范标签指向它。适用条件是这些变体确实服务同一内容;如果参数会改变页面主体内容,则不应简单合并。
要查的是:不同URL之间是否存在大段相同文本。怎么查:选取两两页面,对比标题、H1、正文首段和商品或文章主体。分页序列尤其容易重复,例如列表第2页与第3页可能只差少量条目。
判断依据可以这样设定:若两个页面标题相同、正文主体超过大半相同,且没有各自独立的补充信息,就应视为重复或近似重复。若分页页面的标题和摘要都不同,且每页条目独立,则更适合保留并各自优化,而不是全部指向第一页。
检查项还包括打印版、AMP版、移动版和筛选结果页。它们是否重复,取决于是否暴露了完整正文以及是否可被独立访问。对第一次排查的人来说,先记录“URL、状态码、标题、正文重合度”四列,比直接改模板更可靠。
要查的是:重复URL是否已被搜索引擎收录,以及站内链接指向了哪个版本。怎么查:用站点查询指令或搜索控制台中的页面报告,查看重复URL是否出现在结果中;同时检查导航、面包屑、站点地图和文章内链,统计它们分别指向哪个变体。
结果说明什么:如果重复URL被收录且获得内链,它就可能分散权重并造成选择困难;如果重复URL未被收录且没有内链,优先级可以降低。这里要区分网页搜索与平台推荐、付费广告:收录问题属于网页搜索层面,不应与广告落地页或站内推荐流混为一谈。
下一步:先完成第一组重复URL的记录表,再根据“是否有独立内容价值”决定保留或合并,避免在未确认范围前批量修改全站链接。