处理重复或冲突信号,核心不是“删掉一个”,而是先确认哪条信号代表你真正希望被收录的页面版本,再让其余信号与它保持一致。常见冲突包括:同一内容有多个 URL、规范标签与站点地图指向不同地址、robots.txt 允许抓取但页面被 noindex、内链和重定向链条指向不一致。处理方案可以分成两类:统一信号和移除信号。前者适合内容有价值、只是地址重复;后者适合内容已废弃、参数页或测试页。选择哪一类,取决于该 URL 是否有独立搜索价值,以及你是否愿意长期维护它。
重复和冲突不是同一个问题。重复通常指多个 URL 呈现相同或高度相似内容;冲突指你给出的指令互相矛盾。排查时按下面顺序看,能避免把“抓取问题”误当成“索引问题”:
robots.txt 是否禁止抓取。被禁止抓取的 URL,搜索引擎通常无法读取页面上的 noindex 或 canonical,因此不能用它来做可靠的索引移除。noindex,或 HTTP 状态码是否为 404、410、301。rel="canonical"、站点地图、内链、重定向是否都指向同一个首选 URL。如果同一内容同时存在“可抓取、可索引、canonical 指向 A、站点地图列出 B、内链指向 C”,这就是典型的冲突信号。此时搜索引擎需要自行猜测,结果可能是不收录、收录错误版本,或两个版本交替出现。
适用条件:重复页面有真实内容价值,或用户可能从不同入口访问;你希望长期保留这些 URL,但只让一个版本参与收录。做法是选定首选 URL,然后让所有信号向它收敛:
rel="canonical" 指向首选 URL。验收时检查:首选 URL 返回 200,canonical 自指或指向自身;重复 URL 若保留,canonical 指向首选 URL;站点地图只包含首选 URL;内链不再指向重复版本。注意,canonical 是提示而非强制指令,不同搜索引擎的支持程度和处理方式需要分别核查。
适用条件:页面已废弃、属于测试页、参数组合页、重复的打印页,或内容已合并到其他页面,且你不需要它继续带来访问。做法要区分“移除抓取”和“移除索引”:
noindex。robots.txt 禁止抓取来替代 noindex。被禁止抓取后,搜索引擎看不到 noindex,页面仍可能因外部链接而被收录。验收时检查:目标 URL 的 HTTP 状态码符合预期;可抓取页面上的 noindex 能被读取;站点地图不再包含已移除 URL;站内没有残留链接。移除索引需要时间,且不保证立即消失,应持续观察。
不要凭感觉选。用下面三个问题判断:
假设一个筛选参数页生成了多个排序版本,内容主体相同,且没有独立搜索需求。此时更适合移除信号:让参数页返回 404 或 canonical 指向主分类页,而不是为每个排序版本保留收录。反过来,如果某个版本有独立搜索需求,例如不同地区的落地页,则应统一信号,为每个版本设置自指 canonical,并分别列入站点地图。
从交付结果倒推,处理重复或冲突信号至少需要这些资料和动作:
检查时以实际抓取到的 HTML 和 HTTP 响应为准,不要只看后台设置。不同搜索引擎对 canonical、noindex、robots.txt 的支持和处理速度不同,应分别核查。HTTPS 只说明传输加密,不保证页面安全无漏洞,也不保证排名。站点地图是发现 URL 的辅助手段,不保证收录。
下一步:选一个当前最明显的冲突 URL,记录它的状态码、canonical、noindex 和内链指向,再对照上面的三个判断问题,决定是统一信号还是移除信号,然后按对应清单逐项修改并复查。