排查重复页面,核心不是先改标签,而是先收集证据:确认哪些网址内容相同或高度相似、它们是否能被访问、是否被内部链接或站点地图引用、搜索引擎实际收录了哪些版本。只有先定位重复的真实范围,后续的合并、规范或删除才有依据,权重提升方法也才有落点。
重复页面通常分三类,处理方式并不一样。第一类是完全相同:正文、标题、商品参数几乎一致,只是网址不同。第二类是高度相似:同一产品不同筛选参数、同一文章分页、同一内容带不同跟踪参数。第三类是跨域重复:自己站点与外部站点内容一致,或镜像站、测试站被公开访问。
判断时打开两个页面的源码,对比 <title>、<h1> 和正文首段。如果只有网址不同、内容一致,属于第一类;如果正文主体相同但列表顺序、价格或库存不同,属于第二类。跨域重复需要额外确认对方是否获得授权或是否为同一主体的其他域名。
?utm_ 或 ?ref= 的链接中导出网址清单,去重后保留完整路径和参数。<title>、<h1> 和正文前 200 字。内容指纹相同或高度接近的,归为一组。验收信号是:每组重复页都能说清楚“哪个是主版本、哪些是重复版本、重复版本是否被引用、是否被收录”。如果做不到这一点,说明证据还不完整,不应直接动手改。
完全相同且无独立价值:保留一个主版本,其余做 301 跳转到主版本,并更新内部链接指向主版本。适用条件是重复页没有独立搜索需求,也没有外部链接指向它。判断结果是主版本获得集中信号,重复版本逐步退出收录。
高度相似但各有用途:例如筛选参数页、排序页、分页。如果这些页面有真实用户需求,保留可访问,用 <link rel="canonical"> 指向主版本;如果没有需求,用 robots.txt 限制抓取或加 noindex。注意 noindex 与 canonical 不要同时指向不同目标,否则信号会冲突。
跨域重复:先确认对方是否为自己控制的其他域名。如果是,按同站重复处理;如果不是,检查是否有授权或采集关系,再决定是否联系处理。不要假设搜索引擎一定会选择你的版本。
一次改动前后比较要考虑季节、搜索需求变化和数据采集差异。假设某站点在合并重复页后,主版本展示量上升,同时被合并页面的展示量下降,这可以视为信号集中的迹象;但如果整体展示量同步下降,可能是需求本身变化,不能直接归因于合并动作。
建议固定观察同一组页面、同一数据来源、同一时间窗口。记录改动日期、改动类型、受影响网址数量和收录状态变化。不要承诺固定见效时间,也不要仅凭单日数据下结论。
把本次排查出的重复组、主版本、处理动作和复查日期写入一张清单,之后每次新增筛选参数、分页或测试域名时,先对照清单判断是否会产生新的重复。这样重复页排查就从一次性动作变成可复用的检查项,权重提升方法也更容易落到具体页面上。