抓取、索引和排名是三个先后发生但彼此独立的环节:抓取是搜索引擎发现并读取页面,索引是把读到的内容存入可供检索的数据库,排名是用户搜索时从索引中挑选并排序结果。一个页面没流量,可能是没被抓取、被抓取但没进索引,也可能已索引却排不到前面。要定位问题,必须分别取证,不能只看“搜不到”这一个现象就下结论。
遇到具体问题时,按“抓取 → 索引 → 排名”的顺序逐层检查,前一层不通过,后一层就无从谈起。可以用下面的对照关系做初步判断:
site:加具体网址查询,结果出现该页面:说明至少已被索引,问题更可能在排名或需求匹配。注意,site:查询结果只是粗略参考,不同搜索引擎的表现不同,不能当作精确的索引状态证明。
抓取关注的是搜索引擎是否来过、是否成功读取。要查的是服务器日志和抓取工具的报告。
200 说明成功读取;频繁 5xx 说明服务器当时出错;持续 403 或 429 可能是被拦截或限流。robots.txt,确认目标路径没有被 Disallow 屏蔽。被屏蔽时,抓取请求会被拒绝,页面自然不会进入后续环节。结果说明:如果日志里从未出现该网址的抓取记录,问题在“未被发现或未被抓取”,应先解决入口链接和内链,而不是去改标题关键词。
被抓取不等于被索引。搜索引擎可能读取了页面,但因内容质量、重复、规范化设置等原因不收录。
<meta name="robots"> 是否含 noindex,以及 HTTP 响应头中是否有 X-Robots-Tag: noindex。存在 noindex 时,页面被明确要求排除在索引之外。<link rel="canonical"> 指向哪里。如果它指向了另一个网址,当前页面可能被视为重复版本,索引信号会归到目标网址上。结果说明:如果日志显示已抓取、页面也没有 noindex,但始终查不到,问题可能在内容重复或规范化指向,应检查是否存在多个近似页面互相竞争。
页面已进入索引后仍无流量,要查的是排名与需求匹配,而不是继续排查抓取。
结果说明:若同页结果都是另一种内容形式,调整方向应是改写内容结构和角度,而不是反复提交网址或修改抓取设置。
robots.txt,确认路径未被屏蔽。meta robots 与响应头,确认没有 noindex。canonical 指向,确认没有把索引信号让给其他网址。site: 加具体网址做粗略核对,判断是否已进入索引。这套清单的适用条件是:你有一个明确的网址和一个明确的目标查询词。如果目标词本身搜索量极低或意图模糊,排名数据参考价值有限,应先确认该词是否值得优化。假设某页面日志显示已被抓取、无 noindex、canonical 指向自身,但搜索标题找不到,此时更可能是索引尚未完成或内容被判定为低价值,应优先补充独特内容和站内入口,而不是修改抓取规则。
下一步:挑一个你正在关注的页面,按上面的清单逐项记录结果,把“搜不到”拆成抓取、索引、排名三段中的具体一段,再决定改什么。