做网站收录检查时,如果同一批网址出现互相矛盾的信号,先别急着改代码。正确顺序是:把每个信号单独记录下来,判断它影响的是“能否被抓取”“能否被索引”还是“索引后展示哪个版本”,然后只针对冲突最严重、影响面最大的那一层动手。重复信号通常不会单独导致不收录,但会让搜索引擎难以判断哪个网址是主版本,从而降低抓取和索引效率。
网站收录检查中常见的冲突,基本落在三个层面。把它们混在一起,很容易改错地方。
robots.txt、服务器状态码、登录墙、防火墙拦截。它决定爬虫能不能拿到页面。noindex、规范标签、站点地图、内链。它决定页面能不能进入索引,以及哪个网址被当作代表。判断方法很直接:如果页面在抓取工具里根本取不到内容,先查抓取层;如果能取到却不进索引,查索引层;如果已收录但展示的网址不对,查展示层。一次只改一层,改完再复查,才能知道是哪个信号起了作用。
下面几种组合在网站收录检查里出现频率较高,处理代价也不同。
noindex。优先做法是:如果希望收录,先放开抓取;如果希望移除,改用可抓取状态下的 noindex,而不是只靠 robots.txt。noindex 的网址。站点地图只是提交候选网址,不保证收录。把明确不想收录的网址继续放在站点地图里,会制造额外噪音。检查项:站点地图中的每个网址,是否与当前索引意图一致。不要凭感觉判断冲突。按下面步骤逐项记录,每项都留下可复查的结果。
robots.txt 是否允许抓取、页面是否有 noindex、规范标签指向谁。假设一个例子:某栏目页规范标签指向栏目首页,但站点地图提交的是栏目页本身,内链也指向栏目页。这里冲突在于“规范标签说别收录我,其他信号却都在推我”。如果栏目页确实有独立价值,应把规范标签改为自指;如果它只是聚合页,应统一让内链和站点地图指向栏目首页。两种选择取决于该页是否提供独立内容,而不是取决于哪个改起来省事。
修改后不要立刻下结论。先确认目标网址能被正常抓取,再确认页面返回的状态码和索引指令符合预期,最后检查内链、站点地图、规范标签三者是否指向同一版本。不同搜索引擎对指令的支持和响应速度不同,需要分别核查,不能用一个平台的结果推断另一个平台。若一段时间后仍未收录,回到检查表看是否还有未处理的冲突项,而不是反复提交同一批网址。
下一步:从你的网站收录检查清单里挑出冲突最集中的那一个模板,按上面的检查表跑一遍,先改抓取层,再改索引层,最后核对展示层。