上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引到的地址是你希望展示的规范地址。最直接的做法是先用抓取工具模拟访问,再逐项检查 robots、canonical、状态码和站点地图,而不是等上线后再靠搜索表现反推。
假设你正在改版一个企业站,新版本准备替换旧站。旧站有约两百个产品页,新站把其中一部分合并成了分类页,另一部分换了新路径。上线前如果只检查首页能否打开,很容易漏掉下面这些问题。
200;如果出现 301 或 302,要确认跳转目标是否是最终地址。robots.txt,检查是否误写了 Disallow: /,或者把整站目录、静态资源目录一起屏蔽。测试环境遗留的屏蔽规则是上线前最常见的问题之一。<link rel="canonical">,确认它指向的是当前页面的规范地址,而不是旧域名、测试域名或另一个不相关页面。<meta name="robots" content="noindex">。改版时从测试模板继承过来的 noindex 如果没清掉,页面即使能被抓取也不会进入索引。200 页面,且不包含已被合并、已下线的旧地址。这套流程适用于已有页面或项目在原有基础上的改进,不适用于从零搭建、还没有任何可访问地址的阶段。
这两件事经常被混在一起,但控制方式不同。robots.txt 管的是抓取行为,noindex 管的是索引行为。一个页面可以被允许抓取,同时被禁止索引;反过来,如果 robots.txt 直接屏蔽了抓取,搜索引擎就看不到页面里的 noindex 指令,反而可能因为外部链接而把地址留在索引里。
常见错误是把 canonical 指向一个被 noindex 的地址,或者让 canonical 和站点地图里的地址不一致。判断方法是把三处地址逐一对照:浏览器实际访问的地址、页面 canonical 写的地址、站点地图列出的地址,三者应当一致。
改版后旧地址的处理直接影响索引能否顺利过渡。对每一个下线或换路径的地址,检查它的返回结果:
301 并跳到最相关的新页面,是合并或换路径时的常规处理。404 或 410,表示页面确实不存在,适合彻底下线的地址。302,属于临时跳转,长期使用会让搜索引擎难以确定最终地址。200 但内容是空白页或错误提示页,属于软 404,需要单独排查。检查时不要只看首页跳转是否正常,要覆盖旧站流量较高的栏目页和详情页。可以用站点地图或访问日志整理出旧地址清单,逐个请求并记录状态码与跳转终点。跳转链超过一跳时,尽量改成直接跳到最终地址。
把核对结果整理成可复核的记录,比凭印象确认更可靠。下面每一项都对应一个明确的判断结果:
200,页面内容完整。200,不含重定向地址和已下线地址。任何一项不通过,都应先修复再上线或提交。抓取与索引配置属于基础条件,配置正确不等于一定被收录或获得排名,它只是排除了因配置错误导致的阻碍。
上线后不要立刻停止检查。先确认 robots.txt 和站点地图可以正常访问,再用抓取工具对重点页面做一次复测,观察状态码和 canonical 是否与上线前一致。如果发现页面长期未被抓取或索引,优先回查这几项配置,而不是先改内容。下一步可以把旧地址清单与新地址做一次完整映射,逐条验证跳转终点,确保没有遗漏的地址仍指向旧路径。