上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常访问页面、页面愿意被收录、最终展示的地址唯一且正确。操作上先查 robots.txt 是否误封、再查页面 meta 标签与响应头、最后用可抓取性测试和站点地图提交来复查。下面按观察、判断、处理、复查四步展开,并比较两种常见处理方案的适用条件。
抓取是索引的前提,被阻断的页面不会进入索引流程。上线前最容易被忽略的是测试阶段留下的屏蔽配置。
https://你的域名/robots.txt,检查是否存在 Disallow: / 这类全站禁止规则。<meta name="robots" content="noindex">,测试环境常带这个标签,上线时忘了删。X-Robots-Tag: noindex,这种屏蔽在页面源码里看不到,只能看响应头。判断标准很直接:只要上述任一项存在,抓取或索引就会被拒绝,必须先处理再谈其他优化。注意区分两种现象——抓取被拒通常表现为抓取工具报错或返回 403、404;索引被拒则页面能正常打开,但搜索结果中不出现,原因是 noindex 或 canonical 指向了别处。
发现配置问题后,常见两种处理方式,选择依据是问题范围和上线时间。
方案一:逐项手动修改。适合页面数量少、问题点明确的情况。直接编辑 robots.txt、模板中的 meta 标签和服务器配置,改完立即生效。优点是可控、不影响其他页面;缺点是页面多时容易漏改,模板改动需要重新部署。
方案二:按环境批量切换。适合页面数量多、测试与生产共用一套模板的情况。做法是把屏蔽配置写成环境变量或构建参数,测试环境默认开启 noindex,生产环境自动关闭。优点是避免人为遗漏;缺点是需要一次构建流程改造,上线前要验证变量确实生效。
判断依据可以简化为一条:如果站点超过几十个页面,或者以后还会反复上线新版本,优先考虑方案二;如果只是单页调整或临时上线,方案一更快。两种方案不冲突,可以先手动处理紧急项,再补上环境切换机制。
抓取通道打开后,还要解决“同一内容多个地址”的问题,否则权重会被分散,收录结果也可能指向非预期地址。
<link rel="canonical" href="该页面的规范地址">,不要全部指向首页。Sitemap: 指令声明其完整地址。这里有个容易出错的点:canonical 和 noindex 不要同时用在同一页面。canonical 是告诉搜索引擎“以哪个地址为准”,noindex 是“不要收录”,两者语义冲突,可能导致规范地址也不被收录。
改完配置不等于生效,上线后需要实际验证。以下动作可以直接执行:
<meta name="robots"> 内容为 index,follow 或不存在屏蔽指令。https://你的域名/robots.txt,确认没有误封目录,且 Sitemap 地址可正常打开。复查的预期结果是:抓取测试返回正常状态码、页面可被抓取、规范地址与 canonical 一致、站点地图可读取。若抓取测试仍报被屏蔽,回到第一步重新检查 robots.txt 和响应头;若页面被抓取但长期不进入索引,重点检查内容质量与 canonical 指向,而不是继续修改抓取配置。
下一步建议:整理一份上线检查清单,把 robots.txt、meta robots、响应头、canonical、301 跳转、站点地图六项列为固定核对项,每次发版前逐项确认后再提交。