上线前核对抓取与索引配置,核心是确认两件事:搜索引擎能不能顺利抓到页面,以及你希望被收录的页面是否明确允许进入索引。常见做法有两种——一种是在测试环境就锁死抓取、上线瞬间整体放开;另一种是上线前就让页面可抓取,只在测试域名上做隔离。选哪种,取决于你的上线流程是否存在“先部署、后切域名”的过渡期。下面按观察、判断、处理、复查四步展开。
无论选哪种方案,上线前都要逐项确认以下位置的实际输出,而不是只看后台开关:
robots.txt:是否误写成 Disallow: /,是否屏蔽了 CSS、JS 等渲染所需资源。<meta name="robots">:是否残留 noindex 或 nofollow。X-Robots-Tag: noindex,这类头信息容易被忽略,因为它不在 HTML 里。rel="canonical" 是否指向正式域名,sitemap 里的地址是否为最终可访问地址。观察阶段的判断标准很简单:把测试域名和正式域名分别访问一遍,对比上述四项输出是否一致。如果测试域名返回 noindex 而正式域名也返回 noindex,说明配置没有随域名切换,这是最常见的上线遗留问题。
方案一:测试期全站禁止抓取,上线时统一放开。适合部署流程较长、测试域名可能被外部链接或爬虫提前发现的场景。做法是在测试环境用 robots.txt 屏蔽全站,并在页面加 noindex;上线切域名时,同步删除这两处限制。
方案二:测试期就允许抓取,仅靠测试域名隔离。适合上线切换快、测试环境不对外网开放(如内网或带访问密码)的场景。此时页面本身不带 noindex,只保证正式域名解析正确。
判断依据是:你的测试环境是否可能被外部访问。如果测试域名已经能被公网打开,方案一更稳妥,因为一旦测试页被收录,上线后需要额外时间清理;如果测试环境本身有访问控制,方案二能减少上线时的改动量,降低“忘记删 noindex”的风险。
选定方案后,按以下顺序执行,避免中间态被搜索引擎抓到:
robots.txt,放开需要收录的目录,保留后台、购物车等无需收录路径的屏蔽。noindex,检查模板、组件、CDN 边缘配置是否都同步更新。这里有个容易出错的细节:如果 robots.txt 仍屏蔽着页面,搜索引擎即使看到 noindex 被删除,也无法重新抓取确认,索引状态会停留在旧结果。所以放开抓取要排在移除 noindex 之前或同时完成。
复查不能只看“提交成功”的提示,要回到实际输出:
robots.txt,确认没有全站屏蔽。noindex,确认主页面、栏目页、详情页模板均已清理。X-Robots-Tag。需要区分“可能原因”和“已定位原因”:页面未被收录可能是配置屏蔽、内容重复、站点权重不足等多种解释,只有确认抓取工具返回的是 noindex 或屏蔽状态,才能断定是配置问题。复查周期上,配置类问题通常几天内可观察到抓取变化,但索引更新速度受多种因素影响,不宜按固定天数判断成败。
下一步:把上面四项检查做成一张上线清单,每次发版前由执行人逐项打勾并留存截图,这样切换域名时就不会依赖记忆去删 noindex。