上线前核对抓取与索引配置,核心是确认三件事:爬虫能拿到页面、拿到的是正确版本、拿到后允许被索引。具体做法是在预发布环境用真实域名或等价域名跑一遍抓取测试,逐项检查 robots.txt、canonical、状态码、noindex 和 sitemap,再把结果写成可签字的交付清单。只有这三类信号都通过,才算具备上线条件;任何一项存疑,都应先修复再切换正式域名。
这套核对适用于多人协作、需要向他人交付的网站设计流程,尤其是设计、前端、后端、运维分属不同角色时。它不替代上线后的持续监控,只解决“切换域名或发布新版本之前”这一节点。前提是:你已经有一份页面清单(哪些是正式内容页、哪些是筛选页或测试页),并且能在接近生产环境的地址上访问这些页面。如果连页面清单都没有,先补清单,否则核对会变成随机抽查,容易漏掉关键页面。
抓取关注的是“爬虫能不能进来、进来看到什么”。建议按下面顺序检查,每项都记录实际值而不是“应该没问题”:
Disallow: / 这类全局屏蔽;测试环境常用的屏蔽规则必须在上线前移除或改写。检查方式是直接请求 /robots.txt,看返回内容和状态码。curl -I 或浏览器开发者工具看最终落地地址是否唯一。索引关注的是“爬虫拿到页面后,允不允许收录、以哪个地址收录”。这一层最容易在协作中出错,因为 canonical 和 noindex 常由不同人写入:
<link rel="canonical"> 是否与当前地址一致。noindex;但正式内容页绝不能带。发布前逐类页面抽查,不要只查首页。假设你负责一个企业站改版,准备从测试域名切到正式域名。可以按以下步骤执行,并把每步结果填入交付清单:
/robots.txt 和 sitemap,确认没有屏蔽正式内容,且 sitemap 中的地址与清单一致。验收信号是:代表性 URL 全部返回预期状态码,canonical 指向自身,正式页面无 noindex,robots.txt 不屏蔽正式内容,sitemap 可访问且内容准确。若某项无法确认,标记为待验证,不要默认通过。
如果站点规模很小、页面类型单一,抽查数量可以减少,但 robots.txt、canonical 和 noindex 三项必须查。如果站点有大量筛选参数、多语言或多地区版本,核对范围要扩大到参数页和 hreflang 配置,因为这类页面最容易产生重复索引或错误屏蔽。历史遗留的旧入口或旧功能,不要按记忆判断现状,应以当前实际请求结果为准;无法确认时,先在预发布环境验证,再决定是否上线。下一步是把上述检查项整理成一张签字清单,指定一人负责执行、另一人负责复核,切换域名后保留清单以便回溯。