上线前核对抓取与索引配置,核心是回答两个问题:搜索引擎能不能抓到页面,抓到的页面愿不愿意被收录。实际操作中有两种处理方案:一种是“先放行、后收紧”,即上线时允许抓取和索引,等确认内容稳定后再逐步限制;另一种是“先收紧、后放行”,即上线时用robots或noindex挡住,确认无误后再开放。选择哪一种,取决于你的网站是否已有旧版本、内容是否已定稿、以及能否承受短期无流量。
先放行、后收紧适合全新域名、内容已定稿、没有历史包袱的网站。代价是:如果上线时存在测试页、重复页或参数页,它们可能先被收录,之后要花时间清理。判断信号是:你能否在发布前完成一轮URL清单核对。
先收紧、后放行适合替换旧站、改版迁移、或内容尚未完全定稿的场景。代价是:从放行到被抓取、被索引之间存在延迟,期间自然搜索流量可能偏低。判断信号是:你是否需要先保证旧站权重平稳过渡,而不是抢上线当天的收录。
两种方案都不是“设一次就完事”。无论选哪种,上线前都要逐项核对下面三类配置。
robots.txt控制的是“能不能抓”,不是“能不能收录”。常见错误是写了一条Disallow: /却以为只是屏蔽测试目录。核对方法:
Disallow路径是否只覆盖测试、后台、搜索结果页等不需要抓取的目录。Sitemap行指向的地址可访问,且返回的是XML而非HTML错误页。如果robots.txt写错,搜索引擎可能直接停止抓取整站。这类错误在上线后才发现,恢复抓取需要额外时间,所以它属于必须在上线前核对的项。
控制索引的信号有两个来源:页面里的<meta name="robots">和HTTP响应头中的X-Robots-Tag。两者冲突时,限制更严的一方生效。核对时注意:
noindex。改版时最容易残留的是从测试模板继承来的noindex标签。一个可执行的检查动作:上线前用抓取工具对首页、栏目页、详情页各取一个样本,查看返回的HTML中是否含noindex,以及响应头是否含X-Robots-Tag。两者都干净,才说明索引信号放行。
抓取和索引之间还差一步:同一个内容可能有多个URL。canonical用来指定首选版本,Sitemap用来提交希望被抓取的URL清单。核对要点:
如果canonical指向一个被屏蔽的URL,搜索引擎可能既不索引原页面,也不索引目标页面。这是上线前值得单独抽查的一项。
无论选哪种方案,上线后都应查看服务器的抓取日志或搜索平台提供的抓取统计,确认搜索引擎实际抓取的是预期URL,而不是被屏蔽或重定向的地址。下一步动作:把首页、一个栏目页、一个详情页的URL列成清单,逐项核对robots、noindex、canonical和状态码四项,全部通过后再提交Sitemap。