上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、用户和搜索引擎看到的是同一个版本。时间和人手有限时,先查 robots.txt 和 meta robots,再查可访问性与重复内容,最后用真实 URL 抽查,而不是把整站每个页面都过一遍。
在浏览器打开站点根目录下的 robots.txt,逐条读 Disallow 规则。常见问题是测试阶段写了 Disallow: /,上线时忘记删除,结果整站无法被抓取。另一种是误封了 /css/、/js/ 或图片目录,页面能抓但渲染不完整。
判断方法:把 robots.txt 里每条规则和网站实际目录对照,确认没有把需要收录的栏目、文章路径、列表页写进禁止范围。如果站点使用子目录区分频道,还要检查规则是否误伤了这些子目录。
robots.txt 允许抓取,不代表页面允许索引。需要在页面源码里看 <meta name="robots"> 的内容,重点找 noindex 和 nofollow。测试环境常给整站模板加上 noindex,上线后如果模板没改,页面能被抓取但不会进入索引。
HTTP 响应头里的 X-Robots-Tag 同样会生效,PDF、图片、视频等非 HTML 文件尤其要查。核对时不要只看首页,要按模板类型各抽一个页面:首页、栏目页、内容页、搜索结果页、分页。同一套模板通常共用同一段配置,抽查能覆盖大部分风险。
抓取的前提是 URL 能正常返回内容。用命令行或在线工具请求目标 URL,观察状态码:
还要检查内链是否指向正式域名。测试域名、临时端口、带参数的内部链接如果大量存在,会把抓取预算引到不该收录的地址上。处理办法是统一内链为正式 URL,对测试域名做整站跳转或下线。
同一篇内容出现多个可访问地址时,搜索引擎需要知道哪个是主版本。常见来源包括:带 www 与不带 www、http 与 https、带尾斜杠与不带尾斜杠、大小写混用、跟踪参数不同。
核对步骤:先确定一个规范形式,例如统一使用 https 加 www 或统一不带 www;再检查其他形式是否 301 到规范形式;最后确认页面里的 <link rel="canonical"> 指向自身或正确的主版本。canonical 写错会把权重和索引指向别的页面,比不写更麻烦。
分页、筛选、排序参数也容易产生大量近似页面。时间和人手有限时,优先处理会被内链大量指向的参数组合,其余可以通过 robots.txt 禁止抓取或加 noindex 控制,但要注意 noindex 页面仍可能被抓取,只是不进入索引。
完成上述配置后,按下面清单抽查,每项记录结果,便于复查:
适用条件:这套流程适合中小型站点上线前的快速核对。如果站点有大量由程序生成的页面、多语言版本或复杂的参数体系,需要额外按目录和模板分类抽查,不能只靠几个页面判断整站状态。
下一步:把上面六项做成一张上线检查表,指定一个人在上线前逐项打勾,上线后一周内再复查一次状态码和索引情况,发现异常先回查对应模板或服务器配置。