检查 Yahoo 收录前,最需要准备的不是“一个查询命令”,而是四类可核对的信息:要检查的 URL 清单、站点的抓取与索引声明文件、页面自身的可索引状态,以及你希望 Yahoo 展示的规范版本。把这些信息按同一时间点整理好,才能判断“没收录”是抓取问题、索引问题,还是查询方式不对。
先确定要查什么,否则后面每一步都会失去对照。至少整理以下内容:
这一步的适用条件是:你已经有可访问的站点。若站点尚未上线或返回错误,应先处理可访问性,而不是继续查收录。
robots.txt 决定爬虫可以抓取哪些路径,站点地图用于告知可发现的 URL。两者都要准备,但不能混为一谈。
https://你的域名/robots.txt,查看 Disallow 行是否覆盖目标路径;再打开站点地图文件,搜索目标 URL 是否在列。注意区分:robots.txt 是抓取规则,站点地图是发现线索,二者都不能替代页面本身的索引状态检查。
页面能不能被收录,取决于它返回什么、声明什么。检查前准备好以下判断项:
<head> 中是否有 noindex。有 noindex 时,页面即使被抓取也不会进入索引。<link rel="canonical"> 指向哪个 URL。若指向另一个地址,当前 URL 可能被当作重复版本处理。判断结果时,把“已经定位的原因”和“可能原因”分开:看到 noindex 可以确定页面被主动排除;看到 200 且无 noindex,只能说明页面具备被索引的基础条件,不能保证一定收录。
最后要准备的是统一的查询方法和记录方式,避免不同时间、不同入口得出互相矛盾的结论。
site:你的域名 观察大致收录范围,再用完整 URL 或标题片段查具体页面。site: 结果是估算值,不等于精确收录总数;目标 URL 未出现,可能是未收录、被规范到其他 URL,或查询词无法匹配。不同搜索引擎支持情况须分别核查,不能把其他引擎的结果直接当作 Yahoo 的结论。建议建一张表,列:URL、规范版本、robots.txt 是否放行、站点地图是否包含、HTTP 状态码、meta robots、canonical、site: 查询结果、备注。每项填“是/否/待查”,比只写一句“没收录”更容易定位下一步。
完成上述准备后,先看记录表中哪一项出现异常:robots.txt 屏蔽就调整抓取规则;noindex 就移除该声明;规范版本混乱就统一 canonical 与内部链接;一切正常但未出现,则继续观察并检查内容是否与已有页面高度重复。不要在没有记录的情况下反复提交或修改,否则无法判断变化来自哪一步。