区分访问、抓取与索引,关键看三个不同层面的证据:访问是用户或程序打开了 URL,抓取是搜索引擎爬虫读取了页面内容,索引是搜索引擎把页面存入可供检索的数据库。二级域名只是主机名的一部分,例如 blog.example.com 中的 blog,它本身不会自动带来收录或排名。判断某个二级域名上的页面处于哪个阶段,要分别查服务器日志、抓取统计和索引状态,不能只看“能不能打开”。
访问只说明请求到达了服务器并返回响应。你用浏览器打开、用脚本请求、用监控工具探测,都属于访问。抓取则是搜索引擎爬虫根据链接、站点地图或历史记录来读取页面,它可能成功,也可能被 robots.txt 挡住,或因为服务器错误而失败。索引是抓取之后更远的一步:搜索引擎判断页面是否值得保留在检索库中。三者不是自动递进关系,抓取成功不等于被索引,被索引也不等于有排名。
协作返工往往不是因为问题难,而是每个人说的“收录了”不是同一件事。交付前先约定:谁负责看日志,谁负责查抓取统计,谁负责查索引状态,各自记录什么字段。建议至少记录 URL、观察时间、HTTP 状态码、爬虫名称、robots.txt 是否放行、页面是否有 noindex、以及索引查询结果。这样复查时能对比同一对象,而不是拿“我这边能打开”去反驳“搜索里搜不到”。
注意一个常见误区:robots.txt 的抓取限制不等于可靠的索引移除。它主要阻止爬虫抓取,已经建立的索引记录未必因此消失;如果目标是让页面退出索引,应优先使用页面级 noindex,并确认爬虫仍能抓取到该指令。站点地图也不保证收录,它只是提供发现线索。
先看服务器日志中是否有该二级域名页面的爬虫请求。如果完全没有请求,优先排查发现路径:内链是否指向该页面、站点地图是否包含、robots.txt 是否误挡、服务器是否对爬虫返回 403 或 5xx。如果有请求但索引查询查不到,再排查页面级因素:是否有 noindex、是否返回 404 或软 404、内容是否与已有页面高度重复、是否被 canonical 指向了别的 URL。
这里要区分“可能原因”和“已经定位的原因”。日志没有爬虫记录,可能是没被发现,也可能是爬虫来了但日志被截断、被采样,或日志只记录了部分主机。索引查不到,可能是页面被排除,也可能是查询方式只查了主域而没查二级域名。不要凭单一现象下唯一结论。
curl 请求目标 URL,记录 HTTP 状态码和最终跳转地址。若返回 3xx,先确认跳转终点是否仍是你要观察的页面。noindex 或错误的 canonical。假设一个团队交付了 docs.example.com/start,浏览器能打开,但索引查询查不到。日志显示爬虫只请求了 docs.example.com 首页,没有请求 /start。这时更可能是发现路径不足,而不是页面被惩罚。处理方式是给 /start 增加可从首页到达的内链,并确认站点地图包含它。复查时看日志是否出现该路径的爬虫请求,再看索引状态是否变化。这个例子只说明判断顺序,不代表固定见效时间。
复查要对比同一 URL 在访问、抓取、索引三个层面的记录,而不是重新描述一遍页面内容。若抓取记录增加了但索引仍无变化,继续查页面级指令和内容质量;若抓取记录始终为零,回到发现路径和服务器响应。HTTPS 只说明传输层加密,不保证页面安全无漏洞,也不保证排名。把这三个层面分开记录,协作时就能明确下一步由谁处理、依据是什么。
下一步:选一个你负责的二级域名页面,按上面的检查顺序填一张三列表格——访问结果、抓取记录、索引结果,再决定是修发现路径、修页面指令,还是继续观察。