在SEO域名选择相关的技术排查里,日志核对的核心是回答三个问题:搜索引擎是否来过、抓的是不是目标域名、抓取结果是否正常。多人协作时,建议把日志字段核对做成固定清单,每项写清查什么、怎么查、结果说明什么,交接时直接附上原始日志片段,减少返工。
查什么:日志中的 Host 或虚拟主机字段,以及请求协议是 http 还是 https。 怎么查:在原始访问日志中定位请求行与 Host 字段,逐条比对是否等于你选定并希望收录的域名,包括是否带 www、是否走了旧域名或测试域名。 结果说明什么:如果 Host 出现旧域名、测试域名或未预期的子域,说明抓取落在了非目标站点上,需要检查服务器绑定、跳转配置和站内链接。若 http 与 https 同时出现大量抓取,说明协议统一还没做好,应优先让目标协议稳定返回。
查什么:HTTP 状态码、响应字节数、响应时间。 怎么查:按状态码分组统计,重点看 200、301、302、404、410、5xx 的占比;再结合响应大小,检查 200 是否返回了正常页面内容。 结果说明什么:大量 5xx 说明服务器在抓取时不稳定,会直接影响抓取预算;大量 301 指向同一目标通常是正常的规范化行为,但链条过长需要收敛;200 却返回极小字节数,可能是空页面或错误页伪装成成功,需要单独抽查。响应时间明显偏高的 URL,往往是拖慢整体抓取的原因。
查什么:User-Agent 字符串、同一路径的抓取次数与时间分布。 怎么查:先按 User-Agent 归类,把主流搜索引擎的抓取、普通用户访问、监控与安全扫描分开;再对重点目录统计单位时间抓取量。 结果说明什么:如果某类爬虫集中在低价值页面,说明内链或站点地图把抓取引偏了;如果抓取频次突然下降,需要排查服务器可用性和 robots.txt 是否被改动。注意,User-Agent 可以被伪造,不能只凭它下结论,应与 IP 反查和服务器侧验证结合。
查什么:日志中对 robots.txt 的请求记录,以及被限制路径的实际抓取情况。 怎么查:搜索日志里 robots.txt 的请求时间与返回状态,再对照当前规则,看哪些目录被禁止。 结果说明什么:robots.txt 的抓取限制不等于可靠的索引移除,被禁止抓取的 URL 仍可能因外部链接出现在结果中。如果日志显示目标路径长期被限制,应先确认这是有意为之,再决定是否放开;同时用站点地图提交和站内链接引导抓取,但站点地图不保证收录。
多人协作时,把上述字段做成固定表格,每次排查只填变化项,并在结论里写明“已定位的原因”和“仍待验证的可能原因”。下一步,选取最近七天的日志,按 Host、状态码、User-Agent 三个维度各做一次分组统计,把异常项对应到具体 URL 后再改配置。