直接答案 / DIRECT ANSWER
SEO 日志分析应先保留原始访问记录,再按已验证的搜索爬虫、状态码、URL 类型和时间聚合,观察重要页面是否被访问以及错误和重复路径是否消耗抓取。
保留哪些字段
至少记录时间、请求方法、主机、路径、状态码、响应字节、User-Agent 和处理耗时,同时遵守隐私与日志保留要求。
先验证爬虫身份
User-Agent 可以伪造。需要时结合服务商公开的验证方法,不把普通访问直接计为搜索爬虫。
形成可行动的报告
优先列出重要页面长期未抓取、持续 5xx、重定向链、无效参数路径和高频 404,再逐项修复和复查。
常见问题
日志里没有抓取就说明页面被降权吗?
不能这样推断。先检查页面是否有入口、robots 是否允许、URL 是否稳定以及观察窗口是否足够。