直接答案 / DIRECT ANSWER
百度 SEO 诊断应从服务器可访问性开始,依次核对 robots 与状态码、初始 HTML、规范 URL、站内链接和页面独立价值;每一层都保留证据,再决定修复优先级,不能仅凭 site 查询或单次排名变化下结论。
建立可复查的诊断样本
先按首页、栏目、文章、新页面和历史页面分层抽样,记录 URL、检查日期、预期状态与实际结果。全站平均值容易掩盖某一模板的问题。
- 用 HTTP 请求核对最终状态码和重定向链
- 在禁用脚本时确认标题与主内容存在
- 比对 canonical、Sitemap 和站内链接目标
判断抓取与解析是否正常
robots.txt 允许抓取不等于页面一定会被抓取,但错误的禁止规则会直接形成阻塞。检查服务器日志时还要验证爬虫身份,不能只相信 User-Agent。
页面应在首个服务器响应的 HTML 中提供可理解的标题、摘要、正文和链接;重要信息若仅由交互触发,抓取端可能无法稳定获得。
检查规范化与发现路径
同一内容的协议、域名、路径大小写、尾斜杠和参数版本应收敛到主地址。栏目、面包屑与正文内链应指向同一规范 URL。
把 Sitemap URL 集合与站内可发现 URL 集合对照,可找到孤立页、重定向地址和意外参数页。
按影响和确定性排序
优先修复大范围 5xx、误拦截、错误 canonical 和模板缺失正文;随后处理孤立页与重复 URL;最后才是单页文案微调。修复后使用同一检查方法复测,不把时间上的先后当作因果证明。
常见问题
site 查询数量可以当作准确收录量吗?
不宜。它适合快速观察,不应作为精确统计口径;应结合搜索资源平台反馈、服务器日志和目标 URL 的实际搜索表现。
诊断发现很多问题时先改哪一个?
先处理影响范围大、证据明确且可能阻止抓取或解析的问题,例如服务器错误、误拦截和错误规范化。