技术 SEO

Robots 规则检查清单:避免误拦截与无效配置

逐项核对 robots.txt 的访问、语法、匹配范围、Sitemap 声明和发布变更。

直接答案 / DIRECT ANSWER

检查 robots.txt 时,要确认文件位于站点根目录并可稳定访问,再按 RFC 9309 核对 User-agent、Allow 与 Disallow 的匹配范围;用代表性 URL 测试实际结果,并确保规则不被误当成删除索引或安全控制手段。

确认文件位置与响应

每个协议与主机分别使用根路径 /robots.txt。检查最终状态码、字符编码和是否被重定向到登录页或错误页面。

逐组理解匹配范围

审查通配规则、路径大小写和特殊字符,尤其注意过宽的目录前缀。修改前列出必须抓取与必须禁止的代表性 URL,修改后逐一验证。

Sitemap 声明可帮助发现站点地图,但站点地图中的 URL 仍应符合抓取和索引策略。

区分抓取、索引与访问控制

robots.txt 是抓取协商协议,不是权限系统。敏感内容必须通过身份验证保护;需要移除搜索结果的页面,应采用适合场景的状态码或索引控制方式,并考虑爬虫是否能读取相关指令。

建立发布门禁

将 robots.txt 纳入版本管理和上线检查,监测意外变化。网站改版、测试环境切换或 CDN 规则调整后,应重新获取生产文件并验证关键路径。

常见问题

Disallow 能保证页面不出现在搜索结果吗?

不能。它主要限制抓取;如果 URL 通过其他链接被发现,仍可能以有限信息出现。

robots.txt 可以保护后台和隐私文件吗?

不可以。公开文件本身会暴露路径,真正的保护必须依赖认证、授权和服务器访问控制。

来源与证据

  1. Robots Exclusion Protocol RFC 9309
  2. 百度搜索资源平台