直接答案 / DIRECT ANSWER
检查 robots.txt 时,要确认文件位于站点根目录并可稳定访问,再按 RFC 9309 核对 User-agent、Allow 与 Disallow 的匹配范围;用代表性 URL 测试实际结果,并确保规则不被误当成删除索引或安全控制手段。
确认文件位置与响应
每个协议与主机分别使用根路径 /robots.txt。检查最终状态码、字符编码和是否被重定向到登录页或错误页面。
逐组理解匹配范围
审查通配规则、路径大小写和特殊字符,尤其注意过宽的目录前缀。修改前列出必须抓取与必须禁止的代表性 URL,修改后逐一验证。
Sitemap 声明可帮助发现站点地图,但站点地图中的 URL 仍应符合抓取和索引策略。
区分抓取、索引与访问控制
robots.txt 是抓取协商协议,不是权限系统。敏感内容必须通过身份验证保护;需要移除搜索结果的页面,应采用适合场景的状态码或索引控制方式,并考虑爬虫是否能读取相关指令。
建立发布门禁
将 robots.txt 纳入版本管理和上线检查,监测意外变化。网站改版、测试环境切换或 CDN 规则调整后,应重新获取生产文件并验证关键路径。
常见问题
Disallow 能保证页面不出现在搜索结果吗?
不能。它主要限制抓取;如果 URL 通过其他链接被发现,仍可能以有限信息出现。
robots.txt 可以保护后台和隐私文件吗?
不可以。公开文件本身会暴露路径,真正的保护必须依赖认证、授权和服务器访问控制。