llms.txt 是一项为网站提供简洁、机器易读导航的开放提案:站点可在 /llms.txt 或子路径放置Markdown文件,介绍自身并链接到适合代理读取的重点资料。它不是IETF抓取控制标准,不负责授权或阻止爬虫,也不保证任何AI系统抓取、训练、引用或提升排名。robots.txt用于声明自动客户端的访问规则,Sitemap用于列出希望搜索系统发现的URL;三者职责不同,可以共存但不能互相替代。
直接答案
llms.txt 是一项为网站提供简洁、机器易读导航的开放提案:站点可在 /llms.txt 或子路径放置Markdown文件,介绍自身并链接到适合代理读取的重点资料。它不是IETF抓取控制标准,不负责授权或阻止爬虫,也不保证任何AI系统抓取、训练、引用或提升排名。robots.txt用于声明自动客户端的访问规则,Sitemap用于列出希望搜索系统发现的URL;三者职责不同,可以共存但不能互相替代。
一、llms.txt解决什么问题
网页为人类设计,常包含导航、脚本、广告和交互组件。代理只需要查找产品文档、API参考或政策时,解析整站既耗费上下文,也容易混入无关内容。llms.txt提案希望提供一个小型入口:先告诉代理“这个站点是什么、哪些资料最重要、详细内容在哪里”,再让它按需访问链接。
提案作者Jeremy Howard在v2说明中把它定义为帮助agent使用网站的提案。文件通常采用Markdown,便于人和模型阅读,也能被普通解析器处理。
二、它目前是不是正式标准
不是。llms.txt网站明确称其为proposal。它已有工具和文档平台采用,但采用数量、文件存在和某些AI实验室公开同名文件,都不能证明所有爬虫会读取或遵守它。
评估时应把“文件可访问”“某代理请求过文件”“回答引用了站点”分成三个证据层级。服务器日志看到一次请求,只能证明某个客户端访问过,不能单独证明后续回答使用了内容。
三、基本文件结构
当前提案中唯一必需部分是站点或项目名称的H1。常见结构还包括简短摘要、说明段落,以及用H2划分的重点链接列表。示例:
markdown
Example Docs
Example产品的官方开发文档与支持边界。
仅列出当前维护且无需登录的公开资料。
核心文档
快速开始(https://example.com/docs/start.md): 首次接入步骤
API参考(https://example.com/docs/api.md): 当前稳定接口
Optional
历史版本(https://example.com/docs/archive.md): 仅用于迁移查询
链接标题和说明应能区分页面职责,避免把全部URL无差别复制进来。提案中的Optional部分用于可在上下文紧张时跳过的次要内容。
四、为什么不能替代robots.txt
RFC 9309把Robots Exclusion Protocol定义为服务所有者向爬虫声明URI访问规则的方法。它使用User-agent、Allow和Disallow等规则。RFC同时强调,这些规则不是访问授权,也不能替代真正的安全控制。
llms.txt提供内容导航和上下文,不定义抓取许可语义。即使在llms.txt里写“不要抓取”,也不能假设客户端会把它当作robots规则。真正需要保护的内容应使用认证、授权和网络访问控制,不能仅依靠公开文本文件。
五、为什么不能替代Sitemap
Sitemaps.org协议定义XML Sitemap的结构,用 urlset、url 和 loc 等元素列出站点URL,并可提供真实修改时间。Sitemap面向较完整的URL发现;llms.txt则是精简的、带说明的重点资源导航。
大型站点可能在Sitemap中列出成千上万个规范URL,却只在llms.txt保留十几个高价值文档入口。反过来,只提供llms.txt会让传统搜索发现链路缺少完整URL清单。
六、它也不能替代页面本身
llms.txt中的摘要不是事实数据库。真正的产品限制、价格、API字段和政策仍应发布在稳定、可引用的规范页面,并提供作者、更新时间和来源。若摘要与正文冲突,代理可能选到错误信息。
不要把整站正文复制进llms.txt。文件过长会失去导航价值,也增加多处内容漂移。对重要页面提供干净的Markdown版本时,应确保与HTML来自同一内容源,并保持canonical事实一致。
七、哪些网站更适合部署
文档站、SDK站、知识库、研究机构和公开政策库通常更适合,因为它们拥有清晰的内容层级和稳定的权威页面。只有少量营销页的网站收益更不确定;如果正文缺少事实、来源和维护日期,增加入口文件不会补足内容质量。
部署优先级应排在基本可访问性、robots规则、Sitemap、规范URL和内容准确性之后。先修复404、软404、重复URL与脚本渲染问题,再考虑补充代理导航。
八、如何选择链接
每个链接都应回答明确用户问题,并指向站内权威版本。优先选择概览、快速开始、API参考、限制、价格或政策说明、故障排查和更新日志。删除重定向链、会话URL、搜索结果页与重复参数页。
不要为了关键词覆盖重复链接同一内容。链接说明应写页面用途,而不是堆叠同义词。对已经弃用的内容明确标记历史状态,防止代理把旧资料作为当前答案。
九、HTTP与可访问性检查
文件应在预期路径稳定返回200,使用UTF-8和合适的纯文本或Markdown内容类型,不依赖JavaScript渲染。检查HTTP到HTTPS、裸域到主域的跳转,避免多次重定向。
对根路径和子路径分别部署时,确认覆盖范围清晰。提案v2允许子路径文件描述其下页面,且更具体的文件优先。不要让 /docs/llms.txt 链接到需要登录或被robots禁止的内部页面。
十、更新和版本管理
把llms.txt纳入内容发布流程,而不是一次生成后遗忘。新增核心文档、迁移URL或废弃版本时同步更新;自动化生成后仍需人工核对标题、说明与权威性。
保存文件哈希、生成时间和来源清单。不要伪造所有页面的更新时间,也不要每天无变化重写文件。更新频率应由真实内容变化驱动。
十一、如何验证有没有实际价值
先定义固定问题集和基线日期,记录AI答案是否正确提及站点、是否给出可访问来源以及引用的具体URL。部署后用相同问题、相同产品和相近时间窗口重复观察。
同时查看服务器日志中 /llms.txt 及其链接页面的请求,但要按User-Agent、时间和来源脱敏汇总。搜索与生成式系统会变化,单次命中不能证明因果;需要多轮、对照和长期记录。
十二、审计清单
/llms.txt 稳定返回200且无需执行脚本。
H1为准确、统一的站点或项目名称。
摘要与首页、关于页和组织实体信息一致。
每个链接使用规范HTTPS URL并返回200。
链接指向当前权威内容而非重复页。
Markdown版本与HTML事实保持一致。
robots.txt继续单独管理抓取规则。
Sitemap继续维护完整的规范URL发现链路。
十三、常见误区
把llms.txt称为所有AI平台已支持的正式标准。
认为它能禁止模型训练或爬虫访问。
用它替换robots.txt或Sitemap。
自动收录全部页面,不做质量筛选。
让摘要与正文分别维护并长期冲突。
链接登录页、软404或多跳重定向页面。
只检查文件存在,不验证链接与内容。
用一次AI回答变化宣称GEO效果确定。
十五、结论
llms.txt是面向代理的精选内容入口提案,而不是抓取控制、URL完整发现或排名保证。先把robots.txt、Sitemap、规范URL和权威内容做好,再用短小、准确、可维护的llms.txt补充导航,并通过可重复实验判断它对自身站点是否有价值。