llms.txt:帮助 AI 找到并引用你的网站
2026年7月22日 · 5 分钟阅读
llms.txt 是给 AI 模型看的网站地图。这个标准是什么,与 sitemap.xml 有何区别,格式如何组织,以及连同 llms-full.txt 的 5 步落地方案。
llms.txt 是放在网站根目录的纯文本文件,帮助 AI 模型快速了解网站有什么、哪些值得引用。robots.txt 告诉爬虫哪里可以去,sitemap.xml 列出页面在哪里,而 llms.txt 回答的问题是「这个网站讲什么,精华在哪里」。
该标准于 2024 年提出(llmstxt.org),普及很快:文档平台纷纷支持,AI 爬虫也越来越多地在抓取 robots.txt 的同时请求这个文件。它还是个年轻的标准 —— 不保证被引用 —— 但成本几乎为零,并消除了最大障碍:模型不必再费力穿越 HTML、导航和脚本。
文件的结构
llms.txt 是遵循严格结构的普通 Markdown:
- H1 标题 —— 项目名称;
- 引用块 —— 一段精髓:你是谁、做什么;
- H2 小节及链接列表:页面 —— 一句话描述;
- 可选的 Optional 小节 —— 上下文有限时可以跳过的内容。
旁边放 llms-full.txt —— 网站的完整文字版,单文件、无排版,可整体载入模型上下文。多语言网站值得为每种语言发布完整版:引擎用用户的语言作答。
5 步上线
- 梳理核心:5–15 个关键页面,每个配一行描述 —— 不要营销话术,只讲实质。
- 按上述结构生成 llms.txt,放到根目录:你的域名/llms.txt。
- 制作 llms-full.txt —— 核心内容的完整 markdown 导出;保持与网站同步。
- 在 robots.txt 中放行 AI 爬虫:GPTBot、ClaudeBot、PerplexityBot 等。
- 内容每次重要变更都要更新文件:过时的 llms.txt 比没有更糟。
典型错误
- 只有「名片」没有链接:模型不知道去哪里找细节。
- 与网站不一致:llms.txt 里的价格、服务和事实必须与页面一致。
- 多语言网站只做一种语言:等于放弃一部分受众。
- 文件躺在仓库里却没上线 —— 用直接 URL 检查生产环境。
llms.txt 是 GEO 中性价比最高的动作之一:半小时的工作量,AI 引擎就能拿到你内容的现成地图。我们的版本可以在线查看:neaptide.ai/llms.txt。