跳到正文
Neaptidestudio
博客

llms.txt:帮助 AI 找到并引用你的网站

2026年7月22日 · 5 分钟阅读

llms.txt 是给 AI 模型看的网站地图。这个标准是什么,与 sitemap.xml 有何区别,格式如何组织,以及连同 llms-full.txt 的 5 步落地方案。

llms.txt 是放在网站根目录的纯文本文件,帮助 AI 模型快速了解网站有什么、哪些值得引用。robots.txt 告诉爬虫哪里可以去,sitemap.xml 列出页面在哪里,而 llms.txt 回答的问题是「这个网站讲什么,精华在哪里」。

该标准于 2024 年提出(llmstxt.org),普及很快:文档平台纷纷支持,AI 爬虫也越来越多地在抓取 robots.txt 的同时请求这个文件。它还是个年轻的标准 —— 不保证被引用 —— 但成本几乎为零,并消除了最大障碍:模型不必再费力穿越 HTML、导航和脚本。

文件的结构

llms.txt 是遵循严格结构的普通 Markdown:

  • H1 标题 —— 项目名称;
  • 引用块 —— 一段精髓:你是谁、做什么;
  • H2 小节及链接列表:页面 —— 一句话描述;
  • 可选的 Optional 小节 —— 上下文有限时可以跳过的内容。

旁边放 llms-full.txt —— 网站的完整文字版,单文件、无排版,可整体载入模型上下文。多语言网站值得为每种语言发布完整版:引擎用用户的语言作答。

5 步上线

  1. 梳理核心:5–15 个关键页面,每个配一行描述 —— 不要营销话术,只讲实质。
  2. 按上述结构生成 llms.txt,放到根目录:你的域名/llms.txt。
  3. 制作 llms-full.txt —— 核心内容的完整 markdown 导出;保持与网站同步。
  4. 在 robots.txt 中放行 AI 爬虫:GPTBot、ClaudeBot、PerplexityBot 等。
  5. 内容每次重要变更都要更新文件:过时的 llms.txt 比没有更糟。

典型错误

  • 只有「名片」没有链接:模型不知道去哪里找细节。
  • 与网站不一致:llms.txt 里的价格、服务和事实必须与页面一致。
  • 多语言网站只做一种语言:等于放弃一部分受众。
  • 文件躺在仓库里却没上线 —— 用直接 URL 检查生产环境。

llms.txt 是 GEO 中性价比最高的动作之一:半小时的工作量,AI 引擎就能拿到你内容的现成地图。我们的版本可以在线查看:neaptide.ai/llms.txt。

常见问题

要点速览

llms.txt 是官方标准吗?

不是 —— 它是社区提出的标准(llmstxt.org,2024 年)。引擎没有义务支持它,但文档平台已在使用该格式,AI 爬虫请求该文件的频率也越来越高。风险为零:它只是一个纯文本文件。

llms.txt 与 sitemap.xml 有什么区别?

Sitemap 列出所有待索引的 URL。llms.txt 是经过整理的「意义地图」:什么最重要、每个页面讲什么、什么值得引用。它用 Markdown 编写,面向模型阅读,而非爬虫。

需要 llms-full.txt 吗?

建议提供。llms.txt 是带链接的索引,而 llms-full.txt 让模型一次请求就获得全部内容,无需逐页抓取。对小型网站来说,这是整体进入上下文窗口最可靠的方式。