术语 · 实体

llms.txt

llms.txt 是放在网站根目录的一个 Markdown 纯文本文件,用简洁列表告诉大模型这个站点是什么、有哪些关键页面值得读。

类型
实体
别名
llms txt · llms.txt 文件
更新
2026-08-18

llms.txt 是放在网站根目录的一个 Markdown 纯文本文件,用简洁列表告诉大模型这个站点是什么、有哪些关键页面值得读。

它由 Jeremy Howard 于 2024 年提出,形式上类比 robots.txtsitemap.xml:路径固定为 /llms.txt,内容以 text/plain 返回。区别在于目的——robots.txt 说”哪些不要抓”,sitemap 列出全部 URL,llms.txt 说”先读这几个,它们最能说明我是谁”。

典型结构

  • 一级标题:站点或组织名称。
  • 引用块:一句话简介。
  • 若干二级标题分栏目,每栏是链接列表,每条链接后跟一句说明。
  • 可选的 ## Optional 段落,标记次要内容。

为什么它有用

模型客户端在抓取网站时面对的是导航、脚本和样板文字混杂的 HTML,上下文窗口很快被无关内容填满。一个几 KB 的纯文本清单让它在一次请求内拿到全站骨架。对术语库、文档站这类结构清晰的内容,效果尤其明显。

现状与局限

llms.txt 是社区约定而非标准,没有强制力,各家模型是否读取、如何使用都不公开。它不能保证内容被采信,也不改变模型已有的认知——只是降低获取成本。同样地,它不能替代 Schema 结构化数据:结构化数据标注事实字段,llms.txt 只提供导航。

常见变体

部分站点同时提供 /llms-full.txt(全文合并)和给每个页面追加 .md 后缀的纯 Markdown 版本,让模型能拿到不含导航与脚本的正文原文。

相关条目
  • Schema 结构化数据 —— Schema 结构化数据是按 Schema.org 词表把页面事实标注成机器可读格式(通常是 JSON-LD)的做法,让程序不必从正文里猜实体和关系。
  • 生成引擎优化 —— 生成引擎优化(GEO)是让品牌在 AI 生成的答案中被准确提及和推荐的一套优化方法。