术语 · 实体
llms.txt
llms.txt 是放在网站根目录的一个 Markdown 纯文本文件,用简洁列表告诉大模型这个站点是什么、有哪些关键页面值得读。
llms.txt 是放在网站根目录的一个 Markdown 纯文本文件,用简洁列表告诉大模型这个站点是什么、有哪些关键页面值得读。
它由 Jeremy Howard 于 2024 年提出,形式上类比 robots.txt 和 sitemap.xml:路径固定为 /llms.txt,内容以 text/plain 返回。区别在于目的——robots.txt 说”哪些不要抓”,sitemap 列出全部 URL,llms.txt 说”先读这几个,它们最能说明我是谁”。
典型结构
- 一级标题:站点或组织名称。
- 引用块:一句话简介。
- 若干二级标题分栏目,每栏是链接列表,每条链接后跟一句说明。
- 可选的
## Optional段落,标记次要内容。
为什么它有用
模型客户端在抓取网站时面对的是导航、脚本和样板文字混杂的 HTML,上下文窗口很快被无关内容填满。一个几 KB 的纯文本清单让它在一次请求内拿到全站骨架。对术语库、文档站这类结构清晰的内容,效果尤其明显。
现状与局限
llms.txt 是社区约定而非标准,没有强制力,各家模型是否读取、如何使用都不公开。它不能保证内容被采信,也不改变模型已有的认知——只是降低获取成本。同样地,它不能替代 Schema 结构化数据:结构化数据标注事实字段,llms.txt 只提供导航。
常见变体
部分站点同时提供 /llms-full.txt(全文合并)和给每个页面追加 .md 后缀的纯 Markdown 版本,让模型能拿到不含导航与脚本的正文原文。
- Schema 结构化数据 —— Schema 结构化数据是按 Schema.org 词表把页面事实标注成机器可读格式(通常是 JSON-LD)的做法,让程序不必从正文里猜实体和关系。
- 生成引擎优化 —— 生成引擎优化(GEO)是让品牌在 AI 生成的答案中被准确提及和推荐的一套优化方法。