术语 · 实体

robots.txt

robots.txt 是放在网站根目录的纯文本文件,用 User-agent 与 Disallow 规则告知抓取器哪些路径不要抓取,遵守与否取决于抓取方自愿。

类型
实体
别名
robots 协议 · 爬虫协议 · 机器人排除协议 · robots txt
更新
2026-08-19

robots.txt 是放在网站根目录的纯文本文件,用 User-agent 与 Disallow 规则告知抓取器哪些路径不要抓取,遵守与否取决于抓取方自愿。

它起于 1994 年的社区约定,2022 年由 IETF 以 RFC 9309 标准化为 Robots Exclusion Protocol。路径固定为 /robots.txt,按 User-agent 分组书写,可附 Sitemap: 行指向站点地图

常被搞混的一点

robots.txt 控制的是抓取,不是收录。被 Disallow 的 URL 仍可能因外部链接被列入索引,只是没有正文。要阻止收录需要用 noindex,而 noindex 写在页面里,前提是这个页面允许被抓取——两条规则同时用会互相抵消。

与 AI 抓取器的关系

各家公开了自己抓取器的 user-agent 名称,可按名放行或屏蔽。屏蔽的直接后果是这家模型联网时取不到你的正文,也就不可能把你列为引用源。反过来,允许抓取不等于会被引用。

常见错误

从测试环境带上线的 Disallow: /;屏蔽了静态资源目录导致页面无法正常解析;把参数页规则写得过宽,连正文页一起挡住。上线前用 curl 取一次 /robots.txt 与目标页面核对,是AI 可见性审计技术层的第一步。

相关条目
  • 抓取预算 —— 抓取预算是指抓取器在一段时间内愿意为某个站点花费的抓取量,由服务器承受能力与内容值不值得再抓两方面共同决定。
  • 站点地图 —— 站点地图(sitemap.xml)是列出站点可索引 URL 及其更新时间的 XML 文件,用于告诉抓取器站内有哪些页面、哪些最近变过。
  • llms.txt —— llms.txt 是放在网站根目录的一个 Markdown 纯文本文件,用简洁列表告诉大模型这个站点是什么、有哪些关键页面值得读。
参考来源