术语 · 实体
robots.txt
robots.txt 是放在网站根目录的纯文本文件,用 User-agent 与 Disallow 规则告知抓取器哪些路径不要抓取,遵守与否取决于抓取方自愿。
robots.txt 是放在网站根目录的纯文本文件,用 User-agent 与 Disallow 规则告知抓取器哪些路径不要抓取,遵守与否取决于抓取方自愿。
它起于 1994 年的社区约定,2022 年由 IETF 以 RFC 9309 标准化为 Robots Exclusion Protocol。路径固定为 /robots.txt,按 User-agent 分组书写,可附 Sitemap: 行指向站点地图。
常被搞混的一点
robots.txt 控制的是抓取,不是收录。被 Disallow 的 URL 仍可能因外部链接被列入索引,只是没有正文。要阻止收录需要用 noindex,而 noindex 写在页面里,前提是这个页面允许被抓取——两条规则同时用会互相抵消。
与 AI 抓取器的关系
各家公开了自己抓取器的 user-agent 名称,可按名放行或屏蔽。屏蔽的直接后果是这家模型联网时取不到你的正文,也就不可能把你列为引用源。反过来,允许抓取不等于会被引用。
常见错误
从测试环境带上线的 Disallow: /;屏蔽了静态资源目录导致页面无法正常解析;把参数页规则写得过宽,连正文页一起挡住。上线前用 curl 取一次 /robots.txt 与目标页面核对,是AI 可见性审计技术层的第一步。