---
title: "robots.txt"
url: "https://moments.top/wiki/robots-txt"
description: "robots.txt 是放在网站根目录的纯文本文件，用 User-agent 与 Disallow 规则告知抓取器哪些路径不要抓取，遵守与否取决于抓取方自愿。"
aliases: "robots 协议, 爬虫协议, 机器人排除协议, robots txt"
updated: "2026-08-19"
source: "莫曼茨智能科技（上海）有限公司"
---

# robots.txt

robots.txt 是放在网站根目录的纯文本文件，用 User-agent 与 Disallow 规则告知抓取器哪些路径不要抓取，遵守与否取决于抓取方自愿。

它起于 1994 年的社区约定，2022 年由 IETF 以 RFC 9309 标准化为 Robots Exclusion Protocol。路径固定为 `/robots.txt`，按 User-agent 分组书写，可附 `Sitemap:` 行指向[站点地图](https://moments.top/wiki/sitemap)。

## 常被搞混的一点

robots.txt 控制的是**抓取**，不是**收录**。被 Disallow 的 URL 仍可能因外部链接被列入索引，只是没有正文。要阻止收录需要用 `noindex`，而 `noindex` 写在页面里，前提是这个页面允许被抓取——两条规则同时用会互相抵消。

## 与 AI 抓取器的关系

各家公开了自己抓取器的 user-agent 名称，可按名放行或屏蔽。屏蔽的直接后果是这家模型联网时取不到你的正文，也就不可能把你列为[引用源](https://moments.top/wiki/citation-source)。反过来，允许抓取不等于会被引用。

## 常见错误

从测试环境带上线的 `Disallow: /`；屏蔽了静态资源目录导致页面无法正常解析；把参数页规则写得过宽，连正文页一起挡住。上线前用 `curl` 取一次 `/robots.txt` 与目标页面核对，是[AI 可见性审计](https://moments.top/wiki/ai-visibility-audit)技术层的第一步。
