---
title: "抓取预算"
url: "https://moments.top/wiki/crawl-budget"
description: "抓取预算是指抓取器在一段时间内愿意为某个站点花费的抓取量，由服务器承受能力与内容值不值得再抓两方面共同决定。"
aliases: "爬虫抓取预算, crawl budget, 抓取配额, 爬取预算"
updated: "2026-08-19"
source: "莫曼茨智能科技（上海）有限公司"
---

# 抓取预算

抓取预算是指抓取器在一段时间内愿意为某个站点花费的抓取量，由服务器承受能力与内容值不值得再抓两方面共同决定。

Google 在其文档中把它拆成两部分：抓取速率上限，取决于站点响应速度与错误率，站点变慢或频繁报错时抓取会自动减速；抓取需求，取决于 URL 的受欢迎程度与陈旧程度，长期不变的页面会被越抓越少。

## 什么在浪费预算

无限的参数组合与筛选页、大量内容重复的地址、软 404（返回 200 的空结果页）、多级跳转链、被大量低价值页稀释的站点结构。抓取器把配额花在这些地址上，真正的内容页就更新得慢。

## 对多数站点不是瓶颈

Google 的文档明确指出，几千个页面量级的站点通常不需要为抓取预算做专门优化。它成为问题一般出现在页面量极大、或自动生成 URL 失控的站点上。中小站点把响应速度、状态码正确性、[规范链接](https://moments.top/wiki/canonical)与[站点地图](https://moments.top/wiki/sitemap)做对，就已经覆盖了绝大部分收益。

## 模型侧抓取器

各家 AI 抓取器如何分配抓取量并未公开，只能通过服务器日志观察实际访问频率。能确定的仍是那几条工程基本功：响应快、状态码正确、正文在 HTML 里（见[服务端渲染与客户端渲染](https://moments.top/wiki/ssr-vs-csr)）、[robots.txt](https://moments.top/wiki/robots-txt) 没有误屏蔽。
