KNOWLEDGE / 07LAYER 1当前核心

URL 发现与抓取调度

URL Discovery and Crawling

理解搜索引擎如何从链接、sitemap 和既有 URL 集合发现地址,并在站点承载能力、已知价值与变化信号之间安排抓取。

先修知识搜索引擎工作流与故障分层
解锁能力抓取预算诊断站点架构与内链XML sitemap 设计参数 URL 治理
默认基础robots.txt、HTTP 与服务器日志基础
本页目录 · 11 个学习环节
01

学习契约与正确模型

先明确为什么学、学完能做什么,以及如何证明自己真的掌握。

为什么现在要学

大型 B2B 目录站的筛选参数、PDF、地区副本和过期活动页会制造近乎无限的 URL 空间,挤占服务器与分析注意力;真正重要的产品、行业和集成页反而可能缺少稳定发现路径。

完成本页后,你应能
  • 区分 URL 发现、允许抓取与实际抓取
  • 用日志和站内图谱评估重要 URL 的发现路径
  • 提出兼顾服务器稳定性与页面价值的抓取治理方案
建议节奏

精读 30 分钟 → 引导练习 25 分钟 → 实战任务 60 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。

它是什么
爬虫从已知 URL、可解析链接和 sitemap 扩展 URL 前沿,并依据系统优先级与主机承载约束调度请求。
为什么重要
搜索引擎资源并非对每个 URL 无限分配;重复、低价值和陷阱 URL 会增加无效请求与处理成本。
什么时候使用
用于数万页以上站点、新品发现慢、日志中参数 URL 激增、服务器被爬虫拖慢或迁移后旧 URL 久不消退。
什么时候不要套用
小型健康站点不应把所有收录问题都称为 crawl budget;先排查链接、响应、内容与索引资格。
边界与不确定性
公开的 crawl capacity 与 crawl demand 是概念框架,不代表可计算的固定每日配额。
02

机制精讲

先读完整因果链,再看每个环节留下什么可观察信号。

URL 发现回答“爬虫如何知道地址存在”,抓取调度回答“已知地址何时值得请求”。可解析的内部链接、sitemap、外部链接与历史记录都可能贡献发现信号,但它们的语境和可靠性不同。站点不应把 sitemap 当作信息架构替代品:重要页面若只能出现在一份 XML 文件里,用户和爬虫都缺少稳定的上下文路径。分析时还要把链接是否存在、是否允许抓取、是否真的收到请求以及抓到什么响应分开记录。

大型目录、筛选器和站内搜索很容易制造无穷近似的 URL 空间。治理目标不是追求一个神秘的固定“抓取预算数字”,而是让服务器稳定、减少无价值组合、强化高价值页面的发现与更新证据。Google 公开的 crawl capacity 与 crawl demand 是解释性概念,不是站长可以精确计算或购买的每日额度。真正可操作的是日志中的请求分布、状态码、响应延迟、重要模板重抓间隔、内部点击深度与 URL 生成机制。

01

链接扩展 URL 前沿

爬虫从已知页面解析标准 href,沿链接发现新地址。链接所在页面是否常被抓取、目标是否稳定、是否被脚本事件隐藏,都会影响路径可观察性。导航与上下文链接还能说明页面关系,而纯 sitemap 只提供地址清单。

观察什么爬取站内图谱,检查入链数、来源模板、点击深度、孤立页以及链接是否为可解析的 `<a href>`。
02

Sitemap 提供受控补充

sitemap 适合声明希望搜索系统关注的规范 URL,并可提供可信 lastmod。它不能保证请求、索引或排名;包含重定向、noindex、错误 URL 或伪造更新时间会降低运维价值。

观察什么检查 sitemap HTTP 状态、大小、索引文件、URL 规范性、lastmod 与真实内容更新时间,并对照日志中的抓取。
03

容量与需求共同影响调度

主机持续超时、5xx 或高延迟时,抓取系统可能降低请求以保护站点;对已知价值、更新需求较高的 URL,重抓动机通常更强。SEO 无法观测完整队列,只能通过长期日志和站点变化建立近似判断。

观察什么按周比较 Googlebot 请求量、模板占比、响应时延、5xx 率和重要页面距上次抓取天数。
04

URL 生成逻辑决定浪费上限

排序、会话、日历、筛选和组合参数若通过可跟随链接无限扩展,会不断产生新地址。只在 robots.txt 阻断可能减少内容抓取,却仍让爬虫看到大量地址;更根本的做法是控制链接产生、规范业务状态并合并无价值变体。

观察什么按参数模式聚合日志和爬虫数据,找出 URL 数量增长、请求份额、内容相似度与业务需求。
03

关键概念

掌握术语之间的关系,才能迁移到不同网站、行业和工具。

01

发现路径

可抓取的 `<a href>` 链接通常比依赖点击事件、站内搜索框或孤立 sitemap 记录更稳健;sitemap 是补充而非网站架构替代品。

02

抓取需求

受 URL 已知价值、更新频率、陈旧程度等影响;不是通过制造 sitemap 更新日期就能可靠操控。

03

抓取容量

搜索引擎会考虑站点响应与自身资源;5xx、超时和高延迟可能让抓取降速。

04

完整示范

跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。

WORKED EXAMPLE

参数组合占用目录抓取的日志分析

以下为教学用合成数据。某制造商有 8,000 个规范产品 URL,30 天日志中验证后的 Googlebot 请求共 120,000 次,团队发现新品平均 18 天才首次被请求。

前提与样例口径
  • CDN 和源站日志已合并去重,机器人身份已经验证
  • 产品 URL、分类 URL、参数 URL 和静态资源使用稳定规则分类
  • 请求量只代表抓取行为,不直接代表页面价值、索引或排名
  1. 按 URL 模式建立分布

    输入
    120,000 次请求中,84,000 次带 `sort`、`color` 或 `session` 参数,21,000 次为产品页,9,000 次为分类页,其余为其他页面。
    分析
    参数组合占 70%,但仅凭占比不能证明挤占;先检查其来源、响应和核心页面重抓间隔。
    输出
    得到模板级请求表,并标记参数族、状态码、响应时间和唯一 URL 数。
  2. 追溯生成路径和承载风险

    输入
    筛选控件把每个组合输出为 href;参数页均 200,内容仅商品顺序不同。高峰期参数请求 95 分位响应 2.8 秒,出现 2.4% 的 5xx。
    分析
    可跟随组合链接持续扩展地址,同时高延迟与 5xx 形成容量风险;canonical 指向分类页不能阻止参数 URL 被请求。
    输出
    根因候选为前端链接生成与服务承载,而不是 sitemap priority。
  3. 评估重要页面发现路径

    输入
    新产品有 34% 只在 sitemap,分类页需分页 12 次;旧产品平均每 4 天重抓,新产品首次抓取中位 18 天。
    分析
    核心 URL 的上下文发现弱,与参数空间问题同时存在,应组合治理而非只写 robots 规则。
    输出
    把新品分类入口、分页链接和精选产品模块列为高优先级改造。
  4. 发布并按基线验证

    输入
    控件改为不为无价值组合生成 href,规范分类链接接入新品;四周后参数请求降至 32%,新品首次抓取中位 5 天,5xx 降至 0.3%。
    分析
    趋势符合机制预期,但同期抓取系统和需求可能变化,不能宣称固定因果量级;应继续观察多个周期。
    输出
    治理验收通过,保留回滚条件:关键筛选落地页不得失去用户入口或已验证搜索需求。

结论:主要问题是无价值参数通过可跟随链接持续生成,同时高延迟和 5xx 削弱主机稳定性,且新品缺少上下文入口。修复应先控制 URL 生成、强化产品发现路径和服务稳定性,再针对确有搜索需求的筛选组合保留独立页面。

迁移到真实项目:迁移到其他站点时不要套用“70% 就算浪费”的固定阈值。先定义业务重要 cohort,再联合观察请求分布、生成路径、内容差异、承载风险和发现时延;小站若不存在这些迹象,抓取预算通常不是首要问题。

05

决策规则与证据边界

把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。

信号解释行动限制
重要 URL 仅在 sitemap 中,日志长期无首次请求发现入口可能过弱,也可能是 sitemap 获取、URL 规范或日志覆盖问题。补充来自已抓取分类/专题页的上下文 href,并核验 sitemap 状态与日志层。短观察窗不能证明异常;不同站点和页面的处理时延没有统一保证。
参数 URL 占多数请求且由站内链接无限生成URL 空间膨胀有明确机制,可能增加无效请求和服务器成本。先控制链接生成与产品逻辑,再按需求决定规范化、阻止抓取或独立落地。参数页若承载真实搜索任务,粗暴移除会损害发现、用户导航和既有流量。
5xx、超时与响应延迟同时上升,抓取请求随后下降主机承载可能限制抓取容量,是需要工程参与的高优先级风险。排查 CDN/源站容量,减少昂贵 URL,建立机器人响应监控并在稳定后复测。时间相关不等于唯一因果,部署、攻击流量和日志采集变化也需排除。
小型站点 URL 有稳定内链、200 响应和近期抓取,却未索引抓取预算不太可能是首要解释,应转向索引资格、重复选择、内容与需求。停止反复提交 sitemap,检查渲染、指令、canonical 和页面独特价值。“小型”不是绝对页数阈值,仍需依据真实 URL 空间和服务器表现判断。
可确认
  • 标准 href 链接和 sitemap 都能帮助 URL 发现,但 sitemap 不保证抓取、索引或排名。
  • 服务器日志能证明服务器收到某次请求,状态码与延迟能描述该次响应。
工作推断
  • 日志中低价值 URL 占比、核心页重抓间隔和服务异常共同出现时,可形成抓取治理优先级,但无法还原完整调度算法。
  • 减少无价值地址后重要页面抓取改善支持治理有效,仍应保留对同期变化的说明。
不要声称已知
  • 站外无法知道搜索系统对每个 URL 的精确 crawl demand、队列位置或每日固定额度。
  • 某个 lastmod、链接位置或更新频率对具体 URL 调度产生多大权重并未公开。
06

引导练习

先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。

YOUR TURN

教学用合成数据:站点有 12,000 个产品页和 380,000 个可发现参数 URL。30 天内 Googlebot 请求 90,000 次,其中参数页 54,000、产品页 20,000、404 旧页 9,000;参数页 95 分位响应 2.1 秒,产品页 0.4 秒。20 个战略新品中 12 个只有 sitemap 入口。请制定前三项治理动作和验收指标。

给定材料

  • 日志汇总表:URL 模式、请求数、唯一 URL、状态码、响应分位数和最近抓取
  • 站内图谱表:战略新品的入链数、点击深度、sitemap 状态、首次抓取与业务等级
需要提示时再展开
  1. 区分能减少新 URL 产生的产品改动与只能影响抓取许可的 robots 规则。
  2. 战略新品只有 sitemap 入口是独立问题,应与参数治理并行处理。
完成后核对参考解法

第一项应追溯并停止无搜索价值参数由筛选控件输出可跟随 href,同时保留有真实需求的有限组合,指标是参数唯一 URL 增长和请求占比。第二项处理 9,000 次旧页请求:建立有替代资源的单跳重定向与无替代资源的真实 404/410,并清理内部链接和 sitemap,指标是旧 URL 请求与链路错误趋势。第三项为 12 个战略新品增加来自常抓分类页的上下文链接,核对稳定 200 与规范信号,指标是首次请求时延和被抓取新品比例。还应把参数页高延迟交给工程监控。不能把总请求量上升当唯一成功标准。

自评分量规

0 级只建议重复提交 sitemap 或提高 priority,没有分析 URL 生成、日志与承载。
1 级发现参数页很多,但直接全站 Disallow,未区分真实需求和新品入口。
2 级提出参数、旧页和新品三类动作,但缺少机制顺序或可复测指标。
3 级动作分别对应生成、响应和发现机制,并给出请求占比、首次抓取及错误率指标。
4 级除三级外,还定义样本、时间窗、保留例外、负责人、回滚条件和证据边界。
07

真实项目实战

把理解变成一个可以检查、复核和复用的工作产物。

FIELD LAB

诊断参数页挤占产品目录抓取

制造商网站有 8,000 个产品页,但日志中 70% 的 Googlebot 请求落在颜色、排序和会话参数组合。

  1. 按标准化 URL 聚合 30 天服务器日志,分 Googlebot 类型、状态码、模板与参数
  2. 验证机器人身份并绘制重要模板的请求占比与重抓间隔
  3. 从首页和分类页计算核心产品的点击深度与孤立比例
  4. 为无搜索价值的参数选择链接控制、robots 规则或产品逻辑修复,避免用 canonical 代替抓取控制
  5. 建立核心 URL 抓取占比、5xx 率和发现时延的前后基线
需要交付抓取分布报告与一份按影响、风险、工程成本排序的 URL 空间治理方案。

验收条件

  • 日志样本记录时间范围、机器人验证方式与覆盖局限
  • 方案分别处理发现、抓取和索引,不混用 robots 与 canonical
  • 至少有一个核心模板指标可在发布后复测
08

诊断练习

目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。

SCENARIO

新品在 sitemap 中存在,但上线 14 天仍未看到 Googlebot 请求。

竞争假设

  1. 新品只有 sitemap 入口,站内没有上下文链接
  2. sitemap 获取失败、声明错误或 lastmod 不可信
  3. 站点近期高延迟、5xx 或大量低价值 URL 降低有效抓取

应该检查的证据

  1. 服务器日志与 sitemap 抓取记录
  2. 从已抓取页面到新品的真实 href 路径
  3. 主机响应时延、5xx 与抓取统计趋势

常见陷阱:每天重复提交 sitemap,同时不检查页面是否能从站内导航被发现。

完成后用本页决策规则复核
  1. 若观察到:重要 URL 仅在 sitemap 中,日志长期无首次请求
    应优先:补充来自已抓取分类/专题页的上下文 href,并核验 sitemap 状态与日志层。
    短观察窗不能证明异常;不同站点和页面的处理时延没有统一保证。
  2. 若观察到:参数 URL 占多数请求且由站内链接无限生成
    应优先:先控制链接生成与产品逻辑,再按需求决定规范化、阻止抓取或独立落地。
    参数页若承载真实搜索任务,粗暴移除会损害发现、用户导航和既有流量。
  3. 若观察到:5xx、超时与响应延迟同时上升,抓取请求随后下降
    应优先:排查 CDN/源站容量,减少昂贵 URL,建立机器人响应监控并在稳定后复测。
    时间相关不等于唯一因果,部署、攻击流量和日志采集变化也需排除。
  4. 若观察到:小型站点 URL 有稳定内链、200 响应和近期抓取,却未索引
    应优先:停止反复提交 sitemap,检查渲染、指令、canonical 和页面独特价值。
    “小型”不是绝对页数阈值,仍需依据真实 URL 空间和服务器表现判断。
09

自测与误区

先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。

你应该能回答

1. 重要页面最短发现路径是多少次点击?

参考答案:从一个已经可抓取且较常被访问的入口出发,沿标准 href 到达目标 URL,记录最少边数;同时报告入链来源、是否依赖分页或交互,以及孤立状态。点击深度不是固定排名因子,而是发现与架构风险指标。对只能出现在 sitemap 的页面,应单独标注“无站内路径”。

为什么:最短路径能暴露重要页面是否被埋藏,但单一数字不能代替链接语境、入口质量和日志中的实际抓取证据。

2. 日志里的高抓取 URL 是否等于高业务价值 URL?

参考答案:不等于。高抓取可能来自无限参数、错误循环、频繁变化、历史积累或服务重试;业务价值需要用页面角色、收入、线索、搜索需求和内容更新目标另行定义。应比较“请求份额”和“业务重要 cohort 的覆盖与时延”,而不是把机器人关注自动当作价值。

为什么:抓取日志描述机器请求行为,不包含企业的转化价值判断,也不证明 URL 已索引或排名。

3. 你的治理动作影响的是发现、抓取还是索引?

参考答案:修改可跟随链接和 sitemap 主要影响发现;控制 URL 生成、改善服务响应和某些 robots 规则主要影响抓取路径或成本;noindex、canonical、内容独特性及代表页信号作用于索引资格与选择。一个方案可能跨层,但必须逐项写清预期机制和观测指标,不能混称“解决收录”。

为什么:把行动映射到关卡才能选择正确验收证据,并避免用 canonical 期待停止抓取、用 robots 期待删除索引。

需要避开的误区

  • robots.txt 的 Disallow 能把已知 URL 从索引中删除
  • sitemap 中的 priority 能命令 Google 优先抓取
  • 抓取预算是所有网站的首要 SEO 问题
10

术语与复盘

用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。

URL 前沿
爬虫已知但尚待调度的一组地址的通用概念;站外无法查看搜索引擎真实队列。
发现路径
从已知页面或声明到目标 URL 的入口链,重点检查标准链接、上下文和稳定性。
抓取需求 Crawl demand
公开框架中对 URL 价值、变化与陈旧程度等重抓动机的概括,不是可直接读取的分数。
抓取容量 Crawl capacity
搜索系统在不损害主机稳定性的前提下可能发起请求的约束性概念,受响应与系统资源影响。
抓取陷阱
日历、组合筛选、会话和无限分页等可持续产生近似 URL 的机制。
经验证机器人
不能只信 User-Agent,应通过官方建议的网络身份验证降低伪造日志污染。

离开本页前记住

  1. 发现、允许抓取和实际抓取是三个不同事实。
  2. sitemap 是发现补充,不是内链架构替代品,也不提供收录保证。
  3. 抓取治理要联合 URL 生成、服务器稳定、日志分布和重要页面时延。
  4. canonical 不会阻止参数 URL 被请求,robots 也不是删除索引的通用工具。
  5. 小型健康站点应优先排查链接、响应、渲染与索引资格。
  6. 不存在站长可精确计算的通用每日抓取配额,所有阈值都应来自本站基线。
11

资料与证据

优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。