学习契约与正确模型
先明确为什么学、学完能做什么,以及如何证明自己真的掌握。
大型 B2B 目录站的筛选参数、PDF、地区副本和过期活动页会制造近乎无限的 URL 空间,挤占服务器与分析注意力;真正重要的产品、行业和集成页反而可能缺少稳定发现路径。
- 区分 URL 发现、允许抓取与实际抓取
- 用日志和站内图谱评估重要 URL 的发现路径
- 提出兼顾服务器稳定性与页面价值的抓取治理方案
精读 30 分钟 → 引导练习 25 分钟 → 实战任务 60 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。
- 它是什么
- 爬虫从已知 URL、可解析链接和 sitemap 扩展 URL 前沿,并依据系统优先级与主机承载约束调度请求。
- 为什么重要
- 搜索引擎资源并非对每个 URL 无限分配;重复、低价值和陷阱 URL 会增加无效请求与处理成本。
- 什么时候使用
- 用于数万页以上站点、新品发现慢、日志中参数 URL 激增、服务器被爬虫拖慢或迁移后旧 URL 久不消退。
- 什么时候不要套用
- 小型健康站点不应把所有收录问题都称为 crawl budget;先排查链接、响应、内容与索引资格。
- 边界与不确定性
- 公开的 crawl capacity 与 crawl demand 是概念框架,不代表可计算的固定每日配额。
机制精讲
先读完整因果链,再看每个环节留下什么可观察信号。
URL 发现回答“爬虫如何知道地址存在”,抓取调度回答“已知地址何时值得请求”。可解析的内部链接、sitemap、外部链接与历史记录都可能贡献发现信号,但它们的语境和可靠性不同。站点不应把 sitemap 当作信息架构替代品:重要页面若只能出现在一份 XML 文件里,用户和爬虫都缺少稳定的上下文路径。分析时还要把链接是否存在、是否允许抓取、是否真的收到请求以及抓到什么响应分开记录。
大型目录、筛选器和站内搜索很容易制造无穷近似的 URL 空间。治理目标不是追求一个神秘的固定“抓取预算数字”,而是让服务器稳定、减少无价值组合、强化高价值页面的发现与更新证据。Google 公开的 crawl capacity 与 crawl demand 是解释性概念,不是站长可以精确计算或购买的每日额度。真正可操作的是日志中的请求分布、状态码、响应延迟、重要模板重抓间隔、内部点击深度与 URL 生成机制。
链接扩展 URL 前沿
爬虫从已知页面解析标准 href,沿链接发现新地址。链接所在页面是否常被抓取、目标是否稳定、是否被脚本事件隐藏,都会影响路径可观察性。导航与上下文链接还能说明页面关系,而纯 sitemap 只提供地址清单。
Sitemap 提供受控补充
sitemap 适合声明希望搜索系统关注的规范 URL,并可提供可信 lastmod。它不能保证请求、索引或排名;包含重定向、noindex、错误 URL 或伪造更新时间会降低运维价值。
容量与需求共同影响调度
主机持续超时、5xx 或高延迟时,抓取系统可能降低请求以保护站点;对已知价值、更新需求较高的 URL,重抓动机通常更强。SEO 无法观测完整队列,只能通过长期日志和站点变化建立近似判断。
URL 生成逻辑决定浪费上限
排序、会话、日历、筛选和组合参数若通过可跟随链接无限扩展,会不断产生新地址。只在 robots.txt 阻断可能减少内容抓取,却仍让爬虫看到大量地址;更根本的做法是控制链接产生、规范业务状态并合并无价值变体。
关键概念
掌握术语之间的关系,才能迁移到不同网站、行业和工具。
发现路径
可抓取的 `<a href>` 链接通常比依赖点击事件、站内搜索框或孤立 sitemap 记录更稳健;sitemap 是补充而非网站架构替代品。
抓取需求
受 URL 已知价值、更新频率、陈旧程度等影响;不是通过制造 sitemap 更新日期就能可靠操控。
抓取容量
搜索引擎会考虑站点响应与自身资源;5xx、超时和高延迟可能让抓取降速。
完整示范
跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。
参数组合占用目录抓取的日志分析
以下为教学用合成数据。某制造商有 8,000 个规范产品 URL,30 天日志中验证后的 Googlebot 请求共 120,000 次,团队发现新品平均 18 天才首次被请求。
- CDN 和源站日志已合并去重,机器人身份已经验证
- 产品 URL、分类 URL、参数 URL 和静态资源使用稳定规则分类
- 请求量只代表抓取行为,不直接代表页面价值、索引或排名
按 URL 模式建立分布
- 输入
- 120,000 次请求中,84,000 次带 `sort`、`color` 或 `session` 参数,21,000 次为产品页,9,000 次为分类页,其余为其他页面。
- 分析
- 参数组合占 70%,但仅凭占比不能证明挤占;先检查其来源、响应和核心页面重抓间隔。
- 输出
- 得到模板级请求表,并标记参数族、状态码、响应时间和唯一 URL 数。
追溯生成路径和承载风险
- 输入
- 筛选控件把每个组合输出为 href;参数页均 200,内容仅商品顺序不同。高峰期参数请求 95 分位响应 2.8 秒,出现 2.4% 的 5xx。
- 分析
- 可跟随组合链接持续扩展地址,同时高延迟与 5xx 形成容量风险;canonical 指向分类页不能阻止参数 URL 被请求。
- 输出
- 根因候选为前端链接生成与服务承载,而不是 sitemap priority。
评估重要页面发现路径
- 输入
- 新产品有 34% 只在 sitemap,分类页需分页 12 次;旧产品平均每 4 天重抓,新产品首次抓取中位 18 天。
- 分析
- 核心 URL 的上下文发现弱,与参数空间问题同时存在,应组合治理而非只写 robots 规则。
- 输出
- 把新品分类入口、分页链接和精选产品模块列为高优先级改造。
发布并按基线验证
- 输入
- 控件改为不为无价值组合生成 href,规范分类链接接入新品;四周后参数请求降至 32%,新品首次抓取中位 5 天,5xx 降至 0.3%。
- 分析
- 趋势符合机制预期,但同期抓取系统和需求可能变化,不能宣称固定因果量级;应继续观察多个周期。
- 输出
- 治理验收通过,保留回滚条件:关键筛选落地页不得失去用户入口或已验证搜索需求。
决策规则与证据边界
把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。
- 标准 href 链接和 sitemap 都能帮助 URL 发现,但 sitemap 不保证抓取、索引或排名。
- 服务器日志能证明服务器收到某次请求,状态码与延迟能描述该次响应。
- 日志中低价值 URL 占比、核心页重抓间隔和服务异常共同出现时,可形成抓取治理优先级,但无法还原完整调度算法。
- 减少无价值地址后重要页面抓取改善支持治理有效,仍应保留对同期变化的说明。
- 站外无法知道搜索系统对每个 URL 的精确 crawl demand、队列位置或每日固定额度。
- 某个 lastmod、链接位置或更新频率对具体 URL 调度产生多大权重并未公开。
引导练习
先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。
教学用合成数据:站点有 12,000 个产品页和 380,000 个可发现参数 URL。30 天内 Googlebot 请求 90,000 次,其中参数页 54,000、产品页 20,000、404 旧页 9,000;参数页 95 分位响应 2.1 秒,产品页 0.4 秒。20 个战略新品中 12 个只有 sitemap 入口。请制定前三项治理动作和验收指标。
给定材料
- 日志汇总表:URL 模式、请求数、唯一 URL、状态码、响应分位数和最近抓取
- 站内图谱表:战略新品的入链数、点击深度、sitemap 状态、首次抓取与业务等级
需要提示时再展开
- 区分能减少新 URL 产生的产品改动与只能影响抓取许可的 robots 规则。
- 战略新品只有 sitemap 入口是独立问题,应与参数治理并行处理。
完成后核对参考解法
第一项应追溯并停止无搜索价值参数由筛选控件输出可跟随 href,同时保留有真实需求的有限组合,指标是参数唯一 URL 增长和请求占比。第二项处理 9,000 次旧页请求:建立有替代资源的单跳重定向与无替代资源的真实 404/410,并清理内部链接和 sitemap,指标是旧 URL 请求与链路错误趋势。第三项为 12 个战略新品增加来自常抓分类页的上下文链接,核对稳定 200 与规范信号,指标是首次请求时延和被抓取新品比例。还应把参数页高延迟交给工程监控。不能把总请求量上升当唯一成功标准。
自评分量规
真实项目实战
把理解变成一个可以检查、复核和复用的工作产物。
诊断参数页挤占产品目录抓取
制造商网站有 8,000 个产品页,但日志中 70% 的 Googlebot 请求落在颜色、排序和会话参数组合。
- 按标准化 URL 聚合 30 天服务器日志,分 Googlebot 类型、状态码、模板与参数
- 验证机器人身份并绘制重要模板的请求占比与重抓间隔
- 从首页和分类页计算核心产品的点击深度与孤立比例
- 为无搜索价值的参数选择链接控制、robots 规则或产品逻辑修复,避免用 canonical 代替抓取控制
- 建立核心 URL 抓取占比、5xx 率和发现时延的前后基线
验收条件
- 日志样本记录时间范围、机器人验证方式与覆盖局限
- 方案分别处理发现、抓取和索引,不混用 robots 与 canonical
- 至少有一个核心模板指标可在发布后复测
诊断练习
目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。
新品在 sitemap 中存在,但上线 14 天仍未看到 Googlebot 请求。
竞争假设
- 新品只有 sitemap 入口,站内没有上下文链接
- sitemap 获取失败、声明错误或 lastmod 不可信
- 站点近期高延迟、5xx 或大量低价值 URL 降低有效抓取
应该检查的证据
- 服务器日志与 sitemap 抓取记录
- 从已抓取页面到新品的真实 href 路径
- 主机响应时延、5xx 与抓取统计趋势
常见陷阱:每天重复提交 sitemap,同时不检查页面是否能从站内导航被发现。
完成后用本页决策规则复核
- 若观察到:重要 URL 仅在 sitemap 中,日志长期无首次请求
应优先:补充来自已抓取分类/专题页的上下文 href,并核验 sitemap 状态与日志层。
短观察窗不能证明异常;不同站点和页面的处理时延没有统一保证。 - 若观察到:参数 URL 占多数请求且由站内链接无限生成
应优先:先控制链接生成与产品逻辑,再按需求决定规范化、阻止抓取或独立落地。
参数页若承载真实搜索任务,粗暴移除会损害发现、用户导航和既有流量。 - 若观察到:5xx、超时与响应延迟同时上升,抓取请求随后下降
应优先:排查 CDN/源站容量,减少昂贵 URL,建立机器人响应监控并在稳定后复测。
时间相关不等于唯一因果,部署、攻击流量和日志采集变化也需排除。 - 若观察到:小型站点 URL 有稳定内链、200 响应和近期抓取,却未索引
应优先:停止反复提交 sitemap,检查渲染、指令、canonical 和页面独特价值。
“小型”不是绝对页数阈值,仍需依据真实 URL 空间和服务器表现判断。
自测与误区
先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。
你应该能回答
1. 重要页面最短发现路径是多少次点击?
参考答案:从一个已经可抓取且较常被访问的入口出发,沿标准 href 到达目标 URL,记录最少边数;同时报告入链来源、是否依赖分页或交互,以及孤立状态。点击深度不是固定排名因子,而是发现与架构风险指标。对只能出现在 sitemap 的页面,应单独标注“无站内路径”。
为什么:最短路径能暴露重要页面是否被埋藏,但单一数字不能代替链接语境、入口质量和日志中的实际抓取证据。
2. 日志里的高抓取 URL 是否等于高业务价值 URL?
参考答案:不等于。高抓取可能来自无限参数、错误循环、频繁变化、历史积累或服务重试;业务价值需要用页面角色、收入、线索、搜索需求和内容更新目标另行定义。应比较“请求份额”和“业务重要 cohort 的覆盖与时延”,而不是把机器人关注自动当作价值。
为什么:抓取日志描述机器请求行为,不包含企业的转化价值判断,也不证明 URL 已索引或排名。
3. 你的治理动作影响的是发现、抓取还是索引?
参考答案:修改可跟随链接和 sitemap 主要影响发现;控制 URL 生成、改善服务响应和某些 robots 规则主要影响抓取路径或成本;noindex、canonical、内容独特性及代表页信号作用于索引资格与选择。一个方案可能跨层,但必须逐项写清预期机制和观测指标,不能混称“解决收录”。
为什么:把行动映射到关卡才能选择正确验收证据,并避免用 canonical 期待停止抓取、用 robots 期待删除索引。
需要避开的误区
- robots.txt 的 Disallow 能把已知 URL 从索引中删除
- sitemap 中的 priority 能命令 Google 优先抓取
- 抓取预算是所有网站的首要 SEO 问题
术语与复盘
用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。
- URL 前沿
- 爬虫已知但尚待调度的一组地址的通用概念;站外无法查看搜索引擎真实队列。
- 发现路径
- 从已知页面或声明到目标 URL 的入口链,重点检查标准链接、上下文和稳定性。
- 抓取需求 Crawl demand
- 公开框架中对 URL 价值、变化与陈旧程度等重抓动机的概括,不是可直接读取的分数。
- 抓取容量 Crawl capacity
- 搜索系统在不损害主机稳定性的前提下可能发起请求的约束性概念,受响应与系统资源影响。
- 抓取陷阱
- 日历、组合筛选、会话和无限分页等可持续产生近似 URL 的机制。
- 经验证机器人
- 不能只信 User-Agent,应通过官方建议的网络身份验证降低伪造日志污染。
离开本页前记住
- 发现、允许抓取和实际抓取是三个不同事实。
- sitemap 是发现补充,不是内链架构替代品,也不提供收录保证。
- 抓取治理要联合 URL 生成、服务器稳定、日志分布和重要页面时延。
- canonical 不会阻止参数 URL 被请求,robots 也不是删除索引的通用工具。
- 小型健康站点应优先排查链接、响应、渲染与索引资格。
- 不存在站长可精确计算的通用每日抓取配额,所有阈值都应来自本站基线。
资料与证据
优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。