学习契约与正确模型
先明确为什么学、学完能做什么,以及如何证明自己真的掌握。
B2B 网站常把“没有排名”笼统归因于内容质量。实际上,新产品页可能未被发现、JavaScript 正文未渲染、重复页未选为规范页,或虽已索引却不匹配查询。分层能阻止团队在错误环节投入写作与外链预算。
- 画出任意 URL 从链接发现到搜索结果曝光的证据链
- 依据症状区分可发现性、可抓取性、可索引性与可排序性
- 为每个关卡指定至少一种观测工具和验证方法
精读 28 分钟 → 引导练习 22 分钟 → 实战任务 45 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。
- 它是什么
- 搜索引擎不是一次性“读取并排名”,而是多个异步系统组成的处理链;同一 URL 在不同关卡可能处于不同状态。
- 为什么重要
- 每个关卡有不同输入、失败模式与时延,只有先定位关卡,修复动作才可证伪。
- 什么时候使用
- 用于新站上线、页面不收录、流量骤降、迁移复盘,以及向产品与工程解释 SEO 依赖。
- 什么时候不要套用
- 不能把这条简化流程当成 Google 内部架构图,也不能由一次 URL 检查推断全站状态。
- 边界与不确定性
- 这是诊断心智模型;Google 会持续重抓、重处理并使用多套系统,公开文档没有披露完整生产实现。
机制精讲
先读完整因果链,再看每个环节留下什么可观察信号。
搜索引擎工作流是一张用于诊断的地图,不是一条描述 Google 内部实现的精确生产流水线。对 SEO 学习者最有用的划分是发现、抓取、渲染、索引、检索、排序与呈现:前一关提供后一关所需的输入,但不同关卡可以异步重试,同一 URL 也可能在不同数据源中呈现不同时间截面。使用这张地图的关键不是背诵七个名词,而是看到异常时先问“最早在哪一关失去可观察证据”,再把行动限制在该关能够改变的变量上。
例如产品页没有点击,可能是站内没有可跟随链接,服务器没有收到合格爬虫请求,渲染后主体为空,页面不具备索引资格,被归入另一个规范 URL,未进入目标查询候选,排序竞争不足,或者虽然位置稳定却被新的搜索功能压缩点击空间。这些原因需要完全不同的证据和负责人。完整诊断应保存 URL 样本、时间窗口、工具口径、支持与反对证据以及下一次复查日期,避免把一次截图或一次 URL 检查当成长期事实。
发现与抓取形成输入队列
链接、sitemap 和历史已知地址让爬虫知道 URL 存在;调度系统再结合站点承载、内容变化和既有信号决定何时请求。发现只表示地址进入候选集合,服务器日志中出现经过身份验证的请求才是实际抓取证据。
渲染与索引形成可检索表示
抓到响应后,系统可能处理 HTML、资源和 JavaScript 结果,提取正文、链接、元数据与结构。随后判断页面是否允许索引、是否与其他 URL 高度相似以及哪个 URL 作为代表。抓取成功既不保证渲染完整,也不保证进入索引。
检索与排序处理具体查询
索引中的页面仍需针对某个查询被召回为候选,之后才会由相关性、质量、上下文及其他系统组织顺序。零曝光不能直接证明未召回,因为报告存在阈值与维度限制;有曝光则至少说明在某些条件下进入了可展示结果。
呈现把系统结果转为用户机会
最终页面还会选择标题、摘要并组织广告、图片、视频、答案模块等元素。传统名次相近时,可见像素与点击机会仍可能不同,因此点击变化不能只用平均位置解释,业务质量也不能只用点击率解释。
关键概念
掌握术语之间的关系,才能迁移到不同网站、行业和工具。
关卡状态
“已抓取”不等于“已索引”,“已索引”不等于“对目标查询可检索”,“可检索”也不保证进入用户看到的结果。
证据链
从内部链接或 sitemap、抓取日志、渲染后 HTML、索引状态,一直连接到 query-page impressions;每个结论标注时间与数据范围。
处理时延
发现、重抓、重处理和排名变化并非同步完成,验证计划必须给不同改动设置合理观察窗口。
完整示范
跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。
工业传感器新品页零曝光的七关诊断
以下均为教学用合成数据。新品页 `/sensors/tx-400` 上线 21 天,团队看到目标查询零曝光,准备购买外链。我们用同一 URL 和同一日期范围寻找最早失败关卡。
- 服务器日志已按官方建议验证爬虫身份,排除伪造 User-Agent
- 目标市场为英文美国桌面搜索,分析窗口为上线日至第 21 天
- 示例只演示诊断方法,不声称复现任何搜索引擎内部算法
核对发现入口
- 输入
- 首页到新品需 5 次点击;新品在产品 sitemap 中,分类页按钮由点击事件跳转,没有 `<a href>`。
- 分析
- sitemap 能提供地址,但核心页面缺少稳定上下文链接,发现路径比相邻产品弱。先记录风险,不能据此断言从未发现。
- 输出
- 发现关卡状态标为“有 sitemap 证据、内部链接证据不足”,提出把分类卡片改为普通可跟随链接。
用日志确认抓取
- 输入
- 21 天日志中 `/sensors/tx-400` 有两次已验证 Googlebot 请求,均返回 200,响应约 180ms。
- 分析
- 实际请求证明 URL 已被发现并抓取,因而“完全未发现”不再是当前最早失败点;仍保留链接改进作为长期治理。
- 输出
- 发现与抓取暂记通过,附请求时间、状态、字节数和日志查询。
比较渲染与索引信号
- 输入
- 原始 HTML 只有应用壳;渲染测试显示产品正文,但 canonical 指向旧型号 `/sensors/tx-300`。URL 检查显示系统选择旧型号为规范页。
- 分析
- 正文可渲染,但规范信号把新品并入旧页面,独立 URL 没有成为代表。此证据比“内容不够长”更接近最早可确认故障。
- 输出
- 索引/规范化关卡标为失败,工程任务是修正模板 canonical 并复核两页内容与内部链接。
设定验证与停止条件
- 输入
- 修复于第 22 天发布;第 30 天重抓,第 38 天系统所选 canonical 改为自身,第 45 天出现 37 次相关查询曝光。
- 分析
- 时间线与关卡信号依次恢复,支持修复有效,但曝光增长仍不能证明未来排名或因果量级;同期变化必须保留。
- 输出
- 诊断卡结论为“首要故障是错误 canonical”;后续转入查询匹配与排序评估,不再重复提交索引。
决策规则与证据边界
把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。
- 搜索平台公开说明抓取、索引和结果呈现是不同处理阶段,抓取不保证索引,索引也不保证对特定查询展示。
- HTTP 响应、服务器日志、原始与渲染 HTML、索引状态及页面查询曝光分别能观察不同关卡。
- 把公开流程拆成七关是便于 SEO 诊断的工作模型,可用于组织证据,但不是 Google 内部架构或严格线性时序。
- 关卡修复后指标依次恢复能增强因果解释,仍需排除同期发布、需求和报告口径变化。
- 公开资料没有披露每个 URL 的完整调度队列、处理时点、候选生成逻辑或查询级权重。
- 单次 URL 检查和手工 SERP 无法证明所有数据中心、用户环境与未来状态。
引导练习
先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。
教学用合成数据:三页同时上线 28 天。A 页无内链、在 sitemap 中、日志无已验证请求;B 页有 4 次 200 抓取,渲染正文为空且 noindex 不存在;C 页已索引,有 420 次目标查询曝光、平均位置 17、CTR 0.7%。请为每页判定最早有证据的故障关卡、仍未知的信息和下一项最低成本检查。
给定材料
- 页面表:A/B/C 的链接入口、状态码、原始 HTML、渲染 HTML、canonical 与 URL 检查结果
- 日志与效果表:28 天已验证机器人请求、page-query impressions、position、CTR 和数据提取日期
需要提示时再展开
- 不要把“没有日志”直接等同于没有发现,先检查日志覆盖层与机器人验证。
- C 页已经有曝光,不应继续把主要行动放在提交 sitemap;要转向查询、排序与呈现证据。
完成后核对参考解法
A 页应标为“发现/抓取未知且高风险”:缺内链是发现弱信号,sitemap 只证明主动声明,日志无请求需先确认 CDN 与源站日志是否完整;下一步是补可跟随链接并核验 sitemap 抓取与日志覆盖。B 页最早确认失败在渲染,因为已有 200 抓取而渲染主体为空;应检查脚本、API、资源许可与失败降级,不能先写更多正文。C 页的上游关卡已有最低通过证据:系统至少在某些查询条件下展示过它;下一步应按查询意图、竞争页面和设备分析排名与 CTR。三页结论都要保留日期、样本和未知项,不能把教学数据外推为真实平台保证。
自评分量规
真实项目实战
把理解变成一个可以检查、复核和复用的工作产物。
为 B2B 产品页建立搜索生命周期卡片
一个工业传感器新品页上线三周,没有任何自然搜索曝光,销售团队要求立即增加外链。
- 确认页面有可跟随的内部链接、sitemap 记录及稳定 200 响应
- 比对原始响应与渲染后 HTML,确认主内容、canonical、robots 指令一致
- 用 URL 检查与页面索引报告确认 Google 所选规范页和索引状态
- 在效果报告按页面与查询检查 impressions,区分未检索到与有曝光但排名低
- 把证据、最可能关卡、下一项测试和复查日期写入卡片
验收条件
- 每个状态都有带日期的可复核证据,不用“应该”“可能已经”代替
- 行动针对最早失败的关卡,不跨关卡跳到外链或重写
- 明确未知项以及获取证据的下一步
诊断练习
目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。
页面 URL 检查显示已编入索引,但目标查询连续 28 天零曝光。
竞争假设
- 查询需求或词形判断错误,页面没有进入该查询的候选集合
- Google 选择的规范页与被分析 URL 不同
- 页面可被检索但与现有结果相比相关性或竞争力不足
应该检查的证据
- 页面级 impressions 与相邻查询数据
- Google 所选 canonical、站内 canonical 与重复页集合
- 目标 SERP 的页面类型、意图与内容差距
常见陷阱:把“已索引”解释为“理应获得排名”,然后用重复提交索引替代查询与页面诊断。
完成后用本页决策规则复核
- 若观察到:没有可解析内链、sitemap 记录或已验证爬虫请求
应优先:先补稳定发现入口并验证日志口径,再决定是否需要抓取调度治理。
sitemap 出现不等于已抓取;日志没有记录也可能来自保留期或 CDN 层缺失。 - 若观察到:有 200 抓取,但渲染后主体、链接或元数据缺失
应优先:复现资源/API 失败,定义无需交互即可获得的核心 HTML,并以渲染结果验收。
一次测试工具结果是采样,需结合日志、多个 URL 和失败条件测试。 - 若观察到:已索引且有 impressions,但名次或点击不足
应优先:按查询族和设备拆分,比较结果类型、页面证据、标题摘要与业务转化。
报告阈值和聚合会隐藏低量查询,不能据此宣称页面对所有查询均可检索。 - 若观察到:异常覆盖整个模板且与一次发布同时开始
应优先:先复查发布差异并建立受影响 cohort,必要时回滚,再对恢复指标设观察窗。
时间相邻只形成优先假设,仍需响应、DOM、指令或日志证据建立机制链。
自测与误区
先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。
你应该能回答
1. 目标 URL 当前最早失败的关卡是什么?证据是什么?
参考答案:从最早能被观测的环节开始判定:先查稳定发现入口与已验证日志请求,再比较原始/渲染内容、索引资格和系统所选规范页,最后看 page-query 曝光。第一个缺少预期输出且有直接证据的关卡就是当前最早失败点;若日志或工具覆盖不足,应写“未知”而不是猜测。
为什么:上游失败会限制下游,用顺序证据能避免在未抓取或错误规范化的页面上先做外链、扩写和 CTR 优化。
2. 如果 URL 已索引却无曝光,你会先验证哪三个假设?
参考答案:先验证三个竞争假设:其一,目标查询需求或页面类型判断错误,页面没有稳定进入候选;其二,分析 URL 与系统所选规范页不同,曝光聚合到了另一地址;其三,页面可以检索但相对结果的任务匹配、可信证据或竞争力不足。分别用查询族数据、canonical 集合和 SERP/页面对照取证。
为什么:“已索引”只解决资格与代表页的一部分,不承诺特定查询召回、排序或展示,因此必须把检索与竞争问题继续拆开。
3. 哪些数据只能说明相关性,不能证明因果?
参考答案:手工 SERP、排名与常见页面特征、改版与流量同时变化、链接数量与高排名等都只能先说明相关。更接近因果需要预先假设、明确机制、对照或分批发布、稳定测量口径、排除同期变化并观察预期领先指标。即便如此,外部搜索系统变化也会保留不确定性。
为什么:相关证据适合生成假设,不足以证明单一改动导致结果;记录反证与时间线可以降低但不能消除混杂。
需要避开的误区
- 抓取、索引和排名是同一个动作
- 一次 site: 查询可以精确证明索引状态
- 提交 sitemap 会保证抓取、索引或排名
术语与复盘
用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。
- 发现 Discovery
- 搜索系统得知某个 URL 存在的过程,来源可包括可跟随链接、sitemap 与历史地址;不等于已经请求。
- 抓取 Crawling
- 爬虫向 URL 发起请求并获得响应的过程,应通过已验证机器人日志、状态码和时间确认。
- 渲染 Rendering
- 处理页面资源与脚本、形成可抽取 DOM 表示的过程;与用户登录后的交互状态不必相同。
- 索引 Indexing
- 分析内容、指令与重复关系并决定是否保存可供后续检索的表示;索引资格不等于保证收录。
- 候选检索 Retrieval
- 针对具体查询从索引中找到可能相关页面的阶段,与最终排序名次相区别。
- 排序 Ranking
- 对候选结果应用多类信号和系统进行相对组织,公开资料不提供可逆推出的统一权重表。
- 呈现 Serving
- 在特定设备、地区和查询环境中组织标题、摘要及搜索功能,把系统结果转为用户可见页面。
离开本页前记住
- 先定位最早失败关卡,再选择行动,避免用下游优化掩盖上游故障。
- 发现、抓取、渲染、索引、检索、排序和呈现分别需要不同证据。
- 同一 URL 的工具状态可能来自不同时间截面,所有结论都应带日期与样本。
- 有曝光是进入某些展示结果的证据,不是对所有查询可检索的证明。
- 七关流程是公开事实上的诊断抽象,不是 Google 内部算法或固定线性队列。
- 优秀诊断同时记录未知项、反对证据、下一检查和停止条件。
资料与证据
优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。