LIBRARY / 02 · ATOMIC KNOWLEDGE

知识库

一个知识点解决一个清晰问题,并提供边界、应用任务、诊断场景、自测和证据入口。搜索结果只缩小范围,不改变学习依赖。

81 个知识点

01

搜索系统

建立 crawl → render → index → retrieve → rank → serve 的完整心智模型。

进入知识域
01查询理解与候选检索Query Understanding and Candidate Retrieval把用户字符串视为带语言、实体、约束和任务的查询,并区分“进入候选集合”与“在候选中排序靠前”。当前核心可工作97 分钟02排序:相关性、质量与多系统组合Ranking, Relevance, and System Composition理解最终排序是面向查询与上下文的多信号、多系统决策,而非一张可反推的统一因子清单。当前核心可独立118 分钟03搜索系统诊断漏斗Search System Diagnostic Funnel把站点、模板、页面、查询和业务数据串成可证伪的诊断顺序:先确认数据,再找最早失效关卡,最后评估影响。当前核心可独立137 分钟04搜索引擎工作流与故障分层Search Engine Pipeline用发现、抓取、渲染、索引、检索、排序、呈现七个关卡描述搜索系统,并把 SEO 异常先定位到关卡,再讨论方案。当前核心可独立95 分钟05索引资格、重复聚类与规范化Indexing and Canonicalization理解搜索引擎如何分析内容、决定索引资格、聚类相似 URL 并选择代表性规范页;把 canonical 当作信号而非命令。当前核心可独立120 分钟06渲染、JavaScript 与可见内容Rendering and JavaScript SEO区分服务器响应 HTML、浏览器 DOM 与搜索引擎渲染结果,验证主内容、链接和元数据是否在处理链中稳定可用。当前核心可独立120 分钟07URL 发现与抓取调度URL Discovery and Crawling理解搜索引擎如何从链接、sitemap 和既有 URL 集合发现地址,并在站点承载能力、已知价值与变化信号之间安排抓取。当前核心可独立115 分钟08结果呈现、SERP 功能与点击机会Serving and Search Result Presentation把“排名”与“用户实际看到并点击的搜索结果”分开,理解标题链接、摘要、富媒体、功能模块和设备布局如何改变点击机会。下一阶段可工作93 分钟
02

信息检索

以从业者需要的深度理解 lexical、semantic、retrieval 与 reranking。

进入知识域
01倒排索引与候选集合Inverted Index and Candidate Sets从词项到文档列表理解倒排索引,解释搜索系统为何能快速定位候选文档,以及字段、位置和跳跃结构如何支持更复杂的匹配。当前核心可工作110 分钟02分词、规范化与语言边界Tokenization and Normalization理解文本如何被切成可索引词项,以及大小写、连字符、词形、数字和多语言规则如何改变查询与文档的匹配。当前核心可工作115 分钟03信息检索评估:相关性、指标与误差分析Information Retrieval Evaluation从查询集、相关性标注和排名指标建立可重复评估,理解 Precision、Recall、MRR、MAP、nDCG 的任务假设,并用分组误差而非单一平均数决策。当前核心可独立124 分钟04词频与饱和效应Term Frequency理解词项在文档中的出现次数如何形成局部匹配证据,以及为什么实际检索常用对数或饱和函数削弱重复出现的边际收益。下一阶段可工作105 分钟05逆文档频率与区分度Inverse Document Frequency理解稀有词项为何比全语料常见词更能区分文档,并掌握 IDF 对语料范围、时间和分词规则的依赖。下一阶段可工作105 分钟06向量空间、余弦相似度与表示选择Vector Space Model and Cosine Similarity把查询和文档表示为多维向量,通过夹角比较方向相似度;理解“向量”既可稀疏也可稠密,表示决定相似度的含义。下一阶段可工作115 分钟07语义搜索:含义匹配的能力与边界Semantic Search把语义搜索拆为查询理解、实体与关系、语义表示、召回和重排,而不是把它当作“搜索引擎不再需要文字”的口号。下一阶段可工作122 分钟08BERT:上下文表示,不是排名公式BERT Concepts and Boundaries理解 Transformer 双向上下文、预训练与微调的基本思想,区分模型架构、Google 对语言理解的公开应用与 SEO 行业对“BERT 优化”的误读。下一阶段理解117 分钟09BM25:饱和词频与长度归一化BM25 Ranking Function掌握 BM25 如何结合概率式 IDF、词频饱和与文档长度归一化,建立强而透明的词法排序基线。下一阶段可独立135 分钟10TF-IDF:局部强度与全局区分度TF-IDF Weighting组合词项在文档中的强度与全语料区分度,建立一个透明的词法相关性基线,并学会说明它没有覆盖什么。下一阶段可工作115 分钟11稠密神经检索与双编码器Dense Neural Retrieval理解双编码器如何分别编码查询与文档、用近邻搜索召回语义候选,以及训练数据、向量索引和域迁移怎样决定真实效果。后续延伸可工作138 分钟12学习排序:特征、目标与偏差Learning to Rank理解 pointwise、pairwise、listwise 学习排序如何从带标签样本组合多类特征,以及标签偏差、泄漏和分布漂移为何比算法名字更重要。后续延伸理解141 分钟13重排:用更昂贵模型审查小候选集Reranking理解多阶段检索中先高召回、后精排序的分工,以及 cross-encoder、late interaction 与业务规则如何在有限候选上改善前排质量。后续延伸可工作120 分钟14RAG:检索、上下文与可追溯回答Retrieval-Augmented Generation把 RAG 视为查询处理、检索、过滤、重排、上下文组装、生成、引用和评估的完整系统;分别衡量检索失败与生成失败。后续延伸可独立163 分钟
03

技术 SEO

让重要页面可被发现、正确渲染、规范化、索引与维护。

进入知识域
01站点架构与发现路径Site Architecture & Discovery Paths用业务对象、用户任务和可抓取链接构建层级,让重要页面从稳定 hub 获得清晰上下文,而不是机械追求“三次点击”。当前核心可独立115 分钟02重定向设计与验证Redirect Design & Validation把旧资源映射到最相关的新资源,并尽量单跳到最终 URL;重定向既是用户路由,也是规范化强信号。当前核心可独立99 分钟03Canonical 与重复 URL 信号Canonicalization SignalsCanonicalization 是从重复或近似页面组中选择代表 URL 的过程;声明 canonical 是强提示,不是命令。当前核心可独立114 分钟04robots.txt 与 noindex 控制边界Robots.txt & Noindex Boundariesrobots.txt 管“能否抓取”,noindex 管“能否被索引”;爬虫必须访问页面或响应头,才能读取 noindex。当前核心可独立95 分钟05SEO 迁移控制系统SEO Migration Control System把迁移做成有基线、有 URL 映射、有发布闸门和回滚条件的变更管理,而不是上线当天临时补 301。当前核心可独立174 分钟06URL 与 HTTP 状态契约URL & HTTP Status Contract把 URL 视为长期资源标识,把 HTTP 状态码视为服务器对用户与爬虫的明确答复;先判断“请求得到了什么”,再讨论排名。当前核心可独立91 分钟07XML Sitemap 治理XML Sitemap GovernanceSitemap 是“希望被发现的规范 URL 清单”,不是强制索引指令;其额外价值是按模板监控提交与索引差异。当前核心可工作93 分钟08结构化数据建模与验证Structured Data Modeling & Validation用明确实体和属性描述页面可见事实;选择与页面类型匹配、由真实数据生成且可持续维护的标记。下一阶段可工作101 分钟09抓取预算与日志分析Crawl Budget & Log Analysis先判断规模与更新频率是否真的构成抓取约束,再用服务器日志观察搜索爬虫实际请求,避免用模拟爬取代替现实。下一阶段可独立142 分钟10Core Web Vitals 与 INPCore Web Vitals & INP用真实用户第 75 百分位评估 LCP、INP、CLS,再用实验室数据定位资源、主线程和布局根因;性能首先是体验与转化问题。下一阶段可独立120 分钟11JavaScript SEO 审计与工程验收JavaScript SEO Audit & Engineering QA把渲染机制转化为可复现的审计步骤与工程验收项:比较原始 HTML、渲染 DOM 和网络依赖,确保核心内容与链接可稳定处理。下一阶段可独立110 分钟
04

需求与 SERP

把 ICP 的真实搜索任务映射到查询、SERP 类型与页面机会。

进入知识域
05

内容与架构

建立内容、实体、主题覆盖和内部链接共同工作的页面系统。

进入知识域
01内部链接系统Internal Linking System用可抓取、语义明确且处于真实上下文的链接连接 hub、商业页和支持内容,同时治理孤页、死链与模板噪音。当前核心可独立113 分钟02内容优化、刷新与合并Content Optimization, Refresh & Consolidation从数据异常与用户任务提出刷新假设,选择保留、更新、重构、合并或删除,并以变更日志和结果窗口验证。当前核心可独立143 分钟03内容质量与 E-E-A-T 证据Content Quality & E-E-A-T Evidence围绕页面目的评估努力、原创性、准确性、经验、专业性、权威与信任;E-E-A-T 是质量评估视角,不是可打分的单一标签。当前核心可独立109 分钟04页面级 SEO 基础On-page SEO Fundamentals让标题、主标题、正文结构、媒体、链接和转化共同服务一个明确任务;元素优化建立在页面—意图匹配之上。当前核心可独立103 分钟05主题覆盖与信息增益Topical Coverage & Information Gain以用户决策所需的子问题、实体、关系和证据评估覆盖度,同时删除无用重复;“全面”不等于最长。下一阶段可独立108 分钟06主题集群与内容组合Topic Cluster Design围绕可持续服务的用户任务建立 pillar、子主题和商业页面组合,以真实内链和差异化资产连接,而不是批量制造相似文章。下一阶段可独立111 分钟07实体与知识图谱思维Entities & Knowledge Graph Thinking用实体、属性和关系消除品牌、产品、人物与概念歧义,并保持站内命名、页面、结构化数据和外部资料一致。后续延伸可工作114 分钟
06

站外与权威

把外链执行升级为页面级的 authority、relevance、asset 与风险决策。

进入知识域
01链接基础:发现、相关性与声誉Link Fundamentals: Discovery, Relevance & Reputation把链接理解为一个页面对另一资源的可发现引用;评估来源页、目标页、语境、编辑意图和真实受众,而非只看域名指标。当前核心可独立114 分钟02链接垃圾风险与处置Link Spam Risk & Remediation依据获取意图、编辑关系、付费披露和规模模式识别操纵性链接;停止可控行为、保留证据,并只在有充分理由时采取移除或 disavow。当前核心可独立139 分钟03可链接资产设计Linkable Asset Design从具体引用者的工作需求反推资产:原创数据、免费工具、模板、统计页、视觉图或长期参考资料,并设计更新与分发机制。下一阶段可独立167 分钟04数字 PR 与专家传播Digital PR & Expert Distribution用有新闻价值的数据、观点和专家快速响应真实媒体受众,把品牌提及、引用、引荐访问和关系资产纳入同一传播系统。下一阶段可独立155 分钟05外链差距与机会发现Backlink Gap & Opportunity Discovery比较竞争页面由谁、因为什么内容获得引用,寻找可复制的受众与触发因素,而不是照抄所有 referring domains。下一阶段可独立132 分钟06页面级链接策略与组合Page-level Link Strategy & Portfolio从业务目标和目标 URL 出发,组合合作、专家贡献、资源推广、产品生态和 PR 等可持续路径,并定义投入、领先指标与停止条件。下一阶段可独立149 分钟07锚文本语义与分布Anchor Text Semantics & Distribution把锚文本作为链接上下文的一部分观察品牌、URL、主题描述和自然语言分布;站外锚文本应由编辑语境自然产生。后续延伸可工作107 分钟
07

数据与诊断

把 GSC、GA4、SERP、crawl 与业务数据转化为可证伪的假设。

进入知识域
01分群、切片与聚合陷阱Segmentation and Aggregation Pitfalls用页面类型、品牌/非品牌、意图、市场、设备、新旧内容与 funnel 阶段分群,判断总量变化来自“谁”。同时防止辛普森悖论、样本稀疏和事后切片制造伪解释。当前核心可独立140 分钟02索引覆盖与根因验证Index Coverage and Root-Cause Validation把“未索引”拆成需求合理性、发现、抓取、渲染、canonical、质量/重复和索引选择,按模板与 URL 样本验证根因。索引率只在“应索引 URL 集合”上才有意义。当前核心可独立170 分钟03自然流量下降诊断树Organic Traffic Drop Diagnosis Tree按 tracking → demand → discovery/indexing → ranking/SERP → snippet → landing/measurement 的顺序诊断流量下降。先定位变化发生在哪一层,再检查页面、查询和时间,避免一上来重写内容。当前核心可独立160 分钟04CTR 机会与 SERP 点击诊断CTR Opportunity and SERP Click Diagnosis在 position、query intent、brand、device 与 SERP feature 的条件下评估 CTR,找出真正可测试的 snippet 机会。CTR 不是独立 KPI,而是展示资格、排序位置和用户选择共同作用的结果。当前核心可独立140 分钟05GA4 事件与转化测量计划GA4 Event and Conversion Measurement Plan从业务动作反推 GA4 event、parameter、key event 与验证规则,建立到站后行为的可解释测量层。重点是语义稳定、去重、测试和文档,而不是“能触发就算完成”。当前核心可独立180 分钟06GSC 搜索表现证据模型Search Console Performance Evidence Model理解点击、曝光、CTR、平均排名的计算口径,并用 query、page、country、device、date 与 search appearance 切片。目标不是导出一张大表,而是知道每一行能支持什么结论、遗漏了什么。当前核心可独立150 分钟07自然搜索转化漏斗与 CRO 诊断Organic Conversion Funnel and CRO Diagnosis把 query intent → landing → engagement → micro-conversion → lead quality → revenue 连接成漏斗,寻找损失最大的步骤及其机制。CRO 以减少用户决策阻力为核心,不以随意换按钮颜色为核心。下一阶段可独立160 分钟08KPI 树、归因与业务测量KPI Trees, Attribution, and Business Measurement从收入/管道目标向下拆出可控的 SEO leading、quality 与 lagging indicators,并明确 GA4、CRM 与实验各自能回答的问题。归因是分配规则,不是自然因果证明。下一阶段可独立180 分钟09SEO 实验与变更日志SEO Experiments and Change Logs把 SEO 改动写成可证伪假设,使用页面组、时间序列、对照与保护指标评估效果,并维护统一变更日志。SEO 实验很少拥有完美随机化,因此不确定性说明与替代解释同样重要。下一阶段可独立180 分钟
08

策略与 B2B

连接 ICP、funnel、商业价值、资源约束、路线与 forecast。

进入知识域
01证据驱动的 SEO 优先级Evidence-Driven SEO Prioritization用 Reach/Value、Impact、Confidence、Effort、Risk、Dependency 和 Time-to-signal 排序 SEO 机会,并把分数当作对话输入而非数学真相。安全/合规事故与战略项目使用不同通道。当前核心可独立160 分钟02B2B 搜索旅程与非线性漏斗B2B Search Journey and Nonlinear Funnel把搜索任务映射为 problem framing、solution exploration、requirements、comparison、validation、procurement 与 implementation,而不是僵硬地把每个词贴上 TOFU/MOFU/BOFU。当前核心可独立150 分钟03ICP、购买情境与决策委员会ICP, Buying Situations, and Buying Committees把 ICP 从公司属性表升级为“哪些组织在什么触发下、由哪些角色、用什么标准做决定”的证据模型。SEO 需求应映射 buying situation、job、风险与角色,而不只是职位和搜索量。当前核心可独立150 分钟04SEO 路线图与跨团队交付SEO Roadmaps and Cross-Functional Delivery把战略转成 30/60/90 天 outcome-based roadmap:明确工作流、owner、依赖、definition of done、风险、证据与 review cadence。路线图表达假设和顺序,不是假装确定的承诺日历。当前核心可独立180 分钟05SEO 战略:诊断、选择与取舍SEO Strategy: Diagnosis, Choice, and Trade-offs战略不是任务清单,而是对关键挑战的诊断、指导原则和一组相互强化的行动。明确目标市场、赢法、约束与“暂不做”,才能让内容、技术、权威和测量形成系统。当前核心可独立170 分钟06SEO 预测、场景与不确定性SEO Forecasting, Scenarios, and Uncertainty用 baseline、seasonality、eligible demand、ranking/CTR range、conversion 与交付概率建立 base/upside/downside 场景。预测是决策模型,不是精确承诺,必须能随着证据更新。下一阶段可独立220 分钟07SEO ROI 与商业论证SEO ROI and Business Cases把投资、增量收益、时间价值、风险和替代方案写进商业论证;同时区分 attributed value、incremental value 与 strategic option value。ROI 结论必须随证据强度调整措辞。下一阶段可独立210 分钟
09

国际 SEO

为不同语言、地区与市场设计可维护的站点和内容策略。

进入知识域
10

AI Search 与自动化

理解 AI Search 的检索与引用链路,并只自动化高频、可验证的工作。

进入知识域
01AI 治理、数据隐私与生产发布边界AI Governance, Data Privacy, and Production Release Safety为 SEO AI 用例建立风险分级、数据分类、供应商/模型记录、prompt/output lineage、人审、评估、批准、分批发布、监控、事故和回滚。治理的目标是让可接受的实验更快且可追责。当前核心可独立260 分钟02Regex 与电子表格的可审计分析Auditable Analysis with Regex and Spreadsheets用 RE2 regex、lookup、QUERY/pivot、array formulas 和数据验证完成 URL/query 分类、QA 与轻量模型。把规则、原始数据、计算和输出分层,并用测试样本防止“能跑但错”。当前核心可独立160 分钟03AI 可见性测量与实验基线AI Visibility Measurement and Experimental Baselines用固定且版本化的 prompt set 测量 mention、citation、cited URL、position/context、sentiment/accuracy proxy 与 referral/conversion,并记录平台、模型、地区、日期和重复次数。所有 share of voice 都是方法依赖的估计。下一阶段可独立240 分钟04AI Overviews、AI Mode 与搜索体验变化AI Overviews, AI Mode, and Search Experience Change理解生成式搜索仍以抓取、索引、核心排名和检索为基础,同时可能通过 query fan-out、综合回答、引用和更长的多轮任务改变可见性与点击。坚持搜索基础,不把未经证实的技巧包装成新排名公式。下一阶段可独立220 分钟05GEO、可引用性与内容证据设计GEO, Citability, and Evidence-Centered Content将 GEO 定义为对生成式答案中的品牌呈现、内容使用和来源引用进行可测实验,而不是一套确定排名技巧。通过清晰主张、直接答案、原始证据、来源、实体与更新时间提高人和机器都能核验的可引用性。下一阶段可独立240 分钟06SEO 数据工程:SQL、Python 与 APISEO Data Engineering with SQL, Python, and APIs用稳定 schema 将 GSC、GA4、crawl、SERP、CMS 和 CRM 聚合数据连接成可复跑 pipeline。掌握 SQL grain/join/window、Python cleaning/testing、API pagination/quota/auth 与数据 lineage。下一阶段可独立360 分钟07SEO 自动化:候选选择、验证与失败安全SEO Automation: Selection, Validation, and Fail-Safe Design只自动化高频、规则稳定、输入可控、输出可验证且失败可恢复的工作。默认从 read-only extraction、classification、QA 和 draft 开始,再逐级评估是否允许写入生产。下一阶段可独立170 分钟08Query Fan-out、检索增强生成与来源链Query Fan-out, Retrieval-Augmented Generation, and Source Chains以从业者需要的深度理解 query expansion/decomposition → retrieval → ranking/reranking → context assembly → generation → citation。用这个模型提出内容覆盖和证据假设,但不声称知道商业引擎的私有实现。后续延伸可工作170 分钟