DOMAIN / 02 · LAYER 1

信息检索

Information Retrieval

以从业者需要的深度理解 lexical、semantic、retrieval 与 reranking。

如何学习这个板块

理解搜索系统如何发现、存储、检索与解释信息。

  1. 先解释不看资料,用自己的话描述机制与边界。
  2. 再应用在真实网站、SERP 或数据中完成每页的应用任务。
  3. 后诊断面对异常先提出竞争假设,再选择证据排除。
  4. 留产物只有可复查的文档、图表、实验或决策才算完成。

知识点路径

建议按顺序学习;已有经验可先完成每页自测,再决定是否跳过。

01倒排索引与候选集合Inverted Index and Candidate Sets

从词项到文档列表理解倒排索引,解释搜索系统为何能快速定位候选文档,以及字段、位置和跳跃结构如何支持更复杂的匹配。

当前核心110 分钟
02分词、规范化与语言边界Tokenization and Normalization

理解文本如何被切成可索引词项,以及大小写、连字符、词形、数字和多语言规则如何改变查询与文档的匹配。

当前核心115 分钟
03信息检索评估:相关性、指标与误差分析Information Retrieval Evaluation

从查询集、相关性标注和排名指标建立可重复评估,理解 Precision、Recall、MRR、MAP、nDCG 的任务假设,并用分组误差而非单一平均数决策。

当前核心124 分钟
04词频与饱和效应Term Frequency

理解词项在文档中的出现次数如何形成局部匹配证据,以及为什么实际检索常用对数或饱和函数削弱重复出现的边际收益。

下一阶段105 分钟
05逆文档频率与区分度Inverse Document Frequency

理解稀有词项为何比全语料常见词更能区分文档,并掌握 IDF 对语料范围、时间和分词规则的依赖。

下一阶段105 分钟
06向量空间、余弦相似度与表示选择Vector Space Model and Cosine Similarity

把查询和文档表示为多维向量,通过夹角比较方向相似度;理解“向量”既可稀疏也可稠密,表示决定相似度的含义。

下一阶段115 分钟
07语义搜索:含义匹配的能力与边界Semantic Search

把语义搜索拆为查询理解、实体与关系、语义表示、召回和重排,而不是把它当作“搜索引擎不再需要文字”的口号。

下一阶段122 分钟
08BERT:上下文表示,不是排名公式BERT Concepts and Boundaries

理解 Transformer 双向上下文、预训练与微调的基本思想,区分模型架构、Google 对语言理解的公开应用与 SEO 行业对“BERT 优化”的误读。

下一阶段117 分钟
09BM25:饱和词频与长度归一化BM25 Ranking Function

掌握 BM25 如何结合概率式 IDF、词频饱和与文档长度归一化,建立强而透明的词法排序基线。

下一阶段135 分钟
10TF-IDF:局部强度与全局区分度TF-IDF Weighting

组合词项在文档中的强度与全语料区分度,建立一个透明的词法相关性基线,并学会说明它没有覆盖什么。

下一阶段115 分钟
11稠密神经检索与双编码器Dense Neural Retrieval

理解双编码器如何分别编码查询与文档、用近邻搜索召回语义候选,以及训练数据、向量索引和域迁移怎样决定真实效果。

后续延伸138 分钟
12学习排序:特征、目标与偏差Learning to Rank

理解 pointwise、pairwise、listwise 学习排序如何从带标签样本组合多类特征,以及标签偏差、泄漏和分布漂移为何比算法名字更重要。

后续延伸141 分钟
13重排:用更昂贵模型审查小候选集Reranking

理解多阶段检索中先高召回、后精排序的分工,以及 cross-encoder、late interaction 与业务规则如何在有限候选上改善前排质量。

后续延伸120 分钟
14RAG:检索、上下文与可追溯回答Retrieval-Augmented Generation

把 RAG 视为查询处理、检索、过滤、重排、上下文组装、生成、引用和评估的完整系统;分别衡量检索失败与生成失败。

后续延伸163 分钟