DOMAIN / 02 · LAYER 1
信息检索
Information Retrieval
以从业者需要的深度理解 lexical、semantic、retrieval 与 reranking。
如何学习这个板块
理解搜索系统如何发现、存储、检索与解释信息。
- 先解释不看资料,用自己的话描述机制与边界。
- 再应用在真实网站、SERP 或数据中完成每页的应用任务。
- 后诊断面对异常先提出竞争假设,再选择证据排除。
- 留产物只有可复查的文档、图表、实验或决策才算完成。
知识点路径
建议按顺序学习;已有经验可先完成每页自测,再决定是否跳过。
从词项到文档列表理解倒排索引,解释搜索系统为何能快速定位候选文档,以及字段、位置和跳跃结构如何支持更复杂的匹配。
02分词、规范化与语言边界Tokenization and Normalization理解文本如何被切成可索引词项,以及大小写、连字符、词形、数字和多语言规则如何改变查询与文档的匹配。
03信息检索评估:相关性、指标与误差分析Information Retrieval Evaluation从查询集、相关性标注和排名指标建立可重复评估,理解 Precision、Recall、MRR、MAP、nDCG 的任务假设,并用分组误差而非单一平均数决策。
04词频与饱和效应Term Frequency理解词项在文档中的出现次数如何形成局部匹配证据,以及为什么实际检索常用对数或饱和函数削弱重复出现的边际收益。
05逆文档频率与区分度Inverse Document Frequency理解稀有词项为何比全语料常见词更能区分文档,并掌握 IDF 对语料范围、时间和分词规则的依赖。
06向量空间、余弦相似度与表示选择Vector Space Model and Cosine Similarity把查询和文档表示为多维向量,通过夹角比较方向相似度;理解“向量”既可稀疏也可稠密,表示决定相似度的含义。
07语义搜索:含义匹配的能力与边界Semantic Search把语义搜索拆为查询理解、实体与关系、语义表示、召回和重排,而不是把它当作“搜索引擎不再需要文字”的口号。
08BERT:上下文表示,不是排名公式BERT Concepts and Boundaries理解 Transformer 双向上下文、预训练与微调的基本思想,区分模型架构、Google 对语言理解的公开应用与 SEO 行业对“BERT 优化”的误读。
09BM25:饱和词频与长度归一化BM25 Ranking Function掌握 BM25 如何结合概率式 IDF、词频饱和与文档长度归一化,建立强而透明的词法排序基线。
10TF-IDF:局部强度与全局区分度TF-IDF Weighting组合词项在文档中的强度与全语料区分度,建立一个透明的词法相关性基线,并学会说明它没有覆盖什么。
11稠密神经检索与双编码器Dense Neural Retrieval理解双编码器如何分别编码查询与文档、用近邻搜索召回语义候选,以及训练数据、向量索引和域迁移怎样决定真实效果。
12学习排序:特征、目标与偏差Learning to Rank理解 pointwise、pairwise、listwise 学习排序如何从带标签样本组合多类特征,以及标签偏差、泄漏和分布漂移为何比算法名字更重要。
13重排:用更昂贵模型审查小候选集Reranking理解多阶段检索中先高召回、后精排序的分工,以及 cross-encoder、late interaction 与业务规则如何在有限候选上改善前排质量。
14RAG:检索、上下文与可追溯回答Retrieval-Augmented Generation把 RAG 视为查询处理、检索、过滤、重排、上下文组装、生成、引用和评估的完整系统;分别衡量检索失败与生成失败。