学习契约与正确模型
先明确为什么学、学完能做什么,以及如何证明自己真的掌握。
B2B 查询常有术语差异,例如客户说“supplier onboarding checks”,产品说“third-party due diligence”。语义方法可连接表达,但型号、法规编号、否定和精确约束仍可能更依赖词法证据。
- 把“语义搜索”分解为可测试组件
- 为词法与语义方法选择适合的查询类型
- 用人工相关性案例识别语义近似但任务不同的风险
精读 34 分钟 → 引导练习 28 分钟 → 实战任务 60 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。
- 它是什么
- 语义搜索是利用词义、上下文、实体或学习表示弥补表面词形不一致的一组方法,可存在于查询扩展、候选召回或重排阶段。
- 为什么重要
- 用户与文档常用不同语言表达同一任务,纯精确词项匹配会漏掉相关内容。
- 什么时候使用
- 用于自然语言问题、同义表达、多语言近似、复杂概念与探索型搜索。
- 什么时候不要套用
- 型号、错误码、引用条款、否定条件和必须精确满足的过滤不应只依赖语义近似。
- 边界与不确定性
- “理解”是任务表现的操作性描述,不表示模型拥有人类式知识;语义搜索也不是 Google 单一排名系统名称。
机制精讲
先读完整因果链,再看每个环节留下什么可观察信号。
语义搜索泛指系统利用词面之外的上下文、实体或学习表示,连接表达不同但含义相关的查询与文档。它可以发生在查询改写、候选召回、候选融合或重排,而不是一个装上就取代全部词法检索的单一按钮。对于“供应商尽调自动化”和“第三方风险评估工作流”,语义表示可能发现共同任务;但对于型号、标准条款、否定、数字和版本,精确词法或结构化约束通常仍不可少。讨论语义能力时必须指出它位于哪一阶段、接受什么输入、输出什么候选,并用标注任务评估。
SEO 工具常把向量相似度包装成“主题得分”,这只能说明当前模型表示下的接近程度,不能证明页面高质量、事实正确或会获得 Google 排名。网页搜索的完整生产系统没有公开,本课只讲通用 IR 设计。稳健方案往往是混合检索:词法通道守住精确实体,语义通道补充同义与自然语言表达,再用过滤、融合或重排处理任务约束。评价不能只看平均召回,还要专门测试“不支持”“不兼容”、数值范围、相反动作和相近型号等高风险反例。
语义能力可分布在多个阶段
查询端可做拼写、同义或实体改写;召回端可用稠密向量找近义候选;重排端可联合阅读查询与文档。不同位置决定成本、可解释性和无法挽回的错误。
词法与语义具有互补错误
词法对 `ISO 27001`、`H07V-K`、错误码和数字精确,语义对同义问法更有覆盖;词法会漏表达差异,语义可能把相反含义或相近产品拉近。
混合融合需要透明尺度
简单加权需要先处理 BM25 与向量分数尺度;倒数排名融合可以按各通道名次合并,减少分数不可比问题。融合参数仍需通过测试集选择,而非凭默认值。
硬约束不应交给相似度猜测
权限、库存、语言、当前版本、型号与合规要求常是必须满足的条件。相似度很高的过期或无权限文档仍应被过滤或显式降级。
关键概念
掌握术语之间的关系,才能迁移到不同网站、行业和工具。
词汇鸿沟
相关查询与文档没有共享足够词项;同义扩展、实体映射或稠密表示都可能缓解。
语义漂移
概念接近不等于任务相同,例如“vendor onboarding”与“vendor offboarding”共享领域但动作相反。
混合互补
词法擅长精确标识符,语义擅长释义;融合后仍需统一评估和重排。
完整示范
跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。
词法与语义通道的混合候选
以下查询、文档和分数都是教学用合成数据。查询为“供应商尽调自动化”,D1 标题含精确短语,D2 写“第三方风险评估工作流”,D3 是“员工背景调查自动化”,D4 是“供应商尽调不支持自动审批”。
- 词法排名为 D1、D4,语义排名为 D2、D3、D1
- 采用教学用倒数排名融合 `1/(60+rank)`,只演示排序贡献
- 本例不代表 Google 的语义系统、候选集合或生产参数
检查词法候选
- 输入
- 精确词法通道返回 D1(rank1)、D4(rank2)。
- 分析
- D1 是高置信精确匹配;D4 也含全部词,却有否定“不支持”,不能因词面命中直接判为正答案。
- 输出
- 保留 D1、D4及逐词命中,标记 D4 需否定判断。
检查语义候选
- 输入
- 稠密通道返回 D2(rank1)、D3(rank2)、D1(rank3)。
- 分析
- D2 的“第三方风险评估”与任务近义,是语义补召回价值;D3 对象从供应商变为员工,是相似流程造成的误召回。
- 输出
- 语义通道新增 D2,同时把对象错误 D3 加入挑战集。
融合并保留来源
- 输入
- D1 同时在词法1与语义3,D2仅语义1,D4仅词法2,D3仅语义2。
- 分析
- 按教学 RRF,D1 获得两通道贡献,通常排首;D2、D4、D3随后,但分数不能解决否定与对象约束。
- 输出
- 融合候选保留每项通道贡献,避免把混合分数当不可解释黑箱。
应用约束与人工相关性
- 输入
- 任务要求能自动审批供应商;D4明确不支持,D3对象错误。
- 分析
- 过滤或重排后应保留 D1、D2,排除/显著降级 D3与D4。语义补回 D2,但精确约束守住了错误边界。
- 输出
- 最终教学排序 D1>D2,严重错误率由否定与实体测试单独报告。
决策规则与证据边界
把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。
- 词法和稠密表示可作为不同候选通道,融合排序及评估指标可在自建系统复算。
- 向量相似度只是在给定表示与度量下的接近,不包含事实正确保证。
- 同义查询切片 Recall 提升支持语义通道有用,但线上任务收益仍需独立验证。
- 否定、数字和相反动作挑战集可以揭示语义表示的系统性边界。
- Google 对具体查询在哪个阶段采用哪些语义系统、模型和权重并未完整公开。
- 第三方内容相似度无法换算为网页排名概率或所谓主题权威分。
引导练习
先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。
教学用合成数据:查询 A“支持 Modbus 的压力传感器”,候选含“支持 Modbus”“不支持 Modbus”“支持 Profibus”;查询 B“降低供应商风险”,词法只命中原句,语义新增“第三方尽调”。请设计混合策略、守门测试和成功指标。
给定材料
- 两查询的词法 top5、语义 top5、向量相似度、产品协议字段和人工0–3相关等级
- 性能表:BM25 P95=18ms,语义通道 P95=92ms,融合后缓存命中率与超时率
需要提示时再展开
- A 的协议与否定是硬条件,不能只依赖相似度。
- B 应衡量语义通道新增的相关文档,而不是把共同候选重复算作增益。
完成后核对参考解法
A 应先以词法和结构化 protocol=Modbus、support=true 过滤,语义只在满足硬条件的候选内补充或重排;“不支持”与 Profibus 是严重错误守门样本。B 可并行 BM25 和语义召回,用融合保留原句与“第三方尽调”候选,并计算增量 Recall@10、nDCG 和误召回类型。上线门槛还应包含 P95 延迟、超时回退、权限字段覆盖。所有材料均为教学用合成数据,结论不能外推为 Google 的语义召回方式。
自评分量规
真实项目实战
把理解变成一个可以检查、复核和复用的工作产物。
给合规知识库划分检索策略
查询既有 `ISO 27001 A.5.19`,也有“how do we evaluate a new cloud supplier”。
- 按精确引用、实体别名、自然语言任务和探索问题标注查询
- 运行 BM25、dense 与 hybrid,保存各路候选和分数
- 对每类查询比较 Recall@20 与 nDCG@10,并检查失败样本
- 为标准号和否定条件加精确保护,为释义查询保留语义召回
- 设置逐类发布门槛和回退路径
验收条件
- 查询类型来自真实日志而非编造 demo
- 每种方法的收益与失败类型都有示例
- 保留精确约束,不用一个 embedding 方案覆盖所有任务
诊断练习
目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。
语义搜索把“disable SSO enforcement”文档返回给“enable SSO enforcement”。
竞争假设
- embedding 捕捉主题却弱化否定或方向词
- 长文块中正反操作共存
- 重排和业务过滤未检查关键动作
应该检查的证据
- 查询与候选文本的关键 token
- chunk 边界及 dense/lexical 分路排名
- 包含否定、数字和方向词的挑战集
常见陷阱:展示主题相近就认为相关,而不验证操作后果。
完成后用本页决策规则复核
- 若观察到:精确型号、标准号或错误码查询
应优先:使用 BM25/精确字段为主,可让语义补充但不得覆盖硬匹配。
分词与别名错误仍会破坏词法召回,需要受控规范化。 - 若观察到:同一任务存在大量自然语言和同义表达
应优先:加入稠密或查询扩展通道,并用人工相关集比较增量 Recall。
同义扩展会带来对象、否定和领域误召回,必须设置挑战集。 - 若观察到:高相似结果违反权限、版本、数字或否定约束
应优先:增加结构化过滤、专门重排或拒绝规则,并记录严重错误。
过滤字段缺失或过期同样危险,应监控覆盖和默认行为。 - 若观察到:语义通道仅改善低价值查询且延迟显著上升
应优先:按查询分类路由,仅在受益类型启用,保留词法回退。
小样本可能低估新查询价值,需报告不确定性和观察窗。
自测与误区
先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。
你应该能回答
1. 语义能力位于查询、召回还是重排阶段?
参考答案:必须定位到具体组件:查询阶段可做纠错、同义或实体改写;召回阶段可增加稠密候选;重排阶段可联合分析查询与文档。若不说明位置,就无法判断相关文档在上游漏掉后下游是否还有补救机会,也无法解释延迟、成本和失败回退。
为什么:语义搜索不是单一算法名,阶段定位决定它的输入、输出、可观察证据和工程边界。
2. 哪些精确约束不能丢?
参考答案:精确型号、标准号、数字范围、单位、版本、语言、地区、权限、库存、合规状态和否定通常不能丢。哪些是硬约束要由业务任务定义,并用结构化字段、词法守门或专门判断执行;向量相似只能作为候选证据。
为什么:高相似不等于满足约束,错误产品或无权限文档可能造成比漏召回更严重的损失。
3. 你如何测试否定、数字和相反动作?
参考答案:建立成对挑战集:支持/不支持、至少/至多、10/100、增加/降低、安装/拆除,以及相近型号。对每组要求正确文档进入 top-k、相反文档不进入安全阈值,并按通道保存分数。还要加入自然同义正例,避免系统只因保守过滤而看似无错。
为什么:成对反例直接检验表示是否保留方向和数值,而总体平均很容易掩盖这些低量严重错误。
需要避开的误区
- 语义搜索意味着关键词和文本不再重要
- 向量相似就是用户任务相同
- 加入 embedding 会自动解决所有零结果
术语与复盘
用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。
- 语义检索
- 利用学习表示、实体或改写连接非完全词面重合查询与文档的检索方法集合。
- 混合检索
- 组合词法、稠密或其他通道的候选与分数。
- 融合
- 把多个通道的候选与排名合成为一个列表的过程。
- 倒数排名融合
- 按每个通道中的名次倒数贡献合并结果,减少原始分数尺度差异。
- 硬约束
- 任务要求必须满足的条件,如权限、型号或否定,不能由近似相似度替代。
- 挑战集
- 专门包含否定、数字、相反动作等已知困难样本的评估集合。
离开本页前记住
- 语义能力可能位于查询、召回、融合或重排,必须明确阶段。
- 词法守住精确身份,语义补充同义表达,两者通常互补。
- 权限、型号、数字、版本和否定属于硬约束,不能交给相似度猜测。
- 混合结果应保留各通道贡献和公式,便于错误分析。
- 评估既要看增量 Recall,也要看严重误召回、延迟和回退。
- 语义相似度不是 Google 排名概率,生产细节未公开。
资料与证据
优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。