KNOWLEDGE / 07LAYER 1下一阶段

语义搜索:含义匹配的能力与边界

Semantic Search

把语义搜索拆为查询理解、实体与关系、语义表示、召回和重排,而不是把它当作“搜索引擎不再需要文字”的口号。

先修知识查询理解与候选检索向量空间、余弦相似度与表示选择
解锁能力BERT 概念边界稠密检索混合检索设计
默认基础无需额外背景
本页目录 · 11 个学习环节
01

学习契约与正确模型

先明确为什么学、学完能做什么,以及如何证明自己真的掌握。

为什么现在要学

B2B 查询常有术语差异,例如客户说“supplier onboarding checks”,产品说“third-party due diligence”。语义方法可连接表达,但型号、法规编号、否定和精确约束仍可能更依赖词法证据。

完成本页后,你应能
  • 把“语义搜索”分解为可测试组件
  • 为词法与语义方法选择适合的查询类型
  • 用人工相关性案例识别语义近似但任务不同的风险
建议节奏

精读 34 分钟 → 引导练习 28 分钟 → 实战任务 60 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。

它是什么
语义搜索是利用词义、上下文、实体或学习表示弥补表面词形不一致的一组方法,可存在于查询扩展、候选召回或重排阶段。
为什么重要
用户与文档常用不同语言表达同一任务,纯精确词项匹配会漏掉相关内容。
什么时候使用
用于自然语言问题、同义表达、多语言近似、复杂概念与探索型搜索。
什么时候不要套用
型号、错误码、引用条款、否定条件和必须精确满足的过滤不应只依赖语义近似。
边界与不确定性
“理解”是任务表现的操作性描述,不表示模型拥有人类式知识;语义搜索也不是 Google 单一排名系统名称。
02

机制精讲

先读完整因果链,再看每个环节留下什么可观察信号。

语义搜索泛指系统利用词面之外的上下文、实体或学习表示,连接表达不同但含义相关的查询与文档。它可以发生在查询改写、候选召回、候选融合或重排,而不是一个装上就取代全部词法检索的单一按钮。对于“供应商尽调自动化”和“第三方风险评估工作流”,语义表示可能发现共同任务;但对于型号、标准条款、否定、数字和版本,精确词法或结构化约束通常仍不可少。讨论语义能力时必须指出它位于哪一阶段、接受什么输入、输出什么候选,并用标注任务评估。

SEO 工具常把向量相似度包装成“主题得分”,这只能说明当前模型表示下的接近程度,不能证明页面高质量、事实正确或会获得 Google 排名。网页搜索的完整生产系统没有公开,本课只讲通用 IR 设计。稳健方案往往是混合检索:词法通道守住精确实体,语义通道补充同义与自然语言表达,再用过滤、融合或重排处理任务约束。评价不能只看平均召回,还要专门测试“不支持”“不兼容”、数值范围、相反动作和相近型号等高风险反例。

01

语义能力可分布在多个阶段

查询端可做拼写、同义或实体改写;召回端可用稠密向量找近义候选;重排端可联合阅读查询与文档。不同位置决定成本、可解释性和无法挽回的错误。

观察什么为每个查询保存原始形式、改写、各召回通道候选、融合结果和重排变化。
02

词法与语义具有互补错误

词法对 `ISO 27001`、`H07V-K`、错误码和数字精确,语义对同义问法更有覆盖;词法会漏表达差异,语义可能把相反含义或相近产品拉近。

观察什么按精确实体、同义、自然语言、否定、数字和跨语言切片分别计算 Recall@k 与误召回。
03

混合融合需要透明尺度

简单加权需要先处理 BM25 与向量分数尺度;倒数排名融合可以按各通道名次合并,减少分数不可比问题。融合参数仍需通过测试集选择,而非凭默认值。

观察什么输出各通道排名、归一化或 RRF 公式、融合贡献及候选去重。
04

硬约束不应交给相似度猜测

权限、库存、语言、当前版本、型号与合规要求常是必须满足的条件。相似度很高的过期或无权限文档仍应被过滤或显式降级。

观察什么在检索前后检查过滤字段、缺失值、版本和权限,并把违反硬约束设为严重错误护栏。
03

关键概念

掌握术语之间的关系,才能迁移到不同网站、行业和工具。

01

词汇鸿沟

相关查询与文档没有共享足够词项;同义扩展、实体映射或稠密表示都可能缓解。

02

语义漂移

概念接近不等于任务相同,例如“vendor onboarding”与“vendor offboarding”共享领域但动作相反。

03

混合互补

词法擅长精确标识符,语义擅长释义;融合后仍需统一评估和重排。

04

完整示范

跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。

WORKED EXAMPLE

词法与语义通道的混合候选

以下查询、文档和分数都是教学用合成数据。查询为“供应商尽调自动化”,D1 标题含精确短语,D2 写“第三方风险评估工作流”,D3 是“员工背景调查自动化”,D4 是“供应商尽调不支持自动审批”。

前提与样例口径
  • 词法排名为 D1、D4,语义排名为 D2、D3、D1
  • 采用教学用倒数排名融合 `1/(60+rank)`,只演示排序贡献
  • 本例不代表 Google 的语义系统、候选集合或生产参数
  1. 检查词法候选

    输入
    精确词法通道返回 D1(rank1)、D4(rank2)。
    分析
    D1 是高置信精确匹配;D4 也含全部词,却有否定“不支持”,不能因词面命中直接判为正答案。
    输出
    保留 D1、D4及逐词命中,标记 D4 需否定判断。
  2. 检查语义候选

    输入
    稠密通道返回 D2(rank1)、D3(rank2)、D1(rank3)。
    分析
    D2 的“第三方风险评估”与任务近义,是语义补召回价值;D3 对象从供应商变为员工,是相似流程造成的误召回。
    输出
    语义通道新增 D2,同时把对象错误 D3 加入挑战集。
  3. 融合并保留来源

    输入
    D1 同时在词法1与语义3,D2仅语义1,D4仅词法2,D3仅语义2。
    分析
    按教学 RRF,D1 获得两通道贡献,通常排首;D2、D4、D3随后,但分数不能解决否定与对象约束。
    输出
    融合候选保留每项通道贡献,避免把混合分数当不可解释黑箱。
  4. 应用约束与人工相关性

    输入
    任务要求能自动审批供应商;D4明确不支持,D3对象错误。
    分析
    过滤或重排后应保留 D1、D2,排除/显著降级 D3与D4。语义补回 D2,但精确约束守住了错误边界。
    输出
    最终教学排序 D1>D2,严重错误率由否定与实体测试单独报告。

结论:混合系统的价值不是让语义分覆盖所有判断,而是让词法精确与语义扩展互补。D2 是有益补召回,D3 和 D4 分别暴露对象与否定边界。完整评估必须保存各通道和约束结果,不能只展示最终相似度。

迁移到真实项目:在真实站内搜索或内容检索中,先保留 BM25 强基线,增加语义通道后按查询类型测增益。硬约束由可靠字段或专门判断承担;如果没有足够挑战集,宁可小范围启用,也不要用平均相似度掩盖高风险错误。

05

决策规则与证据边界

把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。

信号解释行动限制
精确型号、标准号或错误码查询字符身份是核心,词法通道通常不可替代。使用 BM25/精确字段为主,可让语义补充但不得覆盖硬匹配。分词与别名错误仍会破坏词法召回,需要受控规范化。
同一任务存在大量自然语言和同义表达纯词法可能漏召回,语义通道有明确候选价值。加入稠密或查询扩展通道,并用人工相关集比较增量 Recall。同义扩展会带来对象、否定和领域误召回,必须设置挑战集。
高相似结果违反权限、版本、数字或否定约束表示没有可靠编码硬条件,相似度不能直接决定可用性。增加结构化过滤、专门重排或拒绝规则,并记录严重错误。过滤字段缺失或过期同样危险,应监控覆盖和默认行为。
语义通道仅改善低价值查询且延迟显著上升总体增益不足以覆盖生产成本。按查询分类路由,仅在受益类型启用,保留词法回退。小样本可能低估新查询价值,需报告不确定性和观察窗。
可确认
  • 词法和稠密表示可作为不同候选通道,融合排序及评估指标可在自建系统复算。
  • 向量相似度只是在给定表示与度量下的接近,不包含事实正确保证。
工作推断
  • 同义查询切片 Recall 提升支持语义通道有用,但线上任务收益仍需独立验证。
  • 否定、数字和相反动作挑战集可以揭示语义表示的系统性边界。
不要声称已知
  • Google 对具体查询在哪个阶段采用哪些语义系统、模型和权重并未完整公开。
  • 第三方内容相似度无法换算为网页排名概率或所谓主题权威分。
06

引导练习

先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。

YOUR TURN

教学用合成数据:查询 A“支持 Modbus 的压力传感器”,候选含“支持 Modbus”“不支持 Modbus”“支持 Profibus”;查询 B“降低供应商风险”,词法只命中原句,语义新增“第三方尽调”。请设计混合策略、守门测试和成功指标。

给定材料

  • 两查询的词法 top5、语义 top5、向量相似度、产品协议字段和人工0–3相关等级
  • 性能表:BM25 P95=18ms,语义通道 P95=92ms,融合后缓存命中率与超时率
需要提示时再展开
  1. A 的协议与否定是硬条件,不能只依赖相似度。
  2. B 应衡量语义通道新增的相关文档,而不是把共同候选重复算作增益。
完成后核对参考解法

A 应先以词法和结构化 protocol=Modbus、support=true 过滤,语义只在满足硬条件的候选内补充或重排;“不支持”与 Profibus 是严重错误守门样本。B 可并行 BM25 和语义召回,用融合保留原句与“第三方尽调”候选,并计算增量 Recall@10、nDCG 和误召回类型。上线门槛还应包含 P95 延迟、超时回退、权限字段覆盖。所有材料均为教学用合成数据,结论不能外推为 Google 的语义召回方式。

自评分量规

0 级只按向量相似度排序,没有识别否定、协议和对象约束。
1 级知道要混合,但没有通道贡献、过滤或评估指标。
2 级策略基本合理,却缺少挑战集、延迟或回退。
3 级正确设计精确守门、语义补召回、融合和质量/性能验收。
4 级除三级外,还按查询路由,计算增量候选,并定义失败默认、监控和停止条件。
07

真实项目实战

把理解变成一个可以检查、复核和复用的工作产物。

FIELD LAB

给合规知识库划分检索策略

查询既有 `ISO 27001 A.5.19`,也有“how do we evaluate a new cloud supplier”。

  1. 按精确引用、实体别名、自然语言任务和探索问题标注查询
  2. 运行 BM25、dense 与 hybrid,保存各路候选和分数
  3. 对每类查询比较 Recall@20 与 nDCG@10,并检查失败样本
  4. 为标准号和否定条件加精确保护,为释义查询保留语义召回
  5. 设置逐类发布门槛和回退路径
需要交付查询类型—检索策略矩阵,附离线证据、风险与路由规则。

验收条件

  • 查询类型来自真实日志而非编造 demo
  • 每种方法的收益与失败类型都有示例
  • 保留精确约束,不用一个 embedding 方案覆盖所有任务
08

诊断练习

目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。

SCENARIO

语义搜索把“disable SSO enforcement”文档返回给“enable SSO enforcement”。

竞争假设

  1. embedding 捕捉主题却弱化否定或方向词
  2. 长文块中正反操作共存
  3. 重排和业务过滤未检查关键动作

应该检查的证据

  1. 查询与候选文本的关键 token
  2. chunk 边界及 dense/lexical 分路排名
  3. 包含否定、数字和方向词的挑战集

常见陷阱:展示主题相近就认为相关,而不验证操作后果。

完成后用本页决策规则复核
  1. 若观察到:精确型号、标准号或错误码查询
    应优先:使用 BM25/精确字段为主,可让语义补充但不得覆盖硬匹配。
    分词与别名错误仍会破坏词法召回,需要受控规范化。
  2. 若观察到:同一任务存在大量自然语言和同义表达
    应优先:加入稠密或查询扩展通道,并用人工相关集比较增量 Recall。
    同义扩展会带来对象、否定和领域误召回,必须设置挑战集。
  3. 若观察到:高相似结果违反权限、版本、数字或否定约束
    应优先:增加结构化过滤、专门重排或拒绝规则,并记录严重错误。
    过滤字段缺失或过期同样危险,应监控覆盖和默认行为。
  4. 若观察到:语义通道仅改善低价值查询且延迟显著上升
    应优先:按查询分类路由,仅在受益类型启用,保留词法回退。
    小样本可能低估新查询价值,需报告不确定性和观察窗。
09

自测与误区

先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。

你应该能回答

1. 语义能力位于查询、召回还是重排阶段?

参考答案:必须定位到具体组件:查询阶段可做纠错、同义或实体改写;召回阶段可增加稠密候选;重排阶段可联合分析查询与文档。若不说明位置,就无法判断相关文档在上游漏掉后下游是否还有补救机会,也无法解释延迟、成本和失败回退。

为什么:语义搜索不是单一算法名,阶段定位决定它的输入、输出、可观察证据和工程边界。

2. 哪些精确约束不能丢?

参考答案:精确型号、标准号、数字范围、单位、版本、语言、地区、权限、库存、合规状态和否定通常不能丢。哪些是硬约束要由业务任务定义,并用结构化字段、词法守门或专门判断执行;向量相似只能作为候选证据。

为什么:高相似不等于满足约束,错误产品或无权限文档可能造成比漏召回更严重的损失。

3. 你如何测试否定、数字和相反动作?

参考答案:建立成对挑战集:支持/不支持、至少/至多、10/100、增加/降低、安装/拆除,以及相近型号。对每组要求正确文档进入 top-k、相反文档不进入安全阈值,并按通道保存分数。还要加入自然同义正例,避免系统只因保守过滤而看似无错。

为什么:成对反例直接检验表示是否保留方向和数值,而总体平均很容易掩盖这些低量严重错误。

需要避开的误区

  • 语义搜索意味着关键词和文本不再重要
  • 向量相似就是用户任务相同
  • 加入 embedding 会自动解决所有零结果
10

术语与复盘

用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。

语义检索
利用学习表示、实体或改写连接非完全词面重合查询与文档的检索方法集合。
混合检索
组合词法、稠密或其他通道的候选与分数。
融合
把多个通道的候选与排名合成为一个列表的过程。
倒数排名融合
按每个通道中的名次倒数贡献合并结果,减少原始分数尺度差异。
硬约束
任务要求必须满足的条件,如权限、型号或否定,不能由近似相似度替代。
挑战集
专门包含否定、数字、相反动作等已知困难样本的评估集合。

离开本页前记住

  1. 语义能力可能位于查询、召回、融合或重排,必须明确阶段。
  2. 词法守住精确身份,语义补充同义表达,两者通常互补。
  3. 权限、型号、数字、版本和否定属于硬约束,不能交给相似度猜测。
  4. 混合结果应保留各通道贡献和公式,便于错误分析。
  5. 评估既要看增量 Recall,也要看严重误召回、延迟和回退。
  6. 语义相似度不是 Google 排名概率,生产细节未公开。
11

资料与证据

优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。