KNOWLEDGE / 02LAYER 1当前核心

分词、规范化与语言边界

Tokenization and Normalization

理解文本如何被切成可索引词项,以及大小写、连字符、词形、数字和多语言规则如何改变查询与文档的匹配。

先修知识倒排索引与候选集合
解锁能力词项统计多语言检索站内搜索质量
默认基础正则表达式或基础文本处理概念
本页目录 · 11 个学习环节
01

学习契约与正确模型

先明确为什么学、学完能做什么,以及如何证明自己真的掌握。

为什么现在要学

B2B 内容充满 `H07V-K`、`SOC 2`、`e-commerce`、化学式和中英混排。粗暴分词或写作不一致会让站内搜索、内容分析和关键词聚类产生错误,也会误导 SEO 人员对搜索引擎能力的推断。

完成本页后,你应能
  • 为特定 B2B 语料制定可解释的 tokenization 规则
  • 识别 stemming、lemmatization 与同义扩展的收益和损失
  • 用错误案例评估规范化而非凭直觉选规则
建议节奏

精读 35 分钟 → 引导练习 35 分钟 → 实战任务 45 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。

它是什么
tokenization 决定文本边界,normalization 把表面形式映射到可比较形式;语言、领域和查询任务决定合适策略。
为什么重要
索引与查询若产生不兼容词项,相关文档可能无法被词法匹配;过度归一化又会混淆原本不同的实体。
什么时候使用
用于自建搜索、关键词清洗、内容去重、多语言站点和带型号、单位、缩写的行业语料。
什么时候不要套用
不应从自己的 tokenizer 结果推断 Google 的确切 tokenization;也不要为了“统一”改写品牌、标准和型号。
边界与不确定性
规范化是精确率与召回率的取舍;没有对所有语言和业务语料都最优的单一规则。
02

机制精讲

先读完整因果链,再看每个环节留下什么可观察信号。

分词决定字符被切成哪些可索引单元,规范化决定哪些表面形式被视为同一词项。大小写、连字符、全半角、中文词边界、数字、单位、型号与版本号都会改变查询和文档能否相遇。规则太保守会漏掉合理变体,太激进又会合并不同实体。本页所有型号、查询和结果均为教学用合成数据,用于展示可复算设计方法,不描述 Google 的内部文本处理算法。

SEO 实践不应通过机械堆叠全部写法解决匹配问题,而应先收集真实查询与产品主数据,再保留实体原始身份并建立受控别名。规范化是带损失的决策:把 `H07V-K`、`H07VK` 与 `h07v k` 合并可能提高召回,但若删除规格边界,又会混淆 `1×6` 与 `1×16`。规则必须有来源、正反例、版本和回滚条件,查询端与文档端的每一步也要可对照。

01

字符到 token 边界

分词器需要决定空格、标点、连字符、斜杠、数字与汉字在哪里切开。教学用合成数据 `AC-500` 若切为 `ac` 与 `500`,可支持部分匹配,却可能与 `AC 500V` 混淆。中文领域复合词也可能被通用模型错误拆分。切得更细不自动等于检索更好。

观察什么输出原始串、字符偏移和 token 序列,重点抽查型号、单位与中文领域词。
02

等价映射与信息损失

小写化、Unicode 归一化、词形还原和单位映射会把多个形式映射到规范值。教学用合成数据 `1×6 mm²` 与 `1x6mm2` 可受控合并,但 `M8` 与 `m8` 是否等价取决于实体规则。应同时保存原始值、规范值和规则来源,避免不可逆清洗。

观察什么查看每条规则合并了哪些原始形式,并检查是否跨产品、规格或语言冲突。
03

两端一致与实体保留

文档端把 `sanitary-pump` 拆成两词,而查询端保留整体时仍会漏召回。安全做法是共享可测试流水线,并为型号保留“原样字段、规范字段、别名字段”。查询端可以有意加入纠错与扩展,但差异必须能解释、关闭和回放。

观察什么并排记录同一测试串在 query 与 document 两端的逐阶段 token 和版本。
03

关键概念

掌握术语之间的关系,才能迁移到不同网站、行业和工具。

01

边界决定

空格对英文常有帮助,对中文不足;连字符、撇号、斜杠与单位需要领域规则。

02

词形处理

stemming 用规则截断,lemmatization 尝试映射词元;前者快但可能过度合并,后者依赖语言资源。

03

实体保护

型号、标准号、化学式和品牌应作为受保护模式评估,避免 `H07V-K` 被拆成没有区分度的碎片。

04

完整示范

跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。

WORKED EXAMPLE

为电缆型号和规格设计规范化规则

以下全部是教学用合成数据:D1=`H07V-K 1×6 mm² red cable`,D2=`H07VK 1x6mm2 blue cable`,D3=`H07V K 1 x 6 sq mm conductor`,D4=`H07V-K 1×16 mm² cable`;查询为 `h07v-k 1x6`、`H07VK 6 mm2` 与 `1x6 red`。

前提与样例口径
  • 产品主数据确认前三种型号写法等价。
  • 大小写不区分,乘号与单位可归一化。
  • 规格 1×6 与 1×16 必须保持不同。
  1. 保存原始串

    输入
    读取四条教学用合成数据。
    分析
    先保存 original 字段和字符位置,再生成初步 token,避免清洗错误后无法复原。
    输出
    得到带偏移的原始 token 表。
  2. 生成规范实体

    输入
    应用经审核的型号、乘号和单位规则。
    分析
    D1、D2、D3 映射到型号 `h07v-k` 与规格 `1x6-mm2`;D4 保持 `1x16-mm2`。
    输出
    形成原始值、规范值、类型和规则来源四列。
  3. 手算候选

    输入
    规范化三个查询。
    分析
    前两个查询召回 D1、D2、D3;`1x6 red` 只召回 D1;D4 不应进入,作为误合并反例。
    输出
    得到两个三文档候选和一个单文档候选。
  4. 建立回归测试

    输入
    增加教学用合成数据 `H07V-K 1×6.0 mm²`。
    分析
    建立应合并正例与规格不得混淆反例,锁定规则版本;若误召回上升,可停用映射而原始字段仍可用。
    输出
    形成正例、反例、负责人和回滚条件清单。

结论:好的规范化不是最大限度删字符,而是在可解释边界内合并真正等价的形式。型号要保留原样,单位可统一但不能吞掉数值差异,召回提升必须与误召回一起评估。

迁移到真实项目:真实站点应从查询、站内搜索、询盘和产品主数据收集变体,经领域专家审核后进入别名字典。自建规则只能用于页面表达与内部检索实验,不能称为 Google 的分词规则。

05

决策规则与证据边界

把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。

信号解释行动限制
真实查询存在大小写、连字符或单位变体等价形式分离会产生可预期漏召回。保留原始值并增加受控规范形式与正反例。字符相似不能证明实体等价。
规范化后不同型号或规格合并规则过度激进,业务误召回风险高。恢复实体边界,按类型采用不同规则并回放历史查询。修复可能降低宽泛查询召回,应以受控别名补偿。
查询端与文档端 token 不一致流水线配置、版本或顺序漂移。建立共享测试并锁定版本;有意差异须写明目的。查询纠错可以不对称,但必须可观察和关闭。
可确认
  • 分词和规范化直接决定词法索引中的 token 与共同词项。
  • 规则明确的教学用合成数据可逐条复算候选变化。
工作推断
  • 为真实用户变体提供清晰等价表达通常有助于可检索性。
  • 站内搜索错误可提示页面表达缺口,但不能证明外部系统规则相同。
不要声称已知
  • Google 对不同语言、实体和查询采用的完整处理实现未公开。
  • 无法仅凭页面判断外部系统对某型号执行了哪种别名扩展。
06

引导练习

先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。

YOUR TURN

用教学用合成数据为阀门型号和中英文查询设计规则,处理大小写、连字符、尺寸单位与中文词边界;设置两个正例和两个反例,手算规范化前后候选,并判断漏召回与误召回的业务损失。

给定材料

  • 教学用合成数据:`VX-20 DN50`、`VX20 DN 50`、`VX-200 DN50`、`食品级蝶阀 DN50`、`食品 级蝶阀 DN 50`、`VX-20 DN80`。
  • 教学用合成数据查询:`vx20 dn50`、`VX-20 50mm`、`食品级 蝶阀`、`VX200 DN50`。
  • 规则表:原始串、类型、规范值、别名、正反例与版本。
需要提示时再展开
  1. 先由产品主数据确认 VX-20 与 VX20 是否等价。
  2. 没有工程证据时不要把 50mm 强制映射为 DN50。
  3. 必须检查 VX-200 与 VX-20、DN80 与 DN50 未被合并。
完成后核对参考解法

参考解法:教学用合成数据中,假设主数据确认 `VX-20` 与 `VX20` 等价,则规范为 `vx-20`,`VX-200` 保持 `vx-200`;`DN 50` 可规范为 `dn50`,但 `dn80` 独立。中文词典保留 `食品级` 与 `蝶阀`。于是 `vx20 dn50` 召回前两条,`VX200 DN50` 只召回第三条。若无依据证明 50mm 等同 DN50,就不做扩展。精确采购中误召回错误型号的损失通常更大,应先守住反例。

自评分量规

0 级没有规则或候选计算。
1 级只删除标点,未保护型号和尺寸。
2 级处理主要变体,但缺查询一致性或损失判断。
3 级规则、正反例、候选与业务损失均完整。
4 级除三级外,按实体类型分层并给出版本与回滚流程。
07

真实项目实战

把理解变成一个可以检查、复核和复用的工作产物。

FIELD LAB

建立电缆产品语料的分词规则

关键词表同时包含 H07V-K、H07V K、450/750V、single-core、单芯线和德语规格词。

  1. 抽样 200 个真实查询与产品标题,标注期望 token 和实体
  2. 比较简单空格切分、语言 tokenizer 与实体保护规则
  3. 列出过度切分、合并错误、词形漏配和跨语言错误
  4. 用查询—产品相关性样本计算规则前后的错误率
  5. 将规则版本、语言范围与例外写入数据字典
需要交付带版本的分词规范、受保护实体表和至少三十个回归测试样例。

验收条件

  • 测试覆盖型号、单位、连字符、中英混排和复数
  • 每条规则有真实查询证据和已知副作用
  • 修改后运行固定回归集,不以少量示例宣布成功
08

诊断练习

目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。

SCENARIO

站内搜索查询 `H07V-K 6mm²` 返回大量普通 6mm 电线,目标产品不在前列。

竞争假设

  1. 型号被拆分并丢失连字符关系
  2. 上标单位归一化与索引形式不一致
  3. 通用品类词的高频信号压过型号精确匹配

应该检查的证据

  1. 查询与文档分析器输出 token
  2. 目标产品的索引字段及 explain 结果
  3. 不同拼写变体的离线相关性结果

常见陷阱:给产品页堆更多型号文本,却不修复查询与索引分析链的不一致。

完成后用本页决策规则复核
  1. 若观察到:真实查询存在大小写、连字符或单位变体
    应优先:保留原始值并增加受控规范形式与正反例。
    字符相似不能证明实体等价。
  2. 若观察到:规范化后不同型号或规格合并
    应优先:恢复实体边界,按类型采用不同规则并回放历史查询。
    修复可能降低宽泛查询召回,应以受控别名补偿。
  3. 若观察到:查询端与文档端 token 不一致
    应优先:建立共享测试并锁定版本;有意差异须写明目的。
    查询纠错可以不对称,但必须可观察和关闭。
09

自测与误区

先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。

你应该能回答

1. 哪类错误对业务损失最大:漏召回还是误召回?

参考答案:没有固定答案。精确型号、法规和安全部件任务中,误召回错误产品可能造成采购或合规风险,通常损失更大;探索性发现中,漏召回可能更严重。应按查询类型分别计算相关文档遗漏、错误候选比例和错误后果,再设阈值。

为什么:规范化是召回与精度取舍,必须映射到具体业务损失。

2. 查询与文档使用了相同规范化吗?

参考答案:把同一测试串分别送入查询端与文档端,比较 Unicode、大小写、标点、分词、单位和别名处理后的 token,并记录版本。若不同,要确认是有意查询扩展还是部署漂移,再用正反例验证候选变化。

为什么:配置名称相同不代表处理顺序与完整规则一致,逐阶段输出才能定位差异。

3. 哪些实体必须原样保留并支持哪些变体?

参考答案:通常应原样保留型号、标准号、法规条款、化学式、版本号及尺寸单位组合。变体应来自主数据、真实查询和专家审核,例如大小写、已确认连字符差异和全半角;每个变体都要有来源、范围、冲突测试与停用条件。

为什么:原样值保证身份和追溯,受控别名保证召回,二者分离最安全。

需要避开的误区

  • 英文按空格切分永远足够
  • stemming 越激进,召回越好且没有代价
  • 所有缩写和型号都应拆成普通词
10

术语与复盘

用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。

Tokenization
把字符序列划分为索引 token 的过程。
Normalization
把若干表面形式映射为规范形式。
别名字典
记录经审核实体等价形式与适用范围的映射。
误召回
规则过度合并导致不相关文档进入候选。
漏召回
相关文档因边界或规范形式不同未进入候选。
可逆处理
保留原始值与版本,使结果可解释和回滚。

离开本页前记住

  1. 分词决定边界,规范化决定等价。
  2. 每次合并都要考虑丢失的实体身份。
  3. 查询与文档流水线必须可对照和版本化。
  4. 型号与规格应保留原始形式并使用受控别名。
  5. 评估必须同时包含正例和反例。
  6. 教学规则不能被描述为 Google 的公开分词算法。
11

资料与证据

优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。