学习契约与正确模型
先明确为什么学、学完能做什么,以及如何证明自己真的掌握。
B2B 内容充满 `H07V-K`、`SOC 2`、`e-commerce`、化学式和中英混排。粗暴分词或写作不一致会让站内搜索、内容分析和关键词聚类产生错误,也会误导 SEO 人员对搜索引擎能力的推断。
- 为特定 B2B 语料制定可解释的 tokenization 规则
- 识别 stemming、lemmatization 与同义扩展的收益和损失
- 用错误案例评估规范化而非凭直觉选规则
精读 35 分钟 → 引导练习 35 分钟 → 实战任务 45 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。
- 它是什么
- tokenization 决定文本边界,normalization 把表面形式映射到可比较形式;语言、领域和查询任务决定合适策略。
- 为什么重要
- 索引与查询若产生不兼容词项,相关文档可能无法被词法匹配;过度归一化又会混淆原本不同的实体。
- 什么时候使用
- 用于自建搜索、关键词清洗、内容去重、多语言站点和带型号、单位、缩写的行业语料。
- 什么时候不要套用
- 不应从自己的 tokenizer 结果推断 Google 的确切 tokenization;也不要为了“统一”改写品牌、标准和型号。
- 边界与不确定性
- 规范化是精确率与召回率的取舍;没有对所有语言和业务语料都最优的单一规则。
机制精讲
先读完整因果链,再看每个环节留下什么可观察信号。
分词决定字符被切成哪些可索引单元,规范化决定哪些表面形式被视为同一词项。大小写、连字符、全半角、中文词边界、数字、单位、型号与版本号都会改变查询和文档能否相遇。规则太保守会漏掉合理变体,太激进又会合并不同实体。本页所有型号、查询和结果均为教学用合成数据,用于展示可复算设计方法,不描述 Google 的内部文本处理算法。
SEO 实践不应通过机械堆叠全部写法解决匹配问题,而应先收集真实查询与产品主数据,再保留实体原始身份并建立受控别名。规范化是带损失的决策:把 `H07V-K`、`H07VK` 与 `h07v k` 合并可能提高召回,但若删除规格边界,又会混淆 `1×6` 与 `1×16`。规则必须有来源、正反例、版本和回滚条件,查询端与文档端的每一步也要可对照。
字符到 token 边界
分词器需要决定空格、标点、连字符、斜杠、数字与汉字在哪里切开。教学用合成数据 `AC-500` 若切为 `ac` 与 `500`,可支持部分匹配,却可能与 `AC 500V` 混淆。中文领域复合词也可能被通用模型错误拆分。切得更细不自动等于检索更好。
等价映射与信息损失
小写化、Unicode 归一化、词形还原和单位映射会把多个形式映射到规范值。教学用合成数据 `1×6 mm²` 与 `1x6mm2` 可受控合并,但 `M8` 与 `m8` 是否等价取决于实体规则。应同时保存原始值、规范值和规则来源,避免不可逆清洗。
两端一致与实体保留
文档端把 `sanitary-pump` 拆成两词,而查询端保留整体时仍会漏召回。安全做法是共享可测试流水线,并为型号保留“原样字段、规范字段、别名字段”。查询端可以有意加入纠错与扩展,但差异必须能解释、关闭和回放。
关键概念
掌握术语之间的关系,才能迁移到不同网站、行业和工具。
边界决定
空格对英文常有帮助,对中文不足;连字符、撇号、斜杠与单位需要领域规则。
词形处理
stemming 用规则截断,lemmatization 尝试映射词元;前者快但可能过度合并,后者依赖语言资源。
实体保护
型号、标准号、化学式和品牌应作为受保护模式评估,避免 `H07V-K` 被拆成没有区分度的碎片。
完整示范
跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。
为电缆型号和规格设计规范化规则
以下全部是教学用合成数据:D1=`H07V-K 1×6 mm² red cable`,D2=`H07VK 1x6mm2 blue cable`,D3=`H07V K 1 x 6 sq mm conductor`,D4=`H07V-K 1×16 mm² cable`;查询为 `h07v-k 1x6`、`H07VK 6 mm2` 与 `1x6 red`。
- 产品主数据确认前三种型号写法等价。
- 大小写不区分,乘号与单位可归一化。
- 规格 1×6 与 1×16 必须保持不同。
保存原始串
- 输入
- 读取四条教学用合成数据。
- 分析
- 先保存 original 字段和字符位置,再生成初步 token,避免清洗错误后无法复原。
- 输出
- 得到带偏移的原始 token 表。
生成规范实体
- 输入
- 应用经审核的型号、乘号和单位规则。
- 分析
- D1、D2、D3 映射到型号 `h07v-k` 与规格 `1x6-mm2`;D4 保持 `1x16-mm2`。
- 输出
- 形成原始值、规范值、类型和规则来源四列。
手算候选
- 输入
- 规范化三个查询。
- 分析
- 前两个查询召回 D1、D2、D3;`1x6 red` 只召回 D1;D4 不应进入,作为误合并反例。
- 输出
- 得到两个三文档候选和一个单文档候选。
建立回归测试
- 输入
- 增加教学用合成数据 `H07V-K 1×6.0 mm²`。
- 分析
- 建立应合并正例与规格不得混淆反例,锁定规则版本;若误召回上升,可停用映射而原始字段仍可用。
- 输出
- 形成正例、反例、负责人和回滚条件清单。
决策规则与证据边界
把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。
- 分词和规范化直接决定词法索引中的 token 与共同词项。
- 规则明确的教学用合成数据可逐条复算候选变化。
- 为真实用户变体提供清晰等价表达通常有助于可检索性。
- 站内搜索错误可提示页面表达缺口,但不能证明外部系统规则相同。
- Google 对不同语言、实体和查询采用的完整处理实现未公开。
- 无法仅凭页面判断外部系统对某型号执行了哪种别名扩展。
引导练习
先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。
用教学用合成数据为阀门型号和中英文查询设计规则,处理大小写、连字符、尺寸单位与中文词边界;设置两个正例和两个反例,手算规范化前后候选,并判断漏召回与误召回的业务损失。
给定材料
- 教学用合成数据:`VX-20 DN50`、`VX20 DN 50`、`VX-200 DN50`、`食品级蝶阀 DN50`、`食品 级蝶阀 DN 50`、`VX-20 DN80`。
- 教学用合成数据查询:`vx20 dn50`、`VX-20 50mm`、`食品级 蝶阀`、`VX200 DN50`。
- 规则表:原始串、类型、规范值、别名、正反例与版本。
需要提示时再展开
- 先由产品主数据确认 VX-20 与 VX20 是否等价。
- 没有工程证据时不要把 50mm 强制映射为 DN50。
- 必须检查 VX-200 与 VX-20、DN80 与 DN50 未被合并。
完成后核对参考解法
参考解法:教学用合成数据中,假设主数据确认 `VX-20` 与 `VX20` 等价,则规范为 `vx-20`,`VX-200` 保持 `vx-200`;`DN 50` 可规范为 `dn50`,但 `dn80` 独立。中文词典保留 `食品级` 与 `蝶阀`。于是 `vx20 dn50` 召回前两条,`VX200 DN50` 只召回第三条。若无依据证明 50mm 等同 DN50,就不做扩展。精确采购中误召回错误型号的损失通常更大,应先守住反例。
自评分量规
真实项目实战
把理解变成一个可以检查、复核和复用的工作产物。
建立电缆产品语料的分词规则
关键词表同时包含 H07V-K、H07V K、450/750V、single-core、单芯线和德语规格词。
- 抽样 200 个真实查询与产品标题,标注期望 token 和实体
- 比较简单空格切分、语言 tokenizer 与实体保护规则
- 列出过度切分、合并错误、词形漏配和跨语言错误
- 用查询—产品相关性样本计算规则前后的错误率
- 将规则版本、语言范围与例外写入数据字典
验收条件
- 测试覆盖型号、单位、连字符、中英混排和复数
- 每条规则有真实查询证据和已知副作用
- 修改后运行固定回归集,不以少量示例宣布成功
诊断练习
目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。
站内搜索查询 `H07V-K 6mm²` 返回大量普通 6mm 电线,目标产品不在前列。
竞争假设
- 型号被拆分并丢失连字符关系
- 上标单位归一化与索引形式不一致
- 通用品类词的高频信号压过型号精确匹配
应该检查的证据
- 查询与文档分析器输出 token
- 目标产品的索引字段及 explain 结果
- 不同拼写变体的离线相关性结果
常见陷阱:给产品页堆更多型号文本,却不修复查询与索引分析链的不一致。
完成后用本页决策规则复核
- 若观察到:真实查询存在大小写、连字符或单位变体
应优先:保留原始值并增加受控规范形式与正反例。
字符相似不能证明实体等价。 - 若观察到:规范化后不同型号或规格合并
应优先:恢复实体边界,按类型采用不同规则并回放历史查询。
修复可能降低宽泛查询召回,应以受控别名补偿。 - 若观察到:查询端与文档端 token 不一致
应优先:建立共享测试并锁定版本;有意差异须写明目的。
查询纠错可以不对称,但必须可观察和关闭。
自测与误区
先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。
你应该能回答
1. 哪类错误对业务损失最大:漏召回还是误召回?
参考答案:没有固定答案。精确型号、法规和安全部件任务中,误召回错误产品可能造成采购或合规风险,通常损失更大;探索性发现中,漏召回可能更严重。应按查询类型分别计算相关文档遗漏、错误候选比例和错误后果,再设阈值。
为什么:规范化是召回与精度取舍,必须映射到具体业务损失。
2. 查询与文档使用了相同规范化吗?
参考答案:把同一测试串分别送入查询端与文档端,比较 Unicode、大小写、标点、分词、单位和别名处理后的 token,并记录版本。若不同,要确认是有意查询扩展还是部署漂移,再用正反例验证候选变化。
为什么:配置名称相同不代表处理顺序与完整规则一致,逐阶段输出才能定位差异。
3. 哪些实体必须原样保留并支持哪些变体?
参考答案:通常应原样保留型号、标准号、法规条款、化学式、版本号及尺寸单位组合。变体应来自主数据、真实查询和专家审核,例如大小写、已确认连字符差异和全半角;每个变体都要有来源、范围、冲突测试与停用条件。
为什么:原样值保证身份和追溯,受控别名保证召回,二者分离最安全。
需要避开的误区
- 英文按空格切分永远足够
- stemming 越激进,召回越好且没有代价
- 所有缩写和型号都应拆成普通词
术语与复盘
用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。
- Tokenization
- 把字符序列划分为索引 token 的过程。
- Normalization
- 把若干表面形式映射为规范形式。
- 别名字典
- 记录经审核实体等价形式与适用范围的映射。
- 误召回
- 规则过度合并导致不相关文档进入候选。
- 漏召回
- 相关文档因边界或规范形式不同未进入候选。
- 可逆处理
- 保留原始值与版本,使结果可解释和回滚。
离开本页前记住
- 分词决定边界,规范化决定等价。
- 每次合并都要考虑丢失的实体身份。
- 查询与文档流水线必须可对照和版本化。
- 型号与规格应保留原始形式并使用受控别名。
- 评估必须同时包含正例和反例。
- 教学规则不能被描述为 Google 的公开分词算法。
资料与证据
优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。