学习契约与正确模型
先明确为什么学、学完能做什么,以及如何证明自己真的掌握。
在工业语料中,“solution”“system”区分度低,而标准号、材料与协议更能缩小候选。IDF 帮助从业者重视具体实体,但不能被误读为写入冷僻词就会提升 Google 排名。
- 根据 N 与 document frequency 计算 IDF
- 解释稀有词和常见词在候选区分上的不同
- 识别语料漂移与零文档频率的处理问题
精读 30 分钟 → 引导练习 35 分钟 → 实战任务 40 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。
- 它是什么
- IDF 通常是总文档数 N 与包含词项的文档数 df 之比的对数变体;df 越低,区分权重通常越高。
- 为什么重要
- 几乎每篇文档都有的词不能有效区分相关文档,稀有但匹配的词提供更强选择性。
- 什么时候使用
- 用于词法检索、关键词特异性分析、特征工程和理解标准号/型号查询。
- 什么时候不要套用
- 不应把低 df 当作商业需求,也不能跨不同语料直接比较 IDF 数值。
- 边界与不确定性
- IDF 是语料统计量,不知道词项是否真实、重要或符合意图;公式存在平滑和概率式等多种变体。
机制精讲
先读完整因果链,再看每个环节留下什么可观察信号。
逆文档频率 IDF 衡量词项在指定语料中的区分能力。词若出现在几乎所有文档中,对判断哪篇更相关帮助较小;只出现在少数文档中,则能更强地缩小候选。IDF 使用文档总数 N 和包含词项的文档数 df,而不是词项在全语料的总出现次数。公式有基础、平滑和概率式变体,数值必须附公式、语料和日期。本页所有语料与数值均为教学用合成数据,不代表 Google 的统计或算法。
IDF 不意味着越稀有越值得写。罕见型号可能区分度高却没有需求,随机导入 ID 也可能极稀有但毫无价值;常见品类词虽然 IDF 低,却是用户理解页面所必需。语料边界会改变结论,同一词在全目录与子目录中的覆盖不同。使用 IDF 时必须同时核对语料范围、计算时间、分词版本、真实查询需求与产品证据。
df 是文档覆盖
df 是至少包含一次词项的文档数,每篇最多贡献1。教学用合成数据 N=8 时,sensor 出现在8篇、ip67在2篇、xt-900在1篇,df分别为8、2、1。某篇重复二十次仍只计一个 docID。
从 df 计算 IDF
基础形式 `ln(N/df)` 下,教学用合成数据得到 sensor=`ln1=0`,ip67=`ln4≈1.386`,xt-900=`ln8≈2.079`。数值越高表示当前语料覆盖越窄;不同平滑会改变尺度。
语料漂移与稀有噪声
IDF 是语料快照函数,不是词的永久属性。新增文档、模板或分词变化都会改变数值。教学用合成数据中的 `tmp-a91x` 与正式型号都可能 df=1,但前者只是噪声;区分度必须结合需求和实体真实性。
关键概念
掌握术语之间的关系,才能迁移到不同网站、行业和工具。
文档频率 df
统计“多少篇文档包含该词”,不是全语料总出现次数;同一页重复很多次不会增加 df。
语料依赖
同一词在全网、企业帮助中心和产品目录中的 IDF 完全不同,语料更新后也会改变。
稀有不等于有价值
拼写错误或随机型号可能极稀有,但没有需求;区分力需要与查询和业务证据结合。
完整示范
跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。
在八篇文档中手算 IDF
以下全部是教学用合成数据:N=8,sensor 的 df=8,ip67 的 df=2,xt-900 的 df=1;采用 `idf=ln(N/df)`。
- 每篇是否出现至少一次决定 df。
- 用自然对数且不平滑。
- 词项经过同一规范化流程。
确认 N 与 df
- 输入
- N=8,df为8、2、1。
- 分析
- 覆盖率分别为100%、25%、12.5%,重复次数不改变 df。
- 输出
- 得到三组 N/df 输入。
代入公式
- 输入
- `ln(N/df)`。
- 分析
- sensor=0,ip67≈1.386,xt-900≈2.079。
- 输出
- 区分度排序为型号、ip67、sensor。
区分总词频
- 输入
- 教学用合成数据总词频分别为64、20、1。
- 分析
- 总词频不进入当前 IDF 公式,只要 docID 集合不变,IDF 不变。
- 输出
- 确认 df 与总出现次数不同。
模拟扩张
- 输入
- 新增8篇教学用合成数据,其中6篇含 ip67。
- 分析
- 新 N=16、ip67 df=8,IDF=`ln2≈0.693`;xt-900 df仍1,IDF=`ln16≈2.773`。
- 输出
- 记录语料扩张造成的统计漂移。
决策规则与证据边界
把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。
- df 是含词文档数,基础 IDF 可由 N 与 df 透明计算。
- IDF 随语料范围、时间和分词规则变化。
- 高区分度且有需求的实体通常比通用词更能区分页面。
- IDF 漂移可提示模板或目录变化,但需内容证据确认。
- Google 的实际语料边界、平滑与更新方式未公开。
- 内部高 IDF 不能证明对真实 Google 排名的影响。
引导练习
先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。
用教学用合成数据在全目录和阀门子目录两个边界计算五个词的 df 与 IDF,识别噪声词、必要品类词与有采购价值的实体。
给定材料
- 教学用合成数据:全目录 N=12,product df12、valve df6、dn50 df3、api-609 df2、tmp-z7 df1;子目录 N=6,对应6、6、3、2、1。
- 教学用合成数据说明:api 609 有采购任务,tmp-z7 来自临时导入字段。
- 公式 `ln(N/df)`,自然对数。
需要提示时再展开
- 两个语料分别计算,不混用 N 与 df。
- 最高 IDF 不等于最高价值。
- valve 在子目录 IDF 为0仍可能必须保留。
完成后核对参考解法
参考解法:全目录教学用合成数据中,product=0,valve≈0.693,dn50≈1.386,api-609≈1.792,tmp-z7≈2.485;子目录中 valve=0,dn50≈0.693,api-609≈1.099,tmp-z7≈1.792。噪声是 tmp-z7,低 IDF 但必要的是 valve,兼具区分度和采购意义的是 api-609。结论必须附语料、日期和公式,不能把内部数值称为外部搜索权重。
自评分量规
真实项目实战
把理解变成一个可以检查、复核和复用的工作产物。
找出工业泵目录的区分性属性
500 个产品页都反复使用 pump、quality 和 solution,真正影响选型的是 ATEX、viscosity 与 seal material。
- 固定 500 页语料与 tokenizer 版本
- 计算每个词项 df 和带平滑的 IDF
- 对高 IDF 词抽样验证是否为真实属性、型号或噪声
- 连接 GSC 查询与销售筛选条件,判断需求和商业意义
- 把缺失但有证据的属性加入数据模型与页面,而非追逐最高 IDF
验收条件
- 记录语料规模、日期与分词规则
- 人工验证拼写错误和一次性噪声
- 入选属性同时具备区分度与用户/销售证据
诊断练习
目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。
内容工具建议加入一批高权重术语,但销售确认客户从不使用。
竞争假设
- 工具的参考语料与目标行业或国家不匹配
- 高 IDF 来自少量竞争页的品牌或噪声
- 术语是专家概念,但查询阶段使用另一表达
应该检查的证据
- 工具语料与计算口径说明
- GSC、站内搜索和通话文本
- 术语在目标 SERP 中的上下文
常见陷阱:把不透明工具分数当作 Google 权重,机械加入所有推荐词。
完成后用本页决策规则复核
- 若观察到:df 接近 N、IDF 接近零
应优先:与更具体实体和任务词组合,并检查模板。
低 IDF 品类词仍可能是用户必需信息。 - 若观察到:IDF 极高但无查询和业务需求
应优先:核对实体来源并从机会清单剔除噪声。
新产品无历史查询不等于未来无价值。 - 若观察到:版本间 IDF 剧烈变化
应优先:检查 N、df 和规则版本,重建基线。
变化也可能真实反映目录扩张或术语普及。
自测与误区
先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。
你应该能回答
1. df 与总词频有何区别?
参考答案:df 是至少包含该词一次的文档数量,每篇最多贡献1;总词频是全部出现次数,一篇可贡献很多。教学用合成数据中两篇各出现十次时,df=2、总词频=20。IDF 通常使用 df,TF 才处理单篇强度。
为什么:混淆两者会把少数文档的重复误判为广泛覆盖。
2. 这个 IDF 来自什么语料和日期?
参考答案:必须报告语料边界、N、纳入规则、语言或目录、分词规范、公式、平滑、日期和版本。例如“2026-08-31 中文产品目录,N=12,自然对数基础公式”。缺少这些元数据就无法复算或比较。
为什么:IDF 是语料快照的函数,不是词项的永久属性。
3. 稀有词是否同时有真实需求与产品证据?
参考答案:需求可由真实查询、站内搜索、询盘或采购任务验证;产品证据来自正式型号、规格和技术文档。若稀有词只是临时 ID 或拼写噪声,即使 IDF 高也不应成为目标;若有需求但产品不具备,也不能添加。
为什么:区分度、用户需求与事实证据必须同时成立。
需要避开的误区
- IDF 衡量一个词的搜索量
- 越稀有的词越值得优化
- 不同工具的 IDF/内容分数可以直接比较
术语与复盘
用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。
- 文档频率
- 包含某词项的文档数量。
- 逆文档频率
- 由 N 与 df 得到的语料级区分度。
- 语料边界
- 参与统计的文档集合及纳入规则。
- 平滑
- 为处理极端值对公式加入常数。
- 区分度
- 词项缩小候选的统计能力。
- 统计漂移
- 语料或规则变化导致 IDF 随时间改变。
离开本页前记住
- df 是含词文档数,不是总出现次数。
- IDF 高只代表当前语料稀有,不自动代表价值。
- 数值必须附语料、公式、日期和分词版本。
- 语料扩张与模板变化会改变 IDF。
- 低 IDF 品类词可能必要,高 IDF 噪声应剔除。
- 内部 IDF 不能冒充 Google 的公开权重。
资料与证据
优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。