KNOWLEDGE / 04LAYER 1下一阶段

词频与饱和效应

Term Frequency

理解词项在文档中的出现次数如何形成局部匹配证据,以及为什么实际检索常用对数或饱和函数削弱重复出现的边际收益。

先修知识分词、规范化与语言边界
解锁能力TF-IDFBM25文本特征审计
默认基础基础对数概念
本页目录 · 11 个学习环节
01

学习契约与正确模型

先明确为什么学、学完能做什么,以及如何证明自己真的掌握。

为什么现在要学

它为“关键词密度为何不是目标”提供数学直觉:从 0 次到 1 次通常比从 20 次到 21 次更有信息。B2B 页面应完整表达产品与任务,而不是通过重复短语追逐伪精度。

完成本页后,你应能
  • 计算 raw、binary 与 log-scaled TF
  • 解释词频边际收益递减
  • 识别词频指标可用于自建检索、不可用于反推 Google 的边界
建议节奏

精读 30 分钟 → 引导练习 35 分钟 → 实战任务 40 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。

它是什么
TF 衡量词项在单篇文档中的出现强度;常见变体包括是否出现、原始次数和 `1 + log(tf)` 等缩放。
为什么重要
重复出现可增加主题证据,但线性计数会让冗长或堆砌文档不合理占优,因此常需缩放与长度校正。
什么时候使用
用于教学、站内搜索调参、文档相似度和可解释的词法基线。
什么时候不要套用
不应用 TF 目标指导 SEO 文案,也不能声称 Google 使用某个公开 TF 公式。
边界与不确定性
TF 只描述文档内部的词项频率,不知道词在全语料是否稀有,也不理解语义、质量与用户任务。
02

机制精讲

先读完整因果链,再看每个环节留下什么可观察信号。

词频 TF 描述词项在单篇文档中的出现次数或变换后的局部强度。第一次出现能把文档从完全缺少该词变为拥有基本匹配证据,继续重复的新增价值通常递减,因此经典检索常使用对数或饱和函数,而不是让频次线性增长。本页所有频次、文档长度、函数参数与结果均为教学用合成数据,只用于手算经典信息检索行为,不代表 Google 的排名权重或公开算法。

SEO 中最常见的误用是把 TF 变成关键词密度目标。一个词出现二十次可能来自导航、页脚或机械堆叠,并不比出现三次但给出定义、规格和限制更有价值。正确审计要同时记录词频、出现字段、模板占比和文档长度,并区分“词完全缺失”与“已经足够但没有新增信息”。超过基本识别需要后,应优先补充事实、例子、比较和边界,而不是复制同一短语。

01

原始词频

最简单的 TF 是 `f(t,d)`。教学用合成数据中,`隔离开关` 在 D1、D2、D3 分别出现 1、4、16 次,原始 TF 就是 1、4、16。它易解释,却隐含每次重复贡献相同,也会偏爱长文档。

观察什么同时报告计数、文档长度、字段和模板来源,不单独使用裸 TF 下结论。
02

边际收益递减

对数 TF 可写 `1+ln(f)`,饱和形式可写 `f/(f+c)`。在教学用合成数据 c=2 时,频次 1、4、16 的饱和值约为 0.333、0.667、0.889;频次翻多倍,分值逐渐接近上限。参数应由任务评估选择。

观察什么绘制频次变化曲线,检查高频文档是否仍因重复获得不合理优势。
03

来源和区分度边界

主体解释、规格表和导航模板都能增加计数,但证据价值不同。TF 也不知道词项在全语料是否常见;教学用合成数据中,`产品` 每页十次而型号只一次,只看 TF 会压过真正区分实体。后续仍需 IDF、长度和任务判断。

观察什么按标题、主体、规格、导航和页脚拆分计数,并检查高 TF 词的全语料覆盖。
03

关键概念

掌握术语之间的关系,才能迁移到不同网站、行业和工具。

01

局部证据

TF 只看当前文档;一个词在页面出现多次可能表示主题重要,也可能只是模板导航重复。

02

次线性缩放

对数或饱和使新增重复的收益递减,避免长度与堆砌主导分数。

03

字段与模板噪声

页脚、导航和筛选标签会抬高次数;分析前需区分主内容与站点模板。

04

完整示范

跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。

WORKED EXAMPLE

比较原始、对数与饱和词频

以下全部是教学用合成数据:三篇等长 100 token 文档中,`隔离开关` 分别出现 1、4、16 次。计算原始 `f`、对数 `1+ln(f)` 和饱和 `f/(f+2)`。

前提与样例口径
  • 三篇文档等长,暂时排除长度差异。
  • 只分析一个词,不加入 IDF 与字段权重。
  • 自然对数结果保留三位小数。
  1. 原始 TF

    输入
    频次 1、4、16。
    分析
    直接计数得到 `[1,4,16]`,D3 被赋予 D2 四倍强度。
    输出
    原始 TF=`[1,4,16]`。
  2. 对数 TF

    输入
    `1+ln(f)`。
    分析
    D1=1;D2≈2.386;D3≈3.773,高频差异被压缩。
    输出
    对数 TF≈`[1.000,2.386,3.773]`。
  3. 饱和 TF

    输入
    `f/(f+2)`。
    分析
    D1≈0.333,D2≈0.667,D3≈0.889,继续重复逐渐接近 1。
    输出
    饱和 TF≈`[0.333,0.667,0.889]`。
  4. 审计来源

    输入
    教学用合成数据补充:D3 的 16 次中有 12 次来自导航模板。
    分析
    主体只有 4 次,主体饱和值为 0.667,与 D2 相同;总频次虚高来自模板。
    输出
    结论修正为 D3 主体证据并不强于 D2。

结论:三种表示对相同计数产生不同增长曲线,证明词频不是天然线性的相关性证据。来源不明的高计数会误导诊断;先确认是否缺失,再检查上下文和字段,最后才用评估选择变换。

迁移到真实项目:真实页面可按模板、正文和规格统计实体并比较案例,但不能从相关性推导因果。自建检索可在标注查询集比较不同 TF;外部 SEO 中只能把它作为内容证据审计,不能声称复现 Google 评分。

05

决策规则与证据边界

把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。

信号解释行动限制
实体在主体完全没有出现缺少最基本的词法与用户理解证据。在符合事实的位置给出实体、定义和上下文。出现一次不保证满足意图或获得排名。
高频主要来自导航或页脚模板污染使总计数不能代表主体。分离字段并修正统计,再判断内容。模板可能有导航价值,不应只为降频删除。
重复不再增加新事实内容进入边际收益递减区。停止堆词,补充规格、证据、反例和限制。不存在适用于所有页面的公开固定饱和点。
可确认
  • 原始 TF 可计数,对数和饱和变换会降低重复边际增益。
  • 给定公式的教学用合成数据结果可复算。
工作推断
  • 主体缺少关键实体时,词法召回机会通常较低。
  • 模板高频通常弱于主体解释,但字段利用方式仍需实测。
不要声称已知
  • Google 对某查询和字段采用何种词频处理未完整公开。
  • 仅凭页面频次无法证明外部排名变化的原因。
06

引导练习

先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。

YOUR TURN

用教学用合成数据审计四篇不同长度产品页,计算主体 TF、全页 TF、对数 TF 和 `f/(f+3)`,识别模板污染,并给出补齐实体或停止重复的决策。

给定材料

  • 教学用合成数据:A 页主体0模板5;B页主体2模板1;C页主体6模板8;D页主体12模板0,长度分别80、100、300、120。
  • 教学用合成数据公式:原始 f、`1+ln(f)`、`f/(f+3)`,零频记0。
  • 字段表:标题、主体、规格、导航、页脚和总长度。
需要提示时再展开
  1. 先分别算主体与全页。
  2. 比较从0到1、2到6、6到12的边际变化。
  3. 本题未做长度归一化,要明确限制。
完成后核对参考解法

参考解法:教学用合成数据中,A 主体为0,即使全页5次也只证明模板含词,应在主体补充真实说明。B、C、D 的主体饱和值分别为 `2/5=0.4`、`6/9≈0.667`、`12/15=0.8`;C 到 D 频次翻倍但只增加约0.133。C 的全页14次中8次来自模板,不能认定主体更强。A补基本证据,B查上下文,C修正模板统计,D停止重复并增加独特信息。

自评分量规

0 级无计算或直接以总词频判质量。
1 级有部分计算但未分主体与模板。
2 级主要数值正确但缺限制或决策。
3 级四页计算、模板、饱和与行动均完整。
4 级除三级外比较多种变换并提出可复测字段审计。
07

真实项目实战

把理解变成一个可以检查、复核和复用的工作产物。

FIELD LAB

比较三份供应商风险管理页面

团队认为把 `vendor risk` 从 12 次增加到 30 次就能超越竞争页面。

  1. 对三页使用同一 tokenizer 并移除导航模板
  2. 计算 raw TF、binary TF 和 log TF
  3. 标注每次出现承担的语义角色:定义、功能、流程、证据或重复
  4. 对比边际分数变化与实际信息增益
  5. 重写缺失的任务证据,而不是以次数为目标
需要交付词频变体计算表与一页“重复次数—信息增益”评审说明。

验收条件

  • 计算可由他人复现且 tokenizer 一致
  • 明确模板文本是否计入
  • 内容建议以用户问题和证据为单位,不给出理想密度
08

诊断练习

目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。

SCENARIO

页面目标词出现频率最高,但对查询表现最差。

竞争假设

  1. 重复来自导航或无信息段落
  2. 页面类型不匹配采购任务
  3. 竞争页提供更完整的实体、证据和权威信号

应该检查的证据

  1. 主内容与模板分离后的 TF
  2. SERP 页面类型和段落级信息比较
  3. 查询族 impressions、链接和转化质量

常见陷阱:继续增加目标词,制造可读性与 spam 风险。

完成后用本页决策规则复核
  1. 若观察到:实体在主体完全没有出现
    应优先:在符合事实的位置给出实体、定义和上下文。
    出现一次不保证满足意图或获得排名。
  2. 若观察到:高频主要来自导航或页脚
    应优先:分离字段并修正统计,再判断内容。
    模板可能有导航价值,不应只为降频删除。
  3. 若观察到:重复不再增加新事实
    应优先:停止堆词,补充规格、证据、反例和限制。
    不存在适用于所有页面的公开固定饱和点。
09

自测与误区

先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。

你应该能回答

1. 从第 0 次到第 1 次与第 20 次到第 21 次为何不同?

参考答案:第0到第1次把文档从没有该词变为至少存在,可能改变是否进入词法候选;第20到21次只是在大量存在后的重复,新增信息通常很小。对数与饱和函数编码这种递减,但如果新一次出现在新的关键规格中,内容价值仍可能更高。

为什么:边际变化解释了为何关键词堆叠不应线性获益,同时保留上下文边界。

2. 频次来自主内容还是模板?

参考答案:按 DOM 区域拆分标题、主体、规格、导航、页脚和推荐组件,跨大量页面重复且结构位置一致的命中通常属于模板;还要抽查渲染文本,避免组件重复注入。报告主体 TF、模板 TF 与总 TF。

为什么:同样计数来自不同字段时代表的页面证据不同。

3. 除词频外还缺少哪些查询证据?

参考答案:还缺语料区分度、文档长度、字段、词序、查询其他词、同义实体、索引状态、意图、内容质量、时效、链接和任务结果。TF 只是局部计数,无法单独回答页面是否真正解决查询。

为什么:列出缺失变量能防止把小指标误当完整排名模型。

需要避开的误区

  • TF 越高,相关性一定越高
  • 存在跨页面通用的最佳关键词密度
  • TF 能判断内容是否准确或有帮助
10

术语与复盘

用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。

词频
词项在单篇文档中的次数或变换权重。
原始 TF
直接使用 f(t,d) 的表示。
对数 TF
用对数压缩高频差异。
饱和函数
频次增加时逐渐接近上限的变换。
边际收益
再增加一次带来的分值或信息增量。
模板污染
跨页重复区域使总词频虚高。

离开本页前记住

  1. TF 是局部证据,不是页面质量或最终排名。
  2. 从零到一次通常比高频后的又一次更重要。
  3. 频次必须与字段、模板和长度一起阅读。
  4. 高频通用词仍可能没有区分度。
  5. 写作应从重复转向新增事实和任务帮助。
  6. 不存在可据此宣称的 Google 关键词密度阈值。
11

资料与证据

优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。