学习契约与正确模型
先明确为什么学、学完能做什么,以及如何证明自己真的掌握。
它为“关键词密度为何不是目标”提供数学直觉:从 0 次到 1 次通常比从 20 次到 21 次更有信息。B2B 页面应完整表达产品与任务,而不是通过重复短语追逐伪精度。
- 计算 raw、binary 与 log-scaled TF
- 解释词频边际收益递减
- 识别词频指标可用于自建检索、不可用于反推 Google 的边界
精读 30 分钟 → 引导练习 35 分钟 → 实战任务 40 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。
- 它是什么
- TF 衡量词项在单篇文档中的出现强度;常见变体包括是否出现、原始次数和 `1 + log(tf)` 等缩放。
- 为什么重要
- 重复出现可增加主题证据,但线性计数会让冗长或堆砌文档不合理占优,因此常需缩放与长度校正。
- 什么时候使用
- 用于教学、站内搜索调参、文档相似度和可解释的词法基线。
- 什么时候不要套用
- 不应用 TF 目标指导 SEO 文案,也不能声称 Google 使用某个公开 TF 公式。
- 边界与不确定性
- TF 只描述文档内部的词项频率,不知道词在全语料是否稀有,也不理解语义、质量与用户任务。
机制精讲
先读完整因果链,再看每个环节留下什么可观察信号。
词频 TF 描述词项在单篇文档中的出现次数或变换后的局部强度。第一次出现能把文档从完全缺少该词变为拥有基本匹配证据,继续重复的新增价值通常递减,因此经典检索常使用对数或饱和函数,而不是让频次线性增长。本页所有频次、文档长度、函数参数与结果均为教学用合成数据,只用于手算经典信息检索行为,不代表 Google 的排名权重或公开算法。
SEO 中最常见的误用是把 TF 变成关键词密度目标。一个词出现二十次可能来自导航、页脚或机械堆叠,并不比出现三次但给出定义、规格和限制更有价值。正确审计要同时记录词频、出现字段、模板占比和文档长度,并区分“词完全缺失”与“已经足够但没有新增信息”。超过基本识别需要后,应优先补充事实、例子、比较和边界,而不是复制同一短语。
原始词频
最简单的 TF 是 `f(t,d)`。教学用合成数据中,`隔离开关` 在 D1、D2、D3 分别出现 1、4、16 次,原始 TF 就是 1、4、16。它易解释,却隐含每次重复贡献相同,也会偏爱长文档。
边际收益递减
对数 TF 可写 `1+ln(f)`,饱和形式可写 `f/(f+c)`。在教学用合成数据 c=2 时,频次 1、4、16 的饱和值约为 0.333、0.667、0.889;频次翻多倍,分值逐渐接近上限。参数应由任务评估选择。
来源和区分度边界
主体解释、规格表和导航模板都能增加计数,但证据价值不同。TF 也不知道词项在全语料是否常见;教学用合成数据中,`产品` 每页十次而型号只一次,只看 TF 会压过真正区分实体。后续仍需 IDF、长度和任务判断。
关键概念
掌握术语之间的关系,才能迁移到不同网站、行业和工具。
局部证据
TF 只看当前文档;一个词在页面出现多次可能表示主题重要,也可能只是模板导航重复。
次线性缩放
对数或饱和使新增重复的收益递减,避免长度与堆砌主导分数。
字段与模板噪声
页脚、导航和筛选标签会抬高次数;分析前需区分主内容与站点模板。
完整示范
跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。
比较原始、对数与饱和词频
以下全部是教学用合成数据:三篇等长 100 token 文档中,`隔离开关` 分别出现 1、4、16 次。计算原始 `f`、对数 `1+ln(f)` 和饱和 `f/(f+2)`。
- 三篇文档等长,暂时排除长度差异。
- 只分析一个词,不加入 IDF 与字段权重。
- 自然对数结果保留三位小数。
原始 TF
- 输入
- 频次 1、4、16。
- 分析
- 直接计数得到 `[1,4,16]`,D3 被赋予 D2 四倍强度。
- 输出
- 原始 TF=`[1,4,16]`。
对数 TF
- 输入
- `1+ln(f)`。
- 分析
- D1=1;D2≈2.386;D3≈3.773,高频差异被压缩。
- 输出
- 对数 TF≈`[1.000,2.386,3.773]`。
饱和 TF
- 输入
- `f/(f+2)`。
- 分析
- D1≈0.333,D2≈0.667,D3≈0.889,继续重复逐渐接近 1。
- 输出
- 饱和 TF≈`[0.333,0.667,0.889]`。
审计来源
- 输入
- 教学用合成数据补充:D3 的 16 次中有 12 次来自导航模板。
- 分析
- 主体只有 4 次,主体饱和值为 0.667,与 D2 相同;总频次虚高来自模板。
- 输出
- 结论修正为 D3 主体证据并不强于 D2。
决策规则与证据边界
把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。
- 原始 TF 可计数,对数和饱和变换会降低重复边际增益。
- 给定公式的教学用合成数据结果可复算。
- 主体缺少关键实体时,词法召回机会通常较低。
- 模板高频通常弱于主体解释,但字段利用方式仍需实测。
- Google 对某查询和字段采用何种词频处理未完整公开。
- 仅凭页面频次无法证明外部排名变化的原因。
引导练习
先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。
用教学用合成数据审计四篇不同长度产品页,计算主体 TF、全页 TF、对数 TF 和 `f/(f+3)`,识别模板污染,并给出补齐实体或停止重复的决策。
给定材料
- 教学用合成数据:A 页主体0模板5;B页主体2模板1;C页主体6模板8;D页主体12模板0,长度分别80、100、300、120。
- 教学用合成数据公式:原始 f、`1+ln(f)`、`f/(f+3)`,零频记0。
- 字段表:标题、主体、规格、导航、页脚和总长度。
需要提示时再展开
- 先分别算主体与全页。
- 比较从0到1、2到6、6到12的边际变化。
- 本题未做长度归一化,要明确限制。
完成后核对参考解法
参考解法:教学用合成数据中,A 主体为0,即使全页5次也只证明模板含词,应在主体补充真实说明。B、C、D 的主体饱和值分别为 `2/5=0.4`、`6/9≈0.667`、`12/15=0.8`;C 到 D 频次翻倍但只增加约0.133。C 的全页14次中8次来自模板,不能认定主体更强。A补基本证据,B查上下文,C修正模板统计,D停止重复并增加独特信息。
自评分量规
真实项目实战
把理解变成一个可以检查、复核和复用的工作产物。
比较三份供应商风险管理页面
团队认为把 `vendor risk` 从 12 次增加到 30 次就能超越竞争页面。
- 对三页使用同一 tokenizer 并移除导航模板
- 计算 raw TF、binary TF 和 log TF
- 标注每次出现承担的语义角色:定义、功能、流程、证据或重复
- 对比边际分数变化与实际信息增益
- 重写缺失的任务证据,而不是以次数为目标
验收条件
- 计算可由他人复现且 tokenizer 一致
- 明确模板文本是否计入
- 内容建议以用户问题和证据为单位,不给出理想密度
诊断练习
目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。
页面目标词出现频率最高,但对查询表现最差。
竞争假设
- 重复来自导航或无信息段落
- 页面类型不匹配采购任务
- 竞争页提供更完整的实体、证据和权威信号
应该检查的证据
- 主内容与模板分离后的 TF
- SERP 页面类型和段落级信息比较
- 查询族 impressions、链接和转化质量
常见陷阱:继续增加目标词,制造可读性与 spam 风险。
完成后用本页决策规则复核
- 若观察到:实体在主体完全没有出现
应优先:在符合事实的位置给出实体、定义和上下文。
出现一次不保证满足意图或获得排名。 - 若观察到:高频主要来自导航或页脚
应优先:分离字段并修正统计,再判断内容。
模板可能有导航价值,不应只为降频删除。 - 若观察到:重复不再增加新事实
应优先:停止堆词,补充规格、证据、反例和限制。
不存在适用于所有页面的公开固定饱和点。
自测与误区
先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。
你应该能回答
1. 从第 0 次到第 1 次与第 20 次到第 21 次为何不同?
参考答案:第0到第1次把文档从没有该词变为至少存在,可能改变是否进入词法候选;第20到21次只是在大量存在后的重复,新增信息通常很小。对数与饱和函数编码这种递减,但如果新一次出现在新的关键规格中,内容价值仍可能更高。
为什么:边际变化解释了为何关键词堆叠不应线性获益,同时保留上下文边界。
2. 频次来自主内容还是模板?
参考答案:按 DOM 区域拆分标题、主体、规格、导航、页脚和推荐组件,跨大量页面重复且结构位置一致的命中通常属于模板;还要抽查渲染文本,避免组件重复注入。报告主体 TF、模板 TF 与总 TF。
为什么:同样计数来自不同字段时代表的页面证据不同。
3. 除词频外还缺少哪些查询证据?
参考答案:还缺语料区分度、文档长度、字段、词序、查询其他词、同义实体、索引状态、意图、内容质量、时效、链接和任务结果。TF 只是局部计数,无法单独回答页面是否真正解决查询。
为什么:列出缺失变量能防止把小指标误当完整排名模型。
需要避开的误区
- TF 越高,相关性一定越高
- 存在跨页面通用的最佳关键词密度
- TF 能判断内容是否准确或有帮助
术语与复盘
用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。
- 词频
- 词项在单篇文档中的次数或变换权重。
- 原始 TF
- 直接使用 f(t,d) 的表示。
- 对数 TF
- 用对数压缩高频差异。
- 饱和函数
- 频次增加时逐渐接近上限的变换。
- 边际收益
- 再增加一次带来的分值或信息增量。
- 模板污染
- 跨页重复区域使总词频虚高。
离开本页前记住
- TF 是局部证据,不是页面质量或最终排名。
- 从零到一次通常比高频后的又一次更重要。
- 频次必须与字段、模板和长度一起阅读。
- 高频通用词仍可能没有区分度。
- 写作应从重复转向新增事实和任务帮助。
- 不存在可据此宣称的 Google 关键词密度阈值。
资料与证据
优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。