学习契约与正确模型
先明确为什么学、学完能做什么,以及如何证明自己真的掌握。
SEO 总量常由几个结构完全不同的群体叠加而成。整体 CTR 或 conversion rate 上升,可能只是高转化群体占比变大,并非任何页面真的改善。
- 能为问题预先选择互斥、可解释、可复跑的核心 segments
- 能同时报告分子、分母、绝对量、比例和样本量
- 能识别聚合反转、选择偏差和多重比较风险
精读 34 分钟 → 引导练习 30 分钟 → 实战任务 76 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。
- 它是什么
- Segmentation 是按因果上可能不同的群体拆解指标;cohort 固定进入条件和时间;aggregation 决定不同群体如何合并。
- 为什么重要
- 分群不是为了找到最好看的数字,而是缩小机制范围,让后续证据能证伪具体假设。
- 什么时候使用
- 任何异常诊断、页面类型评估、市场比较、实验分析或 funnel 分析前使用。
- 什么时候不要套用
- 样本很小时不要无限细分;看到结果后反复改 segment 直到显著,也不能作为确认性结论。
- 边界与不确定性
- 使用业务允许的聚合属性,避免建立可重识别的小群体;敏感地区或客户数据应设最小样本阈值。
机制精讲
先读完整因果链,再看每个环节留下什么可观察信号。
分群的目的不是找一个更好看的数字,而是把可能由不同机制驱动的观察单位分开。SEO 常见分组包括品牌与非品牌、页面类型、意图、市场、设备、位置带、新旧内容和漏斗阶段。核心分组应在看结果前定义,尽量互斥且覆盖全体,并保留 Other 与 Unknown。每个比率必须同时呈现分子、分母、绝对量和样本量,否则 50% 增长可能只是从两次事件变成三次。
聚合指标会同时受到群体内表现和群体占比变化影响。即使每个页面类型的转化率都下降,只要高转化页面的流量占比大幅增加,整体转化率仍可能上升,这就是组合效应可能造成的辛普森反转。分析应先重算群体内指标,再分解 mix shift;低量切片用更长窗口或区间表达。事后反复切片、多重比较和可重识别小群体都构成边界,发现性结果必须在新窗口复核。
分组规则连接业务机制
页面类型可能对应不同用户任务,设备可能对应不同 SERP 与交互摩擦;只有机制合理且规则稳定的分组才便于行动。
加权组合改变总体比率
总体率等于各群体率按各自分母占比加权。群体占比变化可让总体方向与每个群体方向相反。
小样本放大随机波动
细分越多,每格样本越少;几个事件就可能产生巨幅百分比,且多重查看会提高偶然“异常”的机会。
Unknown 是质量信号
无法分类的数据若被删除,会改变分母并隐藏规则漂移;Unknown 突增也可能解释报表变化。
关键概念
掌握术语之间的关系,才能迁移到不同网站、行业和工具。
互斥与穷尽
核心分组尽量每行只属于一组且覆盖全部数据;Unknown 必须保留,不能静默删除。
组合效应
总指标变化可能来自各 segment 占比变化,而非 segment 内表现改变。
预注册切片
在分析前写下首要分群、比较方向与停止规则,减少事后解释。
最小样本
低量群体报告区间或合并周期,不用两三个事件计算精确百分比。
完整示范
跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。
整体转化率上升却没有任何群体改善
教学用合成数据:某 SaaS 比较两个完整月份。前期产品页 2,000 个会话、120 次成功提交,博客 8,000 个会话、80 次;后期产品页 4,000 个会话、220 次,博客 2,000 个会话、16 次。
- 成功提交定义与标签版本未变,分母均为可归因落地会话
- page_type 规则在两个周期相同且 Unknown 单独呈现
- 样例只用于演示组合效应,不从相关数据推断页面改动因果
重算总体指标
- 输入
- 前期 200/10,000=2.0%,后期 236/6,000=3.93%。
- 分析
- 整体率几乎翻倍,但总会话下降且提交仅增加 36;总体百分比不能说明页面体验改善。
- 输出
- 保留总会话、总提交和总体率三项,避免只报相对增长。
计算群体内变化
- 输入
- 产品页从 6.0% 降至 5.5%,博客从 1.0% 降至 0.8%。
- 分析
- 两个群体内部都变差,排除“所有页面转化改善”的说法。
- 输出
- 按 page_type 展示分子、分母、率和差值。
识别 mix shift
- 输入
- 高转化产品页会话占比由 20% 升至 66.7%。
- 分析
- 流量结构向高转化群体移动,足以让总体率上升;这与群体内性能是两个不同现象。
- 输出
- 用前期固定权重得到后期标准化率 1.74%,显示同结构下实际下降。
形成下一轮假设
- 输入
- 非品牌博客曝光下降,品牌产品查询稳定;同期导航改版。
- 分析
- 可以分别调查博客需求/可见性和产品页摩擦,不能把导航改版当成已证实原因。
- 输出
- 建立两个 cohort 的独立诊断,并在新窗口复核预设切片。
决策规则与证据边界
把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。
- 总体比率可精确分解为群体比率与分母权重,辛普森反转是数学上可验证的。
- 互斥规则、原始计数与 Unknown 可以通过分类测试和 reconciliation 审计。
- 某切片贡献多数绝对变化,可优先调查该范围,但“贡献”不是造成变化的行为原因。
- 固定权重后率下降支持群体内表现变差,仍可能受群体内部未观察组合影响。
- 观察数据无法自动说明分群变量是原因、代理变量还是共同结果。
- 极小群体的真实率和长期稳定性在有限样本下不可精确知道。
引导练习
先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。
教学用合成数据:桌面前期 8,000 曝光、480 点击,后期 3,000 曝光、165 点击;移动前期 2,000 曝光、60 点击,后期 7,000 曝光、175 点击。请解释总体 CTR,并给出是否应宣布标题优化成功。
给定材料
- period×device 的 clicks、impressions 与标题版本表
- 同市场 SERP 抽样及品牌/非品牌、position band 分类规则
需要提示时再展开
- 先分别算桌面和移动 CTR,再算总体 CTR;不要平均两个设备的百分比。
- 标题版本只是时间线上一个事件,还需位置、查询与未改页面对照。
完成后核对参考解法
前期桌面 CTR 为 6.0%,移动为 3.0%,总体为 540/10,000=5.4%;后期桌面为 5.5%,移动为 2.5%,总体为 340/10,000=3.4%。两个设备群体内都下降,同时低 CTR 的移动曝光占比从 20% 升至 70%,因此总体下降既有群体内变化也有 mix shift。不能宣布标题优化成功;相反,现有数据只确认点击效率下降。下一步应在预先定义的品牌、位置带和页面类型内比较改版与未改版页面,抽查同设备 SERP 元素,并保留点击和曝光绝对量。若某细格样本太小应合并窗口,标题影响只能作为待验证假设,不能由发布前后相关性推为因果。
自评分量规
真实项目实战
把理解变成一个可以检查、复核和复用的工作产物。
解释“CTR 上升但点击下降”
月报显示整体 CTR 改善,团队想把它归功于标题改写,但总点击反而下降。
- 固定同星期结构的比较窗口,并保留 clicks、impressions、CTR 三项。
- 按品牌/非品牌、page type、device、country 和 position band 预设切片。
- 分别计算群体内 CTR 变化与群体曝光占比变化。
- 定位对总点击变化贡献最大的 3 个 segment,并查看相应 query/page 明细。
- 为内容改写、需求变化、排名变化和 SERP 变化分别列下一步证据。
验收条件
- 每个比例同时提供分子、分母和样本量
- Unknown/Other 未被隐藏
- 结论区分群体占比变化与群体内改善
- 未对低量分群给出虚假精确结论
诊断练习
目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。
移动端和桌面端 CTR 都下降,但整体 CTR 却上升。
竞争假设
- 高 CTR 设备的曝光占比上升导致辛普森反转
- 设备分类或筛选口径发生变化
- 不同 position band 的组合改变
应该检查的证据
- 按设备计算曝光权重
- 复核 period 内各设备的 clicks/impressions
- 再按 position band 与品牌词分层
- 检查数据源和筛选器变更记录
常见陷阱:只看整体加权平均并宣布页面 snippet 已经改善。
完成后用本页决策规则复核
- 若观察到:总体率与所有主要群体内率方向相反
应优先:计算群体权重与固定权重标准化率,复核 Unknown。
标准化选择哪个基期会影响数值,应同时展示原始结果。 - 若观察到:切片只有个位数事件却增长数百个百分点
应优先:报告计数与区间,合并时间或相关群体,并标为探索性。
低量但高风险问题仍可行动,依据应是风险控制而非显著增长。 - 若观察到:分析后不断增加维度直到找到异常
应优先:区分预设和探索切片,在独立时期或样本中复核。
复核失败不代表最初数据造假,只说明证据不足以确认稳定模式。 - 若观察到:Unknown 占比跨期显著变化
应优先:先修复/版本化规则并做 reconciliation,再解释业务变化。
不能为了覆盖率把不确定行强塞进最相近类别。
自测与误区
先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。
你应该能回答
1. 这个分组对应可能不同的机制吗?
参考答案:应能说明为什么该组可能由不同机制驱动,例如设备改变 SERP 与交互,page type 对应不同任务,品牌词反映不同需求。仅按颜色、任意字长等方便字段切分而没有机制,就不应成为核心分组。
为什么:机制合理的分组才能把观察转成下一步检查;任意切片更容易产生偶然差异和无法行动的故事。
2. 分组规则在两个周期完全一致吗?
参考答案:必须冻结规则版本,并检查 URL 结构、locale、品牌词词典和 Unknown 是否跨期变化。若分类逻辑更新,应对两个周期用同一版本重算,或明确把规则变化当作序列断点,不能直接拼接。
为什么:分组口径改变会移动行与分母,即使底层行为不变也会制造增长或下降。
3. 总量变化有多少来自 mix shift?
参考答案:计算每组分母占比的变化,并比较原始总体率与固定基期权重的标准化率;还可把总量差拆成群体内率变化和权重变化。报告绝对贡献时注明这只是算术分解,不是因果份额。
为什么:总体指标同时由组内表现与组合构成,只有分别计算才能识别辛普森反转并避免错误归功。
4. 样本与隐私阈值是否允许继续细分?
参考答案:若事件极少、区间过宽或切片可能识别客户,就应停止细分,改用更长时间、合并相近群体或只给定性描述。敏感属性应遵守最小样本与访问规则,Unknown 也不能为了美观被删除。
为什么:继续细分会同时降低统计稳定性并提高隐私风险,产生看似精确却不可复核的结论。
需要避开的误区
- 切得越细越接近真相。
- 比例上升就代表绝对业务价值上升。
- 探索中发现的任意 segment 都可当成确定因果。
术语与复盘
用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。
- Segment
- 按预先定义规则划分、可能受不同机制影响的一组观察单位。
- Cohort
- 以共同进入条件和时间固定的一组对象,适合追踪后续状态。
- Mix shift
- 各群体在总体分母中的权重发生变化。
- 辛普森悖论
- 聚合趋势与各主要分组趋势方向相反的现象。
- 标准化率
- 使用固定群体权重重算的比率,用来隔离组合变化。
- 多重比较
- 同时检查大量切片时偶然发现极端结果的概率上升。
离开本页前记住
- 分群必须对应可能不同的机制。
- 每个比例都带分子、分母、绝对量和样本量。
- 总体变化要拆成群体内变化与 mix shift。
- 规则跨期冻结,Unknown 必须可见。
- 事后切片是探索证据,需要独立窗口复核。
- 小样本和敏感群体都有停止细分的边界。
资料与证据
优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。