KNOWLEDGE / 03LAYER 4下一阶段

AI 可见性测量与实验基线

AI Visibility Measurement and Experimental Baselines

用固定且版本化的 prompt set 测量 mention、citation、cited URL、position/context、sentiment/accuracy proxy 与 referral/conversion,并记录平台、模型、地区、日期和重复次数。所有 share of voice 都是方法依赖的估计。

先修知识AI Overviews、AI Mode 与搜索体验变化GEO、可引用性与内容证据设计SEO 实验与变更日志
解锁能力Query Fan-out、检索增强生成与来源链SEO 自动化:候选选择、验证与失败安全AI 治理、数据隐私与生产发布边界
默认基础无需额外背景
本页目录 · 11 个学习环节
01

学习契约与正确模型

先明确为什么学、学完能做什么,以及如何证明自己真的掌握。

为什么现在要学

AI 平台没有统一 Search Console;工具使用不同 prompt universe、采样频率和权重。没有基线与元数据,dashboard 的一个百分比无法支持优化或 ROI 决策。

完成本页后,你应能
  • 能设计覆盖 ICP tasks、brand/non-brand、stage 与 locale 的 prompt sampling frame
  • 能区分 mention rate、citation rate、share of voice、referral 与 business outcome
  • 能报告不确定性、重复性、coverage bias 和工具方法差异
建议节奏

精读 55 分钟 → 引导练习 55 分钟 → 实战任务 130 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。

它是什么
AI visibility measurement 是对一个定义好的 prompt universe 和采样过程进行观测,不是全体真实用户问题的完整 census。
为什么重要
把 universe、weight、platform、run count 和 scoring 外显,才能比较时间和竞品,也能识别工具指标变化是否来自方法更新。
什么时候使用
建立 AI Search baseline、GEO 实验、品牌风险监测、竞品研究和季度趋势报告时使用。
什么时候不要套用
少量 prompt 或一次手工测试不能支持市场份额、真实 reach 或 revenue 结论;不要用模型输出推断个人用户行为。
边界与不确定性
只测试获批的公开/合成 prompts,不上传客户/员工/机密数据;遵守平台自动化条款,限制响应存储、访问和保留期。
02

机制精讲

先读完整因果链,再看每个环节留下什么可观察信号。

AI可见性测量首先是分母设计。prompt universe 应来自真实客户问题、站内搜索、销售/支持记录和战略任务,记录来源、意图、locale、漏斗阶段、业务权重与版本;供应商随意生成的一小组提示不能代表市场。最小观察单位应包含prompt×platform/product×model或版本×region/language×account/login state×run×date。只有这些条件被固定和保存,mention rate、citation rate或share of voice才有可比较含义。

指标必须对应清楚结果层:mention只表示文本出现,citation表示具体链接,citation correctness检查链接是否支持主张,referral描述可识别访问,business result才是MQL或收入。生成式输出具有随机性、个性化和产品变化,单次运行不能当真值;不同平台原始比例也不能不加说明地平均。测量系统需要重复运行、全量保存失败结果、方法版本和bridge period,并把趋势措辞限制在样本范围内,不承诺平台引用或商业增量。

01

prompt registry定义可解释分母

问题来源与权重决定指标代表什么。高频问题、低频高价值采购问题和品牌测试可以共存,但必须分层,不能用未公开采样生成漂亮总分。

观察什么保存prompt_id、原文、来源、意图、权重、locale、有效期、敏感标记和owner。
02

重复运行估计波动

同一问题不同运行可能出现不同回答和链接。至少按预定频率重复,并保留零mention、错误和超时,才能区分偶然截图与较稳定模式。

观察什么按prompt计算出现频率、运行间一致性和置信范围,记录新会话、温度不可控等限制。
03

多层指标防止代理替代

mention、citation、支持正确率、流量和业务结果数据源不同。一个品牌可被提及但不链接,也可有链接却不带来访问;任何合成分都应公开权重。

观察什么保留逐层原始计数和分母,禁止只展示供应商归一化指数。
04

方法版本维持趋势诚实

平台、模型、地区覆盖、prompt集或解析器变化都会造成断点。bridge run可在一段时间同时跑新旧方法,无法桥接时应重建baseline。

观察什么维护method_version、变更原因、双跑差异、不可比区间和回算规则。
03

关键概念

掌握术语之间的关系,才能迁移到不同网站、行业和工具。

01

Prompt universe

由 ICP task、topic、stage、brand status、locale 和重要性构成的目标问题集合;工具数据库通常只是代理。

02

Mention vs citation

Mention 是品牌文字出现;citation 是链接/来源;两者的业务意义和可控因素不同。

03

Repeatability

同 prompt 多次/多日运行,用 occurrence rate 或分布而非单一结果降低随机性。

04

Method versioning

保存 prompt、platform/model、location、run rule、normalization、weight 和评分版本,方法变更应断开趋势或重算。

04

完整示范

跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。

WORKED EXAMPLE

加权prompt集合的双平台基线

以下为教学用合成数据。prompt registry有8个高价值采购问题(每个权重2)和12个探索问题(每个权重1),总权重28;每个问题在平台A和B各运行3次。团队以“至少2/3次出现”定义该prompt的稳定mention或citation。

前提与样例口径
  • 两平台分别报告,不合并原始比例
  • 运行固定美国英语、退出登录、桌面与同一周
  • 权重在看到结果前由业务owner批准
  • 指标描述样本观察,不推断平台算法或保证未来链接
  1. 冻结registry与稳定判定

    输入
    8个权重2、12个权重1;每项3次。
    分析
    加权分母=8×2+12×1=28;稳定出现需至少2次,避免把一次偶然输出直接算作prompt覆盖。原始60次/平台仍完整保存。
    输出
    method v1含prompt来源、权重、环境与2-of-3规则。
  2. 计算平台A加权mention

    输入
    A在6个高价值、4个探索prompt稳定mention。
    分析
    加权分子=6×2+4×1=16;mention rate=16/28≈57.1%。未加权则10/20=50%,两者回答不同业务分布。
    输出
    A加权mention 57.1%,同时报告未加权50%。
  3. 计算citation并分离支持质量

    输入
    A在3个高价值、2个探索prompt稳定citation;5个链接中4个支持相关主张。
    分析
    加权citation=(3×2+2)/28=8/28≈28.6%;citation correctness=4/5=80%,后者分母是人工审查链接,不可与28混用。
    输出
    A citation 28.6%,已审citation支持正确率80%。
  4. 与平台B做同口径分层比较

    输入
    B在4个高价值、6个探索prompt稳定mention。
    分析
    B加权mention=(4×2+6)/28=14/28=50%。A高7.1个百分点只描述本周指定样本;平台产品、覆盖和随机性不同,不称为总体领先。
    输出
    双平台分别展示,并按高价值/探索拆分误差。
  5. 处理方法变更

    输入
    下月平台A升级产品界面,prompt集新增5题。
    分析
    先用旧20题做两周bridge run,新题单列;检查解析字段和重复运行波动。若断点显著,从method v2重建baseline,不回填伪历史。
    输出
    趋势图标注版本边界、重叠样本和不可比说明。

结论:平台A的加权mention为57.1%、citation为28.6%,但支持正确率另为80%;三个数字使用不同分母且不可互换。平台B的50%只适合同协议比较。透明registry、重复规则和版本断点比一个“AI visibility score”更可审计。

迁移到真实项目:真实项目可按市场或购买阶段调整权重,但需事前审批并保留未加权结果。对于登录个性化或无法固定模型的产品,把状态写成限制并增加重复;连接流量和CRM时继续保留独立口径,不把观测答案直接归因到收入。

05

决策规则与证据边界

把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。

信号解释行动限制
供应商不披露prompt来源、权重或失败结果分母不可审计,趋势可能受选择偏差驱动。要求registry与raw runs,或仅把分数当探索信号。披露方法仍不代表样本覆盖全部市场。
单次运行被当作品牌可见真值随机与个性化波动未测量。按固定协议重复运行并报告稳定性与区间。增加运行次数降低采样噪声但不能消除平台变化。
mention、citation和业务结果合成一分不同层级与数据质量被隐藏。拆回原始计数、分母、支持正确率、流量和转化。管理层总览可用合成分,但权重和组成必须可见。
模型、产品或方法更新时指标跳变可能是测量断点而非品牌变化。执行bridge、标注版本并必要时新建baseline。无法访问旧版本时应诚实保留不可比区间。
可确认
  • 给定prompt registry、运行协议和编码规则,可复算样本mention/citation与支持正确率。
  • 保存的回答、链接、环境和时间可证明特定运行中观察到什么。
工作推断
  • 重复运行和分层加权可使业务样本趋势更稳定,但仍不是全市场测量。
  • bridge run可帮助区分方法断点与真实变化。
不要声称已知
  • 平台生成、选源、个性化和更新的完整机制及概率未公开。
  • 观测可见性与真实用户曝光、点击和收入之间的总体关系无法由提示实验单独确定。
06

引导练习

先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。

YOUR TURN

教学用合成数据:registry含5个决策prompt权重3、10个发现prompt权重1,总权重25。稳定mention覆盖3个决策和6个发现;稳定citation覆盖2个决策和2个发现。计算加权率,并写平台升级后的可比方案。

给定材料

  • prompt registry:来源、意图、locale、权重、版本和owner
  • run表:platform/model、region、login、date、mention、citation、URL、人工支持标签和错误
需要提示时再展开
  1. 加权分子是覆盖prompt的权重和,不是运行次数。
  2. 升级前后保留同一旧prompt子集进行bridge,新题不要回填旧历史。
完成后核对参考解法

加权分母=5×3+10×1=25。稳定mention分子=3×3+6×1=15,所以加权mention rate=15/25=60%;稳定citation分子=2×3+2×1=8,所以citation rate=8/25=32%。还应分别报告未加权覆盖、逐run波动和citation支持正确率,不能把32%解释为点击率。平台升级时固定旧15题、地区、登录和运行次数,在新旧版本可用期间双跑;比较字段与差异。新增prompt从method v2单列,若无法桥接就标注断点并重建baseline,不把旧趋势回填。所有结论限定在该registry,不能承诺真实用户引用或业务增长。

自评分量规

0 级用错误分母或把citation当点击。
1 级算出覆盖数量但忽略权重和方法版本。
2 级正确得到60%与32%,并区分指标。
3 级加入重复运行、支持正确率、bridge和断点说明。
4 级进一步保留raw runs、未加权切片、owner与业务归因边界。
07

真实项目实战

把理解变成一个可以检查、复核和复用的工作产物。

FIELD LAB

建立 90 天 AI visibility baseline

管理层购买了 AI visibility 工具,要求下月把 Share of Voice 提升 30%。

  1. 从真实 search/sales/support research 构建 80–150 个 prompts,按 task、stage、locale、brand/non-brand 分层。
  2. 为每个平台设固定运行频率和重复次数,保存时间、模型、地区、响应、citations 与工具版本。
  3. 定义 mention rate、citation rate、unique cited pages、accuracy、competitor SOV 和 referral/key event 指标。
  4. 手工复核一部分工具结果,估计 false positive、品牌同名和 URL normalization 问题。
  5. 先跑 4–6 周基线再定义实验;同时报告 coverage、波动和无法观测的真实用户 prompt。
需要交付prompt registry、measurement protocol、baseline dashboard、QA sample 和 limitation statement。

验收条件

  • prompt universe 的来源、覆盖和权重可解释
  • 每个指标有公式、分母和业务用途
  • 多次运行与方法版本可追溯
  • 报告没有把 proxy impressions/SOV 写成真实 reach 或因果 revenue
08

诊断练习

目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。

SCENARIO

工具显示 AI SOV 一周增长 40%,但自建 prompt set、referral 和 brand search 没变化。

竞争假设

  1. 工具扩大/更换 prompt universe 或模型
  2. 少量高权重 prompt 改变
  3. 品牌实体匹配 false positive
  4. 工具更新/采样噪声而非真实变化

应该检查的证据

  1. vendor methodology/change log
  2. 按 prompt/platform 的原始 response diff
  3. 自建固定 prompt repeated runs
  4. mention/citation normalization QA 与 referral trend

常见陷阱:把工具 headline metric 直接写入绩效或收入报告。

完成后用本页决策规则复核
  1. 若观察到:供应商不披露prompt来源、权重或失败结果
    应优先:要求registry与raw runs,或仅把分数当探索信号。
    披露方法仍不代表样本覆盖全部市场。
  2. 若观察到:单次运行被当作品牌可见真值
    应优先:按固定协议重复运行并报告稳定性与区间。
    增加运行次数降低采样噪声但不能消除平台变化。
  3. 若观察到:mention、citation和业务结果合成一分
    应优先:拆回原始计数、分母、支持正确率、流量和转化。
    管理层总览可用合成分,但权重和组成必须可见。
  4. 若观察到:模型、产品或方法更新时指标跳变
    应优先:执行bridge、标注版本并必要时新建baseline。
    无法访问旧版本时应诚实保留不可比区间。
09

自测与误区

先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。

你应该能回答

1. 分母中的 prompts 从哪里来、如何加权?

参考答案:prompt来自真实站内搜索、销售/支持问题、客户研究和战略任务,去重后按意图、漏斗、locale与价值分层;权重由业务owner在看结果前批准。registry保留来源、原文、版本、加入/退休理由,不能让供应商临时换题改善分数。

为什么:分母决定指标代表的市场,透明来源和事前权重能降低选择偏差。

2. 平台/模型/地区/登录状态和运行次数是什么?

参考答案:每条run记录平台及具体产品、可见模型/版本、国家、语言、设备、登录/订阅状态、新会话、日期时间和运行序号;同一prompt按预定次数重复并保存超时与未出现。无法控制的变量也要显式标未知。

为什么:生成输出与产品可用性受环境影响,缺少运行契约就无法解释变化。

3. 指标衡量 mention、citation、traffic 还是 business result?

参考答案:先明确字段:mention是文本出现,citation是品牌URL链接,citation correctness是链接支持主张,traffic是可识别到站,business result是MQL/收入。每层使用自身原始分母和数据源,任何总分都公开权重,不能用上游代理替代下游价值。

为什么:同名“visibility”容易混合完全不同结果,拆层能防止过度宣称。

4. 方法或模型变化时如何保持趋势可比?

参考答案:维护method_version和变更日志;平台/模型、prompt、权重、解析器或运行条件变化时,用共同旧prompt做bridge并并列新旧方法。若无法桥接或结构变化太大,明确趋势断点、建立新baseline,旧数据不伪回算。

为什么:方法变化会制造看似增长或下降的测量假象,版本与重叠样本保护趋势诚实。

需要避开的误区

  • AI Share of Voice 是标准化、跨工具可直接比较的市场份额。
  • 每个 AI mention 都代表一个真实用户看到了品牌。
  • 一次 prompt 的首个引用位置就是稳定排名。
10

术语与复盘

用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。

Prompt universe
测量希望代表的完整问题任务范围。
Prompt registry
带来源、权重、locale、版本和owner的受控问题清单。
Mention rate
按声明分母计算品牌或实体文本出现的比例。
Citation rate
按声明分母计算品牌URL作为来源链接出现的比例。
Citation correctness
被审查引用中真正支持相应主张的比例或等级。
Method version
共同定义prompt、环境、运行和编码规则的一次测量配置。
Trend break
因平台或方法变化导致前后指标不可直接比较的断点。

离开本页前记住

  1. AI可见性从透明prompt分母开始。
  2. 观察单位必须包含平台、环境、运行和时间。
  3. 重复运行并保存失败结果,避免单次截图偏差。
  4. mention、citation、支持、流量和业务结果分别报告。
  5. 平台或方法变化通过bridge或新baseline处理。
  6. 样本指标不能承诺真实用户曝光、引用、点击或收入。
11

资料与证据

优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。