学习契约与正确模型
先明确为什么学、学完能做什么,以及如何证明自己真的掌握。
AI 平台没有统一 Search Console;工具使用不同 prompt universe、采样频率和权重。没有基线与元数据,dashboard 的一个百分比无法支持优化或 ROI 决策。
- 能设计覆盖 ICP tasks、brand/non-brand、stage 与 locale 的 prompt sampling frame
- 能区分 mention rate、citation rate、share of voice、referral 与 business outcome
- 能报告不确定性、重复性、coverage bias 和工具方法差异
精读 55 分钟 → 引导练习 55 分钟 → 实战任务 130 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。
- 它是什么
- AI visibility measurement 是对一个定义好的 prompt universe 和采样过程进行观测,不是全体真实用户问题的完整 census。
- 为什么重要
- 把 universe、weight、platform、run count 和 scoring 外显,才能比较时间和竞品,也能识别工具指标变化是否来自方法更新。
- 什么时候使用
- 建立 AI Search baseline、GEO 实验、品牌风险监测、竞品研究和季度趋势报告时使用。
- 什么时候不要套用
- 少量 prompt 或一次手工测试不能支持市场份额、真实 reach 或 revenue 结论;不要用模型输出推断个人用户行为。
- 边界与不确定性
- 只测试获批的公开/合成 prompts,不上传客户/员工/机密数据;遵守平台自动化条款,限制响应存储、访问和保留期。
机制精讲
先读完整因果链,再看每个环节留下什么可观察信号。
AI可见性测量首先是分母设计。prompt universe 应来自真实客户问题、站内搜索、销售/支持记录和战略任务,记录来源、意图、locale、漏斗阶段、业务权重与版本;供应商随意生成的一小组提示不能代表市场。最小观察单位应包含prompt×platform/product×model或版本×region/language×account/login state×run×date。只有这些条件被固定和保存,mention rate、citation rate或share of voice才有可比较含义。
指标必须对应清楚结果层:mention只表示文本出现,citation表示具体链接,citation correctness检查链接是否支持主张,referral描述可识别访问,business result才是MQL或收入。生成式输出具有随机性、个性化和产品变化,单次运行不能当真值;不同平台原始比例也不能不加说明地平均。测量系统需要重复运行、全量保存失败结果、方法版本和bridge period,并把趋势措辞限制在样本范围内,不承诺平台引用或商业增量。
prompt registry定义可解释分母
问题来源与权重决定指标代表什么。高频问题、低频高价值采购问题和品牌测试可以共存,但必须分层,不能用未公开采样生成漂亮总分。
重复运行估计波动
同一问题不同运行可能出现不同回答和链接。至少按预定频率重复,并保留零mention、错误和超时,才能区分偶然截图与较稳定模式。
多层指标防止代理替代
mention、citation、支持正确率、流量和业务结果数据源不同。一个品牌可被提及但不链接,也可有链接却不带来访问;任何合成分都应公开权重。
方法版本维持趋势诚实
平台、模型、地区覆盖、prompt集或解析器变化都会造成断点。bridge run可在一段时间同时跑新旧方法,无法桥接时应重建baseline。
关键概念
掌握术语之间的关系,才能迁移到不同网站、行业和工具。
Prompt universe
由 ICP task、topic、stage、brand status、locale 和重要性构成的目标问题集合;工具数据库通常只是代理。
Mention vs citation
Mention 是品牌文字出现;citation 是链接/来源;两者的业务意义和可控因素不同。
Repeatability
同 prompt 多次/多日运行,用 occurrence rate 或分布而非单一结果降低随机性。
Method versioning
保存 prompt、platform/model、location、run rule、normalization、weight 和评分版本,方法变更应断开趋势或重算。
完整示范
跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。
加权prompt集合的双平台基线
以下为教学用合成数据。prompt registry有8个高价值采购问题(每个权重2)和12个探索问题(每个权重1),总权重28;每个问题在平台A和B各运行3次。团队以“至少2/3次出现”定义该prompt的稳定mention或citation。
- 两平台分别报告,不合并原始比例
- 运行固定美国英语、退出登录、桌面与同一周
- 权重在看到结果前由业务owner批准
- 指标描述样本观察,不推断平台算法或保证未来链接
冻结registry与稳定判定
- 输入
- 8个权重2、12个权重1;每项3次。
- 分析
- 加权分母=8×2+12×1=28;稳定出现需至少2次,避免把一次偶然输出直接算作prompt覆盖。原始60次/平台仍完整保存。
- 输出
- method v1含prompt来源、权重、环境与2-of-3规则。
计算平台A加权mention
- 输入
- A在6个高价值、4个探索prompt稳定mention。
- 分析
- 加权分子=6×2+4×1=16;mention rate=16/28≈57.1%。未加权则10/20=50%,两者回答不同业务分布。
- 输出
- A加权mention 57.1%,同时报告未加权50%。
计算citation并分离支持质量
- 输入
- A在3个高价值、2个探索prompt稳定citation;5个链接中4个支持相关主张。
- 分析
- 加权citation=(3×2+2)/28=8/28≈28.6%;citation correctness=4/5=80%,后者分母是人工审查链接,不可与28混用。
- 输出
- A citation 28.6%,已审citation支持正确率80%。
与平台B做同口径分层比较
- 输入
- B在4个高价值、6个探索prompt稳定mention。
- 分析
- B加权mention=(4×2+6)/28=14/28=50%。A高7.1个百分点只描述本周指定样本;平台产品、覆盖和随机性不同,不称为总体领先。
- 输出
- 双平台分别展示,并按高价值/探索拆分误差。
处理方法变更
- 输入
- 下月平台A升级产品界面,prompt集新增5题。
- 分析
- 先用旧20题做两周bridge run,新题单列;检查解析字段和重复运行波动。若断点显著,从method v2重建baseline,不回填伪历史。
- 输出
- 趋势图标注版本边界、重叠样本和不可比说明。
决策规则与证据边界
把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。
- 给定prompt registry、运行协议和编码规则,可复算样本mention/citation与支持正确率。
- 保存的回答、链接、环境和时间可证明特定运行中观察到什么。
- 重复运行和分层加权可使业务样本趋势更稳定,但仍不是全市场测量。
- bridge run可帮助区分方法断点与真实变化。
- 平台生成、选源、个性化和更新的完整机制及概率未公开。
- 观测可见性与真实用户曝光、点击和收入之间的总体关系无法由提示实验单独确定。
引导练习
先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。
教学用合成数据:registry含5个决策prompt权重3、10个发现prompt权重1,总权重25。稳定mention覆盖3个决策和6个发现;稳定citation覆盖2个决策和2个发现。计算加权率,并写平台升级后的可比方案。
给定材料
- prompt registry:来源、意图、locale、权重、版本和owner
- run表:platform/model、region、login、date、mention、citation、URL、人工支持标签和错误
需要提示时再展开
- 加权分子是覆盖prompt的权重和,不是运行次数。
- 升级前后保留同一旧prompt子集进行bridge,新题不要回填旧历史。
完成后核对参考解法
加权分母=5×3+10×1=25。稳定mention分子=3×3+6×1=15,所以加权mention rate=15/25=60%;稳定citation分子=2×3+2×1=8,所以citation rate=8/25=32%。还应分别报告未加权覆盖、逐run波动和citation支持正确率,不能把32%解释为点击率。平台升级时固定旧15题、地区、登录和运行次数,在新旧版本可用期间双跑;比较字段与差异。新增prompt从method v2单列,若无法桥接就标注断点并重建baseline,不把旧趋势回填。所有结论限定在该registry,不能承诺真实用户引用或业务增长。
自评分量规
真实项目实战
把理解变成一个可以检查、复核和复用的工作产物。
建立 90 天 AI visibility baseline
管理层购买了 AI visibility 工具,要求下月把 Share of Voice 提升 30%。
- 从真实 search/sales/support research 构建 80–150 个 prompts,按 task、stage、locale、brand/non-brand 分层。
- 为每个平台设固定运行频率和重复次数,保存时间、模型、地区、响应、citations 与工具版本。
- 定义 mention rate、citation rate、unique cited pages、accuracy、competitor SOV 和 referral/key event 指标。
- 手工复核一部分工具结果,估计 false positive、品牌同名和 URL normalization 问题。
- 先跑 4–6 周基线再定义实验;同时报告 coverage、波动和无法观测的真实用户 prompt。
验收条件
- prompt universe 的来源、覆盖和权重可解释
- 每个指标有公式、分母和业务用途
- 多次运行与方法版本可追溯
- 报告没有把 proxy impressions/SOV 写成真实 reach 或因果 revenue
诊断练习
目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。
工具显示 AI SOV 一周增长 40%,但自建 prompt set、referral 和 brand search 没变化。
竞争假设
- 工具扩大/更换 prompt universe 或模型
- 少量高权重 prompt 改变
- 品牌实体匹配 false positive
- 工具更新/采样噪声而非真实变化
应该检查的证据
- vendor methodology/change log
- 按 prompt/platform 的原始 response diff
- 自建固定 prompt repeated runs
- mention/citation normalization QA 与 referral trend
常见陷阱:把工具 headline metric 直接写入绩效或收入报告。
完成后用本页决策规则复核
- 若观察到:供应商不披露prompt来源、权重或失败结果
应优先:要求registry与raw runs,或仅把分数当探索信号。
披露方法仍不代表样本覆盖全部市场。 - 若观察到:单次运行被当作品牌可见真值
应优先:按固定协议重复运行并报告稳定性与区间。
增加运行次数降低采样噪声但不能消除平台变化。 - 若观察到:mention、citation和业务结果合成一分
应优先:拆回原始计数、分母、支持正确率、流量和转化。
管理层总览可用合成分,但权重和组成必须可见。 - 若观察到:模型、产品或方法更新时指标跳变
应优先:执行bridge、标注版本并必要时新建baseline。
无法访问旧版本时应诚实保留不可比区间。
自测与误区
先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。
你应该能回答
1. 分母中的 prompts 从哪里来、如何加权?
参考答案:prompt来自真实站内搜索、销售/支持问题、客户研究和战略任务,去重后按意图、漏斗、locale与价值分层;权重由业务owner在看结果前批准。registry保留来源、原文、版本、加入/退休理由,不能让供应商临时换题改善分数。
为什么:分母决定指标代表的市场,透明来源和事前权重能降低选择偏差。
2. 平台/模型/地区/登录状态和运行次数是什么?
参考答案:每条run记录平台及具体产品、可见模型/版本、国家、语言、设备、登录/订阅状态、新会话、日期时间和运行序号;同一prompt按预定次数重复并保存超时与未出现。无法控制的变量也要显式标未知。
为什么:生成输出与产品可用性受环境影响,缺少运行契约就无法解释变化。
3. 指标衡量 mention、citation、traffic 还是 business result?
参考答案:先明确字段:mention是文本出现,citation是品牌URL链接,citation correctness是链接支持主张,traffic是可识别到站,business result是MQL/收入。每层使用自身原始分母和数据源,任何总分都公开权重,不能用上游代理替代下游价值。
为什么:同名“visibility”容易混合完全不同结果,拆层能防止过度宣称。
4. 方法或模型变化时如何保持趋势可比?
参考答案:维护method_version和变更日志;平台/模型、prompt、权重、解析器或运行条件变化时,用共同旧prompt做bridge并并列新旧方法。若无法桥接或结构变化太大,明确趋势断点、建立新baseline,旧数据不伪回算。
为什么:方法变化会制造看似增长或下降的测量假象,版本与重叠样本保护趋势诚实。
需要避开的误区
- AI Share of Voice 是标准化、跨工具可直接比较的市场份额。
- 每个 AI mention 都代表一个真实用户看到了品牌。
- 一次 prompt 的首个引用位置就是稳定排名。
术语与复盘
用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。
- Prompt universe
- 测量希望代表的完整问题任务范围。
- Prompt registry
- 带来源、权重、locale、版本和owner的受控问题清单。
- Mention rate
- 按声明分母计算品牌或实体文本出现的比例。
- Citation rate
- 按声明分母计算品牌URL作为来源链接出现的比例。
- Citation correctness
- 被审查引用中真正支持相应主张的比例或等级。
- Method version
- 共同定义prompt、环境、运行和编码规则的一次测量配置。
- Trend break
- 因平台或方法变化导致前后指标不可直接比较的断点。
离开本页前记住
- AI可见性从透明prompt分母开始。
- 观察单位必须包含平台、环境、运行和时间。
- 重复运行并保存失败结果,避免单次截图偏差。
- mention、citation、支持、流量和业务结果分别报告。
- 平台或方法变化通过bridge或新baseline处理。
- 样本指标不能承诺真实用户曝光、引用、点击或收入。
资料与证据
优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。