学习契约与正确模型
先明确为什么学、学完能做什么,以及如何证明自己真的掌握。
AI 可在内容、代码、标签、redirect 和客户数据上放大错误。事实幻觉、提示注入、版权/隐私、品牌与批量发布风险,不能靠“人工会看一眼”模糊处理。
- 能按数据敏感度、输出影响面、可逆性和自主程度分级用例
- 能建立 model/prompt/data/output registry 与明确 RACI
- 能为 AI 内容或代码设计 eval、approval、canary、monitor、rollback 与 incident runbook
精读 60 分钟 → 引导练习 60 分钟 → 实战任务 140 分钟。实战时间单列,不再把浏览页面和项目操作混成一个数字。
- 它是什么
- AI governance 是贯穿 Govern/Map/Measure/Manage 的控制系统;release safety 把风险控制落到每次输入、生成、审阅和生产变更。
- 为什么重要
- 概率输出和快速规模化意味着传统抽查不足,需要与影响面成比例的自动/人工评估、权限和证据记录。
- 什么时候使用
- 任何 LLM 处理组织数据、生成可公开内容、创建技术建议、调用 API 或接近生产写权限前使用。
- 什么时候不要套用
- 不要把低风险头脑风暴流程套成沉重审批,但也不能因“只是草稿”而上传受限数据或跳过最终 owner。
- 边界与不确定性
- 默认禁止未授权 PII/机密/凭证进入外部模型;模型不得自行发布、删除、redirect、noindex、改 canonical/robots 或分析标签。高风险动作需两人批准、最小权限、canary、备份与 kill switch。
机制精讲
先读完整因果链,再看每个环节留下什么可观察信号。
AI治理把每个用例按输入敏感度、输出影响面、自主程度与可逆性分级,并据此配置权限、评估、审批与发布方式。公开资料摘要与客户PII处理不是同一风险;生成一页草稿与自动改5,000页canonical也不是同一控制。治理目标不是让所有实验变慢,而是让低风险探索有轻量边界,让高风险内容、代码、API调用和生产写入必须有具名责任人、最小权限、证据记录与可停止路径。
有效human-in-the-loop不是“有人点approve”,而是reviewer理解领域和影响、看得到source与diff、有明确checklist、足够时间和拒绝权。系统还需登记model/vendor/version、prompt/template、输入数据、参数、输出、reviewer、决定和发布版本;正常gold cases之外加入事实、品牌、locale、权限、prompt injection与危险技术建议等对抗测试。任何模型、prompt、data或解析器变更都视为新发布候选,按影响重跑eval,并通过canary、guardrail、kill switch、rollback和incident runbook控制规模。
风险分级决定控制强度
可用sensitivity×impact×autonomy×reversibility评估。受限数据、批量公开输出、生产写权限和难回滚组合应进入最高层;低风险公开草稿可用较轻审阅。
Lineage与RACI建立问责
模型输出必须能追溯到数据、prompt、版本和审阅决定;事实、品牌、数据合规和生产结果可由不同角色accountable,但不能无人负责。
Eval覆盖正常与对抗失败
流畅度不足以验收。测试集按用例检查事实支持、品牌、格式、locale、重复、HTML/代码、安全拒答、prompt injection和危险建议,并设严重错误零容忍项。
分批发布限制爆炸半径
read→assist→draft→approved write逐级提高自治;高风险写入先canary,实时监控错误和业务护栏,阈值触发自动停止。回滚需使用已保存旧版本而非依赖模型重生成。
关键概念
掌握术语之间的关系,才能迁移到不同网站、行业和工具。
Use-case risk tier
按数据 sensitivity × output impact × autonomy × reversibility 分类:公开研究摘要低于客户数据处理或生产写入。
Lineage registry
记录模型/供应商/版本、prompt/template、数据来源、参数、生成时间、reviewer、决策和发布版本。
Evaluation suite
gold cases + adversarial cases,评估事实、引用、品牌、policy、locale、格式、SEO 和 refusal,而非只看流畅度。
Human accountability
Human-in-the-loop 只有在 reviewer 有权限、能力、时间、清晰 checklist 和拒绝权时才是有效控制。
完整示范
跟随一次“输入 → 分析 → 中间产物 → 结论”,看见专家是怎样做判断的。
五千页AI内容更新的安全降级与canary
以下为教学用合成数据。团队计划让模型读取GSC机会、自动重写5,000个产品页标题与正文并直接发布。输入含查询和内部产品字段,错误可能制造虚假性能主张、重复内容或大范围索引变化。
- 客户级查询和未发布产品字段被分类为受限,不得进入未批准外部模型
- 旧页面版本、模板和deployment可以恢复
- 上线成功标准同时包含事实、品牌、技术和业务护栏
- AI输出不获得排名、引用或业务结果保证
评估风险与最坏影响
- 输入
- 受限输入、5,000个公开页、自动write、批量可回滚但恢复需数小时。
- 分析
- 敏感度高、影响面大、自主高、恢复非即时,判为高风险;直接全量写入不可接受。先删除非必要敏感字段并限制服务账号。
- 输出
- 风险记录、数据流、禁止字段、最小权限和accountable owners。
降级自治并登记lineage
- 输入
- 原方案从分析直达发布。
- 分析
- 改为read-only机会分析→draft→领域/品牌/SEO审批→受控deployment;每个草稿保存source、model、prompt、diff和reviewer,模型没有生产凭证。
- 输出
- 审批队列与不可绕过的两人高风险批准。
构建版本化eval
- 输入
- 120个代表gold cases与30个对抗case。
- 分析
- 测试事实支持、禁用主张、品牌、locale、HTML、重复与prompt injection;严重事实错误、越权数据和危险技术指令阈值为零。当前模型出现6个事实错误和2个注入失败,禁止发布。
- 输出
- 修复prompt/数据后重跑完整suite,不只重测失败8例。
执行小范围canary
- 输入
- eval通过后选择50页,占总量1%,含高低流量与多个模板。
- 分析
- 保存旧版本和实验assignment;人工复核全部50页,监控渲染、canonical、抓取、投诉、转化与质量抽样,未到观察窗不扩大。
- 输出
- canary批准记录、guardrail dashboard与一键回滚清单。
按阈值停止并处理事故
- 输入
- 发布后5页出现错误产品兼容性主张,严重错误率10%。
- 分析
- 超过零容忍阈值,kill switch停止队列并恢复50页旧版本;冻结run artifacts、通知产品/法务、分析根因并把5例加入回归集。
- 输出
- incident编号、恢复验证、影响通知与重新批准前置条件。
决策规则与证据边界
把“看到什么、意味着什么、下一步做什么”连起来,同时区分公开事实、实践推断和未知项。
- 输入数据流、权限、模型/prompt版本、eval结果、diff、审批和deployment可直接记录。
- NIST AI RMF、OWASP等公开框架提供风险治理与典型威胁的通用参考。
- 与风险成比例的eval、人审和canary可降低错误扩散概率,但不能消除所有风险。
- 完整lineage与回滚演练通常能缩短调查和恢复时间。
- 模型在未覆盖输入、未来版本或供应商变化下的全部失败模式不可预知。
- 通过离线eval不能保证生产内容获得排名、引用、正确性或无事故。
引导练习
先独立完成,再按提示修正,最后展开参考解法并用 0–4 级量规评分。
教学用合成数据:AI根据crawl与GSC自动开技术票,建议把20万个参数URL加入robots.txt;它可直接合并配置,输入含内部路径和客户查询。请做风险分级、审批、eval、canary与停止方案。
给定材料
- 影响inventory:URL模板、当前抓取/索引/流量、robots/canonical/noindex行为和回滚时间
- 治理模板:数据分类、model/prompt/data版本、gold/adversarial cases、RACI、canary与incident阈值
需要提示时再展开
- robots是crawl control,不是可靠的canonical或index control;先验证建议机制。
- 20万URL和直接merge把影响面与自治推到高风险,人工点一下不够。
完成后核对参考解法
该用例包含客户查询与内部路径,且输出可直接修改影响20万URL的生产配置,应判高风险:先移除非必要敏感字段,AI只产draft票据,无merge凭证。SEO对机制与URL范围accountable,工程对配置和恢复、数据owner对合法用途、安全/法务对受限字段分别负责。gold set应覆盖需抓取参数、重复参数、noindex/canonical差异、被robots阻挡仍可能出现URL等边界,并加入prompt injection。通过后只在一个低风险目录canary,保存旧robots、验证日志、抓取、索引和关键流量。任何关键URL抓取骤降、严重错误或越权输入立即kill、恢复旧配置并启动incident;模型/prompt/data变更重跑完整suite。
自评分量规
真实项目实战
把理解变成一个可以检查、复核和复用的工作产物。
为 AI 内容更新 pipeline 做上线审查
团队计划让模型根据 GSC 机会自动重写并发布 5,000 页标题和正文。
- 建立 use-case map:数据字段、供应商保留/训练政策、输出影响面、自主程度、owner 与法规/合同限制。
- 降级为 read-only analysis → draft;去除 PII/机密,使用批准模型和最小权限服务账号。
- 构建代表性/边界/对抗 gold set,测试事实、source support、品牌、语言、重复、HTML 与有害建议。
- 让领域/品牌/SEO owner 审批,先 canary 小页面组;保存 old version、diff、experiment assignment 和 rollback。
- 监控 error rate、quality sample、index/click/conversion guardrails 与投诉;触发阈值自动停止而非继续扩散。
验收条件
- 数据分类、合法用途、供应商政策和 retention 已审查
- 模型无直接无审批生产写权限
- eval 覆盖正常、边界和 prompt-injection/恶意输入
- canary、监控、kill switch、回滚 owner 和证据齐全
诊断练习
目标不是猜中答案,而是提出竞争假设并选择能区分它们的证据。
AI 自动生成的技术票据建议把参数目录加入 robots.txt,工程准备全站发布。
竞争假设
- 模型混淆 crawl control 与 index control
- 输入未提供 canonical/internal link/业务规则
- 无 gold tests、impact inventory 和 accountable SEO review
- 自动化权限与审批层级过高
应该检查的证据
- 受影响 URL inventory 与当前索引/流量
- robots/noindex/canonical 官方语义
- prompt/context/output lineage
- 审批/RACI、staging test 和 rollback readiness
常见陷阱:因模型措辞自信且票据格式完整,就把建议视为经过验证的技术方案。
完成后用本页决策规则复核
- 若观察到:输入含PII、机密、凭证或未发布信息
应优先:停止上传,做数据最小化、批准供应商/用途、最小权限与retention审查。
删除姓名不一定匿名,组合字段仍可重识别。 - 若观察到:AI可直接批量写生产或执行技术动作
应优先:降级到read/assist/draft,加入审批、canary、kill switch和备份。
可回滚不表示无害,抓取、用户和品牌影响可能已发生。 - 若观察到:model、prompt、data或解析器版本变化
应优先:按impact重跑完整核心suite与受影响切片,登记新版本后再canary。
只测历史失败例会漏掉新的回归。 - 若观察到:严重事实/权限错误或护栏越界
应优先:自动停止、回滚、冻结证据并触发incident owner。
阈值和权限需预先实现并演练,不能临场口头决定。
自测与误区
先口头回答,再展开检查。无法给出例外与证据,说明还没真正掌握。
你应该能回答
1. 最敏感输入、最大输出影响面和最坏可恢复成本是什么?
参考答案:先画data flow并分类PII、客户查询、机密路径、凭证和公开数据;再计算输出影响资产数、是否公开/生产、自治层级和恢复时长。把最坏情形写成具体结果,例如20万URL停止抓取、虚假主张公开及需要多少小时恢复,而不是只写“模型可能出错”。
为什么:敏感度、影响面、自主和可逆性共同决定风险层级与必要控制。
2. 谁对事实、品牌、数据和生产结果分别 accountable?
参考答案:事实由领域/产品owner负责,品牌语气由品牌或内容owner,数据合法用途与访问由data owner和隐私/安全角色,生产变更由工程service owner;业务sponsor接受残余风险。RACI明确谁批准、谁可拒绝、谁执行回滚,不能让“AI团队”笼统承担全部。
为什么:不同风险需要相应能力和权限,具名accountability让审阅成为实质控制。
3. 模型/prompt/data 版本变化后哪些 eval 必须重跑?
参考答案:model版本变化至少重跑完整核心gold与对抗集;prompt/template变化重跑格式、事实、品牌和安全切片;data/schema变化重跑覆盖、缺失、敏感数据与漂移测试;解析器或工具权限变化重跑集成、注入和执行安全。高风险系统即使只改一层,也要做端到端canary。
为什么:系统行为由模型、指令、数据和工具共同产生,旧通过记录不能自动继承到新组合。
4. 什么监控信号会自动停止、回滚并触发 incident?
参考答案:事前定义严重事实错误、权限泄露、危险技术动作、HTML/配置破坏、投诉、关键流量/转化护栏和异常发布率阈值;零容忍项首次出现即停止。kill switch暂停队列,rollback恢复签名旧版本,保留run artifacts并通知incident commander、领域和法务owner,恢复后验证而非只看部署成功。
为什么:自动停止与已演练恢复把错误限制在canary范围,并为调查保留证据。
需要避开的误区
- Human-in-the-loop 只要有人点击 approve 就足够。
- 不在 prompt 写姓名就代表没有隐私风险。
- 模型换成更强版本后,旧 eval 可以直接沿用。
术语与复盘
用自己的话复述术语和结论;如果只能认出、不能解释,就还没有形成可调用的知识。
- Risk tier
- 按数据、影响、自主与可逆性划分的用例控制等级。
- Lineage registry
- 记录模型、prompt、数据、输出、审阅和发布版本的可追溯登记。
- Gold set
- 有预期正确结果和明确rubric的代表性评估案例集。
- Adversarial case
- 专门探测注入、越权、边界和高危失败的测试输入。
- Canary
- 先向小且代表性的范围发布并以护栏决定扩展的方式。
- Kill switch
- 触发阈值后立即停止生成、队列或生产写入的机制。
- Rollback
- 将生产恢复到已验证旧版本并确认状态的过程。
离开本页前记住
- 风险由数据敏感度、影响面、自主和可逆性共同决定。
- 有效人审需要能力、证据、时间、拒绝权和具名责任。
- 模型、prompt、data和output都要版本化lineage。
- eval同时覆盖正常、边界、对抗和严重错误。
- 高风险AI默认无直接生产写权,先draft再canary。
- 阈值、kill switch、rollback和incident必须在发布前实现并演练。
资料与证据
优先采用官方和一手资料。实践材料用于补充工作方法,不替代机制证据。