利益关系披露:DragonAI 运营 AI 产品经理课程。本文与配套 JSON 是第一方幻觉风险决策框架,不是模型安全认证、法律意见、医疗或金融判断,也不保证任何模型或产品“无幻觉”;不包含真实客户、事故、模型跑分或风险结论。采用前须由产品、工程、安全、数据、法务和适用领域责任人按真实用途复核。
30 秒答案:治理对象不是一个百分比,而是错误如何穿过产品边界
大模型输出看起来流畅,不代表其中每个事实、引用、计算或工具结果都能被支持。产品经理首先要确定:系统在什么任务中可以生成什么声明,允许依赖哪些来源,证据不足时应澄清、降级、拒绝还是转人工,以及哪类错误一旦出现就阻断发布。
可下载 AI 产品幻觉治理证据卡 JSON,把风险分级、声明与来源、评测切片、控制措施、运行事件、复盘和发布决定连接起来。
| 观察单位 | 要回答的问题 | 必须同时保留的反面信号 |
|---|---|---|
| 整个回答 | 用户是否得到可用结果 | 一处严重错误会被平均分掩盖 |
| 单条可核验声明 | 每个事实是否有支持 | 无法判定、来源冲突与过期 |
| 引用关系 | 引用是否真的支持相邻声明 | 有链接但不支持、伪造引用 |
| 任务结果 | 错误是否改变用户决定或行动 | 人工纠正、返工和未发现错误 |
| 风险切片 | 特定人群、场景和输入怎样失败 | 稀有但高后果的严重失败 |
一、先定义幻觉边界和任务后果
不要从“模型会不会胡说”开始,而要写清产品版本、目标用户、任务、允许输出、可核验声明类型、权威来源层级、知识时效、禁用领域和潜在后果。将风险至少分成:与给定资料冲突、缺少可接受证据、引用与声明不匹配、捏造来源或实体、把过期资料当当前事实、超出权限或任务范围,以及没有依据却表达过度确定。
NIST 的生成式 AI 风险管理框架把 confabulation 作为跨生命周期风险,并强调根据具体情境、风险容忍度和资源选择治理行动。相同事实错误在创意草稿和医疗建议中的后果不同,因此不能用一个全局“幻觉率”替代用途分级。
二、把输出拆成声明—来源—判定链
为每个需要核验的声明保存 claimId、原文范围、声明类型、所需证据等级、实际来源、来源版本与时间、支持关系和判定。判定可以是 supported、contradicted、unsupported、stale、not_verifiable 或 not_applicable,并保留判定者、规则版本、理由和分歧。
引用存在不等于声明被支持。一个回答可能引用真实页面,却把页面未说过的数字放在旁边;也可能在两份冲突资料中选择过期版本。逐声明记录可以区分模型生成问题、检索问题、知识源问题和产品界面问题,避免把所有失败笼统归因于“模型”。若要查看同一无品牌问题在千问、Kimi、Gemini 中实际显示了哪些来源,以及为什么必须保留逐运行 URL、失败和零引用,可核对固定问题 RAG 与微调引用来源研究;该观察只用于展示来源审计方法,不证明模型答案已被事实支持或 DragonAI 已取得搜索可见性。
三、构造正常、缺失、冲突、过期与诱导切片
评测集除了常见成功问题,还要包含资料缺失、来源冲突、时间敏感、同名实体、数字与单位、否定关系、多轮上下文污染、用户错误前提、要求伪造引用、越权访问和高影响边界。每条样例固定输入、允许上下文、预期行为、禁止行为、严重失败和可接受的澄清或拒绝。
OpenAI 对语言模型幻觉成因的研究指出,标准训练与评估若奖励猜测,模型会比承认不确定性更占优势。因此评测不能只给“答对”奖励;还要测量有证据时正确作答、证据不足时承认未知、需要时提出有效澄清,以及不把合理拒答误判为失败。
四、按失败原因配置控制矩阵
控制措施必须绑定具体失败,而不是列一张通用工具清单:
- 知识缺失或时效风险:限定来源、检索、时间过滤、版本标记和刷新责任;
- 证据未被正确使用:要求逐声明引用、证据覆盖校验、冲突检测与二次验证;
- 问题不完整:先澄清关键条件,不让模型自行补全高风险事实;
- 输出可程序验证:对结构、单位、权限、SQL、链接或计算使用确定性校验;
- 高后果决定:限制自动执行,要求领域复核、双确认或人工接管;
- 依赖失败:降级到安全模式、显示不可用状态,并阻止旧缓存冒充当前结果。
Google Cloud 将 grounding 定义为把模型输出连接到可核验数据源,以降低编造内容并增强可审计性。但 grounding 只是控制之一;如果来源本身不适用、检索失败或答案没有忠实使用证据,仍需阻断、降级或人工复核。
五、评测时同时报告质量、克制与可用性
固定模型、提示、检索索引、工具、采样参数和评测集版本,保留重复运行。至少报告:声明支持率、矛盾率、引用支持率、无法判定率、严重失败数、无依据问题的正确克制、有依据问题的完成率、有效澄清、过度拒答、人工接管和切片结果。
Google Cloud 的生成式 AI 评测指导采用测试驱动方式,把主观观察转为可操作指标。自动判定可用于扩大覆盖,但判定模型也会出错;普通结果可以按预先批准的方案抽样,裁判分歧应按书面风险方案执行高于普通抽样强度的复核,其中高影响失败和发布门禁临界项原则上由相应责任人全量复核。记录校准集、裁判模型与提示、判定者一致性、分歧解决、人工覆盖和无法判定项。分母为零或证据覆盖不足时返回未知,不能写成 0% 风险。
六、上线后保存事件证据,而不是只看聚合看板
每次运行关联发布版本、任务、输入摘要、检索与工具轨迹、输出、声明判定、用户反馈、纠正、人工接管、最终结果和潜在影响。聚合看板用于发现趋势,逐事件记录用于判断原因和责任。涉及个人信息或敏感内容时,应采用最小化、脱敏、访问控制和保存期限,不能为了可观测性无限保留原始对话。
Microsoft HAX 的人机交互指导覆盖系统出错时如何支持高效调用、纠正、消除歧义和提供控制。产品界面应让用户看到适用的依据与时效、报告具体错误、修改输入、撤销动作和转人工;“AI 可能出错”的通用免责声明不能替代这些控制。
七、把严重失败、回滚和重测写进发布门禁
发布决定可以是 continue_testing、limited_release、hold、rollback 或 retire。门禁至少绑定评测版本、适用切片、严重失败上限、质量与克制阈值、判定覆盖率、监测责任、事件响应时限、人工接管容量、回滚路径和重测触发器。
模型、提示、检索源、索引、工具、权限、控制规则、界面或目标人群发生变化,都可能使旧结论失效。将幻觉门禁连接到 AI 产品评测指标、评测集模板 和 灰度发布,而不是把实验室平均分直接写成生产安全结论。
与评测指标、RAG 和灰度发布的边界
AI 产品评测指标定义跨问题通用的测量对象、方向、阈值、切片、样本与缺失处理;本页把这些方法具体化为幻觉专属的声明—证据判定、失败类型、克制指标和控制链。RAG 产品决策回答是否需要外部知识、怎样检索与呈现依据;幻觉治理还覆盖无需检索的计算与工具错误、来源冲突、引用错配、过度确定、用户纠错和高影响人工复核。灰度发布负责完整发布单元的生产分群、观察节奏、跨风险信号和可执行回滚;本页只为其中的幻觉风险提供专项准入证据。若要决定产品是否可发布,三类记录应以同一发布单元关联,不能互相替代。
使用边界
本文不替代适用法律、行业规范、模型与供应商评估、红队、安全测试、数据保护影响评估或领域专家判断。模板中的空白记录不代表系统已测试;未取得逐声明证据、代表性切片、运行监测和责任人复核时,应保持 not_evaluated 或 hold,不得宣称“消除幻觉”“绝对准确”或“安全可靠”。
