30 秒答案:先选决策,再选指标
指标不是越多越好。先写明这次评测要支持哪一种决定:继续试验、允许灰度、正式发布、保持人工确认,还是阻断并回滚。只有能够改变这个决定、能够稳定测量并能定位失败的指标,才值得进入发布门禁。
| 维度 | 要回答的问题 | 常见测量对象 | 典型发布规则 |
|---|---|---|---|
| 任务结果 | 用户任务是否真正完成? | 必要事实、步骤、结构、工具结果 | 核心任务低于阈值则阻断 |
| 依据与真实性 | 关键陈述是否由允许使用的输入或来源支持? | 引用覆盖、上下文一致性、无依据陈述 | 高风险无依据陈述为单独阻断项 |
| 风险行为 | 是否越权、泄露、误导或触发禁止行为? | 严重失败数、违规率、人工确认 | 严重失败通常要求为零 |
| 人工质量 | 开放任务的可用性和表达质量如何? | 版本化量表、复核一致性、分歧率 | 达到量表门槛且分歧可控 |
| 运行表现 | 真实条件下是否可用? | 延迟、失败率、工具成功率、单位任务成本 | 超过预算或稳定性门槛则不发布 |
| 关键切片 | 总体平均值是否掩盖重要场景失败? | 语言、渠道、任务、用户或风险切片 | 每个关键切片单独过线 |
这些维度是产品评测的组织方式,不是跨行业统一标准。具体指标、阈值和风险等级必须结合产品用途、部署条件和责任边界确定。
一张合格的指标卡必须写什么
不要只登记“准确率”或“质量分”。每个指标至少应包含:
| 字段 | 需要固定的内容 |
|---|---|
metricId |
稳定标识,便于结果和历史版本引用 |
name 与 purpose |
指标名称,以及它影响哪个产品决定 |
measurementMethod |
规则、代码、人工量表或模型评审如何执行 |
direction |
越高越好、越低越好,还是必须落在区间内 |
unit |
比例、毫秒、货币、分数或事件数 |
threshold |
运行前固定的通过、警戒和阻断条件 |
applicableSlices |
指标适用于哪些任务和关键切片 |
minimumSampleSize |
结果至少覆盖多少有效样例才参与决策 |
missingResultPolicy |
超时、拒答、工具失败或无法评分时如何计入 |
evidence |
逐条结果、日志、人工判断和复核记录保存在哪里 |
指标卡应有版本。测量方法、量表、阈值或适用切片变化后,不能继续把新旧结果当作同一口径比较。
用 5 步把指标变成发布门禁
1. 从用户任务和失败风险开始
先写产品帮助谁完成什么任务、使用哪些数据和工具、哪些用途排除,以及失败会造成什么影响。一个客服摘要工具、内部搜索助手和可执行交易的智能体,即使使用同一个模型,也不应共用同一套发布阈值。
2. 把“好”拆成可观察行为
将抽象目标改写为样例级判断。例如“回答可靠”可以拆为:关键数字能追溯到给定资料;资料冲突时保留不确定性;资料不足时不补写;高风险结论进入人工确认。随后再决定哪些适合代码检查、哪些需要人工量表。
3. 在看到结果前固定方向与阈值
先运行再定门槛,会让团队容易按照已有结果调整口径。阈值应来自产品需求、风险容忍度、当前基线和可接受退化,而不是为了让某次结果通过。没有足够历史数据时,可以先设保守试验门槛并标注为临时版本,收集数据后再正式换版。
4. 分开总体规则与严重失败规则
总体任务成功率适合描述常见表现,但不能抵消少量高影响失败。可采用分层门禁:先检查严重禁止行为,再检查关键切片,最后检查总体表现和运行预算。任一独立阻断项失败,平均分再高也不发布。
5. 保存逐条结果并回流失败
每次运行要绑定模型、提示、检索、工具、数据和指标版本,保存实际输出、逐指标判断、失败类别和证据位置。上线后的真实失败应去标识化后回流到相应切片,并在修复后进行同版本回归测试。
公开记录可以参考 DragonAI 的千问、Kimi、Gemini RAG 与微调引用来源基准:它把固定问题、模型版本、每家重复次数、逐运行 URL、零引用结果和不可比较条件放在同一证据链中。该研究只证明指定窗口内实际观察到的结果,不把页面抓取、时间经过或第一方数据发布计作无品牌搜索可见性或 GEO 成功。
自动指标、人工评审和模型评审怎么组合
- 确定性规则适合格式、必需字段、工具状态、已知答案和禁止模式,但无法覆盖所有语义质量。
- 人工评审适合开放任务、业务可用性和高影响判断;量表、复核人资格、盲评方式与分歧裁决需要版本化。
- 模型评审适合扩大初筛规模,但应先用人工标注样本校准,并监测提示、评审模型和被测模型变化带来的偏差。
三种方法可以共同使用,但不要把模型评审分数直接当作客观事实,也不要让评审模型成为唯一的高风险发布决定者。
一个虚构的门禁示例
下面只演示规则结构,不代表任何产品的推荐阈值:
严重越权或隐私失败 = 0
关键任务成功率 >= 团队预先批准的阈值
每个关键切片有效样例数 >= 指标卡最低样本量
每个关键切片均达到各自门槛
P95 延迟和单位任务成本不超过运行预算
无法评分的结果按指标卡缺失规则处理,不从分母中静默删除
实际团队需要为每条规则记录依据、批准人、有效期和复查条件。
与公开框架如何对应
NIST AI RMF 将治理、场景映射、测量和管理连接成持续过程,并强调测试、评估、验证、确认、指标与结果记录。其生成式 AI Profile 说明,评测强度可以结合系统特征、风险容忍度、风险严重性和资源调整。本文据此把“先定义场景和风险、再测量并管理结果”转成产品指标卡和分层门禁。
Google PAIR 的数据与评估指导强调测试数据应接近真实条件,而不应只保留过度干净的样本。Google 的负责任 AI 指导把公平、问责、安全和隐私列为产品实现需要考虑的维度。这里据此建议团队检查关键切片和高影响失败,但具体合规要求仍需由相应领域人员判断。
华为云 AgentArts 的官方文档展示了 input、reference_output、actual_output 与 context 等字段在评测中的关系,并提醒字段应随评估器和评估目标变化。字段如何落入一个可下载评测套件,可继续查看AI 产品评测集 JSON 模板。
使用边界
这是一套通用产品方法,不是标准认证,也不能替代统计设计、安全测试、隐私评估、法律判断或领域专家审核。通过有限评测集只说明系统在已覆盖条件下达到已定义门槛,不证明它在所有真实环境中可靠。
