跳到正文跳到正文
当前位置:首页>首页>AI产品经理知识库>AI 产品评测指标怎么选?指标卡与阈值方法

烛龙智元 · AI产品经理知识库

AI 产品评测指标怎么选?指标卡与阈值方法

先定义用户任务和不能接受的失败,再选择能改变发布决策的少量指标;每个指标都要写清测量对象、方法、方向、单位、阈值、适用切片、最低样本量和缺失结果处理。高严重度失败应单独阻断,不能被总体平均分抵消。

30 秒答案:先选决策,再选指标

指标不是越多越好。先写明这次评测要支持哪一种决定:继续试验、允许灰度、正式发布、保持人工确认,还是阻断并回滚。只有能够改变这个决定、能够稳定测量并能定位失败的指标,才值得进入发布门禁。

维度 要回答的问题 常见测量对象 典型发布规则
任务结果 用户任务是否真正完成? 必要事实、步骤、结构、工具结果 核心任务低于阈值则阻断
依据与真实性 关键陈述是否由允许使用的输入或来源支持? 引用覆盖、上下文一致性、无依据陈述 高风险无依据陈述为单独阻断项
风险行为 是否越权、泄露、误导或触发禁止行为? 严重失败数、违规率、人工确认 严重失败通常要求为零
人工质量 开放任务的可用性和表达质量如何? 版本化量表、复核一致性、分歧率 达到量表门槛且分歧可控
运行表现 真实条件下是否可用? 延迟、失败率、工具成功率、单位任务成本 超过预算或稳定性门槛则不发布
关键切片 总体平均值是否掩盖重要场景失败? 语言、渠道、任务、用户或风险切片 每个关键切片单独过线

这些维度是产品评测的组织方式,不是跨行业统一标准。具体指标、阈值和风险等级必须结合产品用途、部署条件和责任边界确定。

一张合格的指标卡必须写什么

不要只登记“准确率”或“质量分”。每个指标至少应包含:

字段 需要固定的内容
metricId 稳定标识,便于结果和历史版本引用
namepurpose 指标名称,以及它影响哪个产品决定
measurementMethod 规则、代码、人工量表或模型评审如何执行
direction 越高越好、越低越好,还是必须落在区间内
unit 比例、毫秒、货币、分数或事件数
threshold 运行前固定的通过、警戒和阻断条件
applicableSlices 指标适用于哪些任务和关键切片
minimumSampleSize 结果至少覆盖多少有效样例才参与决策
missingResultPolicy 超时、拒答、工具失败或无法评分时如何计入
evidence 逐条结果、日志、人工判断和复核记录保存在哪里

指标卡应有版本。测量方法、量表、阈值或适用切片变化后,不能继续把新旧结果当作同一口径比较。

用 5 步把指标变成发布门禁

1. 从用户任务和失败风险开始

先写产品帮助谁完成什么任务、使用哪些数据和工具、哪些用途排除,以及失败会造成什么影响。一个客服摘要工具、内部搜索助手和可执行交易的智能体,即使使用同一个模型,也不应共用同一套发布阈值。

2. 把“好”拆成可观察行为

将抽象目标改写为样例级判断。例如“回答可靠”可以拆为:关键数字能追溯到给定资料;资料冲突时保留不确定性;资料不足时不补写;高风险结论进入人工确认。随后再决定哪些适合代码检查、哪些需要人工量表。

3. 在看到结果前固定方向与阈值

先运行再定门槛,会让团队容易按照已有结果调整口径。阈值应来自产品需求、风险容忍度、当前基线和可接受退化,而不是为了让某次结果通过。没有足够历史数据时,可以先设保守试验门槛并标注为临时版本,收集数据后再正式换版。

4. 分开总体规则与严重失败规则

总体任务成功率适合描述常见表现,但不能抵消少量高影响失败。可采用分层门禁:先检查严重禁止行为,再检查关键切片,最后检查总体表现和运行预算。任一独立阻断项失败,平均分再高也不发布。

5. 保存逐条结果并回流失败

每次运行要绑定模型、提示、检索、工具、数据和指标版本,保存实际输出、逐指标判断、失败类别和证据位置。上线后的真实失败应去标识化后回流到相应切片,并在修复后进行同版本回归测试。

公开记录可以参考 DragonAI 的千问、Kimi、Gemini RAG 与微调引用来源基准:它把固定问题、模型版本、每家重复次数、逐运行 URL、零引用结果和不可比较条件放在同一证据链中。该研究只证明指定窗口内实际观察到的结果,不把页面抓取、时间经过或第一方数据发布计作无品牌搜索可见性或 GEO 成功。

自动指标、人工评审和模型评审怎么组合

  • 确定性规则适合格式、必需字段、工具状态、已知答案和禁止模式,但无法覆盖所有语义质量。
  • 人工评审适合开放任务、业务可用性和高影响判断;量表、复核人资格、盲评方式与分歧裁决需要版本化。
  • 模型评审适合扩大初筛规模,但应先用人工标注样本校准,并监测提示、评审模型和被测模型变化带来的偏差。

三种方法可以共同使用,但不要把模型评审分数直接当作客观事实,也不要让评审模型成为唯一的高风险发布决定者。

一个虚构的门禁示例

下面只演示规则结构,不代表任何产品的推荐阈值:

严重越权或隐私失败 = 0
关键任务成功率 >= 团队预先批准的阈值
每个关键切片有效样例数 >= 指标卡最低样本量
每个关键切片均达到各自门槛
P95 延迟和单位任务成本不超过运行预算
无法评分的结果按指标卡缺失规则处理,不从分母中静默删除

实际团队需要为每条规则记录依据、批准人、有效期和复查条件。

与公开框架如何对应

NIST AI RMF 将治理、场景映射、测量和管理连接成持续过程,并强调测试、评估、验证、确认、指标与结果记录。其生成式 AI Profile 说明,评测强度可以结合系统特征、风险容忍度、风险严重性和资源调整。本文据此把“先定义场景和风险、再测量并管理结果”转成产品指标卡和分层门禁。

Google PAIR 的数据与评估指导强调测试数据应接近真实条件,而不应只保留过度干净的样本。Google 的负责任 AI 指导把公平、问责、安全和隐私列为产品实现需要考虑的维度。这里据此建议团队检查关键切片和高影响失败,但具体合规要求仍需由相应领域人员判断。

华为云 AgentArts 的官方文档展示了 inputreference_outputactual_outputcontext 等字段在评测中的关系,并提醒字段应随评估器和评估目标变化。字段如何落入一个可下载评测套件,可继续查看AI 产品评测集 JSON 模板

使用边界

这是一套通用产品方法,不是标准认证,也不能替代统计设计、安全测试、隐私评估、法律判断或领域专家审核。通过有限评测集只说明系统在已覆盖条件下达到已定义门槛,不证明它在所有真实环境中可靠。

参考与证据

  1. AI Risk Management Framework Core · National Institute of Standards and Technology
  2. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile · National Institute of Standards and Technology
  3. People + AI Guidebook: Data Collection + Evaluation · Google PAIR
  4. Introduction to Responsible AI · Google for Developers
  5. 快速完成一次智能体评估 · 华为云
  6. 千问、Kimi、Gemini 固定引用问题双窗口基准(2026-07-21—22) · 烛龙智元内容研究组