30 秒答案:把功能说明升级为可测试约定
利益关系披露:DragonAI 运营 AI 产品经理课程。本文是第一方编辑模板,不是统一行业标准,也不证明使用模板的项目一定成功。
传统 PRD 通常更侧重“为谁解决什么问题、做哪些功能、流程怎样走、什么叫完成”。AI 产品还会受到模型版本、输入上下文、数据质量、概率输出、工具调用和运行条件影响,因此 PRD 通常需要按用途和风险进一步回答:系统依据什么生成、什么不能做、怎样测量、何时交给人、何时阻断发布、上线后由谁发现并处理失败。本文把这些可测试的行为约定简称为“行为合同”,不是法律合同。
| 传统 PRD 常见内容 | AI 产品 PRD 可能需要补充 | 可验收证据 |
|---|---|---|
| 用户、场景、需求 | AI 是否必要及非 AI 基线 | 同一任务的方案比较与停止条件 |
| 功能、流程、页面 | 输入、输出、不确定性与能力边界 | 正常、边界、冲突和失败样例 |
| 数据字段 | 数据与上下文的来源、许可、更新和删除 | 来源清单、版本和追溯记录 |
| 确定性验收条件 | 评测集、指标、阈值、切片与严重失败 | 逐条结果和预设发布门禁 |
| 异常提示 | 拒答、降级、纠错、人工确认和接管 | 失败演练与责任路径 |
| 接口与权限 | Agent 工具权限、参数约束和停止条件 | 工具调用日志与越权测试 |
| 性能要求 | 质量、延迟、成本与可用性联合预算 | 关键切片的运行结果 |
| 上线计划 | 生产监测、事件升级、回滚和复审 | 仪表盘、告警、演练与版本记录 |
下载 AI 产品 PRD 适用字段与验收清单 JSON,可把每项要求连接到证据、测试、验收规则和负责人。
一、十部分都要写吗?先判定适用性,再确定深度
下面十部分是候选核验框架,不是所有项目都适用,也不是固定篇幅。先逐项判断是否与当前用途和风险有关:不适用项记录理由,适用项再确定字段深度、证据和负责人。低影响内部草稿工具可以简化治理和审批;会对健康、财务、就业、权益或大规模用户产生影响的系统,通常需要更严格的证据、人工监督、事件处置和复审。
| PRD 部分 | 适用时需回答的问题 | 最低产物 | 最低验收动作 |
|---|---|---|---|
| 1. 决策背景与非目标 | 为什么解决、为什么可能用 AI、这次明确不做什么? | 问题卡、非 AI 基线、范围和停止条件 | 用同一任务比较 AI 与替代方案 |
| 2. 用户任务与成功条件 | 谁在什么条件下完成什么任务? | 任务链、用户与风险切片、成功定义 | 目标用户完成任务并复述边界 |
| 3. AI 行为合同 | 输入、输出、依据、不确定性和禁止行为是什么? | 行为表、输出结构、拒答与纠错规则 | 运行正常、边界、冲突和对抗样例 |
| 4. 数据与上下文 | 来源、用途、许可、质量、更新和删除怎样管理? | 数据清单、上下文策略、追溯字段 | 抽查输出能否追溯到允许来源 |
| 5. 评测与发布门禁 | 用什么样例、指标、阈值和切片做决定? | 版本化评测集、指标卡、阻断规则 | 运行前固定门槛并逐条保存结果 |
| 6. 失败与人工接管 | 哪些失败必须拒答、降级、确认或升级? | 失败分类、严重度、接管与申诉路径 | 演练高影响失败的发现和处置 |
| 7. Agent 与工具权限 | 能调用什么、传什么参数、花多少资源、何时停止? | 工具白名单、权限矩阵、重试和停止条件 | 越权、重复调用与部分失败测试 |
| 8. 风险、隐私与治理 | 谁批准用途、监督风险并处理第三方变化? | 风险登记、角色责任、审批和复审条件 | 逐项确认控制措施与剩余风险 |
| 9. 运行约束与可观测性 | 延迟、成本、可用性和质量怎样联合监测? | 预算、日志字段、告警和数据保留规则 | 在关键切片和峰值条件下验证 |
| 10. 发布、采用与变更 | 谁发布、培训、支持、回滚并判断真实采用? | 灰度计划、支持入口、回滚和版本日志 | 发布就绪检查并区分上线与采用 |
二、先写决策背景,不要从模型名称开始
Google 的机器学习问题定义指南把判断机器学习是否适用、形成清晰目标和成功标准放在项目起点。PRD 应先记录用户任务、当前流程、非 AI 基线、预期价值、失败成本和停止条件,再说明为什么需要概率系统。
不合格写法是“接入最新大模型提升效率”。可测试写法应明确:针对哪类任务、当前基线是多少、哪些步骤由模型承担、哪些仍由规则或人工处理、达到什么证据才继续投入。模型名称和供应商是实现版本,不是用户问题。
三、用行为合同描述概率输出
适用的 AI 行为合同通常至少要固定以下内容:
- 输入合同:允许的输入类型、长度、语言、敏感信息和缺失字段处理。
- 上下文合同:可以使用哪些来源,冲突、过期和检索为空时怎样处理。
- 输出合同:结构、必需字段、依据、置信表达和禁止内容。
- 交互合同:何时追问、确认、拒答、纠错、撤销或交给人工。
- 版本合同:模型、提示、工具和知识版本怎样记录,变化后哪些测试必须重跑。
Google PAIR 的 Mental Models 指导强调帮助用户形成符合系统实际能力的理解,并沟通能力、限制和反馈作用。PRD 因此不能只画顺利路径;还要写清系统不知道什么、用户怎样发现并纠正错误。
四、数据与上下文要能追溯、更新和删除
对每类训练、检索、提示上下文或用户输入,记录来源、用途、许可或同意、代表性、质量、敏感性、更新频率、保留期和删除路径。Google PAIR 的数据与评估指导强调数据应贴近真实使用条件;这意味着演示样例不能替代真实任务、重要切片和失败场景。
RAG 产品还应说明切片、索引、召回、排序、引用展示和过期处理。即使 PRD 不决定具体算法,也必须让产品、数据、工程和法务能够检查“系统依据了什么”以及“来源变化后谁负责更新”。
五、把评测计划写进 PRD,而不是上线前补表
需要评测与发布门禁时,PRD 通常要链接以下字段:评测目的、样例来源、风险切片、指标、方向、阈值、最低样本量、缺失结果处理、严重失败和发布决策。可以使用 AI 产品评测集 JSON 模板 固定测试记录,再使用 指标卡与发布门禁方法 固定阈值。
总体平均分不能抵消高影响失败。若“泄露敏感信息”“执行未授权操作”或“关键依据无法追溯”被定义为阻断项,一次严重失败也可能要求停止发布;具体规则取决于用途和风险,不存在跨产品通用的数字门槛。
六、Agent PRD 要多写四类控制
涉及工具调用或 Agent 时,通常还需增加:
- 权限:工具白名单、身份、最小权限、读写范围和敏感参数;
- 执行:调用顺序、前置条件、幂等性、并发和预算;
- 失败:超时、部分成功、重试上限、补偿动作和人工接管;
- 停止:完成、无法继续、风险触发、预算耗尽和用户取消条件。
只写“Agent 自动完成任务”无法验收。应能从日志复原它调用了什么、使用什么参数、改变了什么状态、为什么停止,以及谁批准了高影响动作。
七、用四档量规审 PRD,不用文档页数打分
UIC 的 rubric 指导要求评分标准与学习或任务目标对齐,并为标准描述可区分的表现层级;CMU 的指导也强调 rubric 可以帮助理解期望、使用反馈改进并提高跨评分者一致性。将这一方法用于 PRD 评审时,可对十部分分别记录四档状态:
| 状态 | 判断条件 | 不能据此推出什么 |
|---|---|---|
| 缺失 | 没有要求、负责人或证据入口 | 不能假设团队会在开发中补齐 |
| 已定义 | 写了目标或规则,但没有测试和门槛 | 定义不等于可验收 |
| 可测试 | 已连接样例、指标、阈值或演练 | 一次通过不等于生产稳定 |
| 有证据 | 有版本化结果、复核记录、负责人和变更触发 | 有限证据不等于所有场景安全 |
不建议把四档直接相加成总分。先按用途确定必需项;任何高风险必需项仍为“缺失”或“已定义”时,不应由页面精美、功能数量或其他平均分抵消。
八、PRD、评测集和运行手册各自负责什么
- PRD 固定产品决定、行为边界、验收规则和责任关系;
- 评测集 保存具体输入、期望行为、实际输出、切片和失败分类;
- 指标卡 固定测量方法、方向、阈值和缺失处理;
- 运行手册 规定告警、升级、降级、回滚和恢复步骤。
四者应互相引用,但不应被一份超长文档取代。PRD 中的每个关键要求都要有稳定 ID,测试结果和运行事件才能反向指向原始决定。
使用边界
本文和 JSON 是 DragonAI 的第一方编辑模板,不是法律意见、行业认证、通用安全标准或项目成功保证。字段深度需要结合用途、行业、用户影响和部署环境调整。公开 PRD 也不能包含个人信息、密钥、内部安全细节或无权披露的数据;公开作品集应使用授权材料、脱敏样例或明确标注的虚构案例。
