30 秒答案:把术语翻译成产品决策
利益关系披露:DragonAI 运营本网站与 AI 产品经理课程。本文是公开技术学习地图,不是任何平台认证,也不承诺学习、就业、模型效果或业务结果。
AI 产品经理不必把每个组件都从零实现,但必须能回答五个问题:它解决什么问题、依赖什么输入、怎样验收、失败发生在哪一层、不能据此推出什么。 如果只会复述缩写,方案评审时仍无法判断应该检索、训练、调用工具还是先补评测。
下载 AI 产品经理 8 个核心技术术语决策地图 JSON,可直接用于课程大纲、面试准备、PRD 和方案评审。
一张表看懂 8 个术语
| 术语 | 它主要解决什么 | 产品验收重点 | 不能据此推出 |
|---|---|---|---|
| RAG | 在生成前检索外部材料并注入相关上下文 | 检索命中、上下文质量、答案依据、权限与延迟 | 接入知识库后答案一定正确 |
| Embedding | 把文本等对象表示为可比较的向量 | 目标语料与查询上的召回、分群和漂移 | 向量距离等于业务相关性 |
| Reranker | 对初步召回候选进行二次排序 | 前 k 条相关性、延迟和成本增量 | 能找回初检阶段完全漏掉的材料 |
| 微调 | 用训练样本调整模型参数与行为 | 锁定测试集上的任务表现、泛化与退化 | 适合充当频繁更新的事实数据库 |
| Agent | 在控制循环中选择动作并推进多步任务 | 轨迹、工具成功率、停止条件、接管与恢复 | 使用大模型就自动成为可靠 Agent |
| 工具调用 | 让模型按结构选择外部函数或 API | 参数校验、授权、幂等、错误处理和审计 | 模型生成调用参数就已完成业务动作 |
| MCP | 规范 AI 应用与外部资源、工具等能力的连接 | 能力协商、连接边界、授权与兼容性 | 自动提供规划、正确性或完整安全模型 |
| 评测集 | 用固定任务、指标和阈值比较方案 | 覆盖真实任务、失败切片、版本和发布门槛 | 离线通过等于线上用户结果必然提升 |
1. RAG:先找材料,再生成答案
RAG(Retrieval-Augmented Generation)把参数化生成模型与外部非参数记忆结合。原始 RAG 论文研究的是可检索外部索引与生成模型的组合;在产品系统中,常见流程还会包括分块、索引、召回、重排、上下文组装和答案生成。
当事实需要频繁更新、必须按权限获取、希望保留来源或企业资料不能全部写进模型参数时,可以先评估 RAG。验收不能只看“能回答”,还要分别检查检索是否命中、引用是否支持答案、无答案时是否拒答、权限是否泄漏,以及新增检索带来的延迟和成本。
2. Embedding:为检索建立可比较表示
Embedding 把文本、图片或其他对象映射为数值向量,使系统可以按相似性寻找候选。产品选择 Embedding 时,应在自己的查询、语言、领域术语和文档长度上测召回,而不是只比较公开榜单或向量维度。
相似度只是候选信号。语义相近不等于对当前业务问题有用,时间、权限、文档类型和精确关键词仍可能需要过滤或混合检索。
3. Reranker:在候选集中重新排序
Reranker 接收初步召回的候选,根据查询与候选的联合相关性重新排序。它适合改善前几条上下文的质量,但会增加计算与延迟。
验收时比较加入前后的 top-k 命中、最终答案质量、P95 延迟和单次成本。如果初检根本没有召回正确材料,重排无法凭空恢复它;应回到分块、索引、查询改写或召回策略排查。
4. 微调:调整模型行为,不是更新知识库
微调使用训练样本调整模型参数,适合学习稳定的任务模式、输出格式、语气或领域行为。它与 RAG 的边界不是“高级与低级”,而是修改参数和提供外部上下文的不同机制。
需要比较时,固定同一训练边界、验证集和最终测试集,分别测任务表现、泛化、退化、成本与维护周期。频繁变化且需要可追溯来源的事实,通常不应只靠微调承载。
5. Agent:把模型放进有状态的行动循环
Agent 通常包含模型、工具、指令与控制逻辑,并在多步任务中根据中间结果继续决策。适合步骤不能完全预先写死、需要在多个工具之间选择或必须处理动态反馈的任务。
产品文档应明确允许哪些动作、每步权限、预算与超时、停止条件、人工接管、失败恢复和审计轨迹。能调用一个工具不代表系统已经具有可靠的自主规划能力。
6. 工具调用:模型提议动作,应用负责执行
工具调用让模型输出结构化的工具名和参数,实际 API 请求通常由应用执行。应用必须再次验证参数、身份、授权、幂等性与业务规则,并保存成功和失败结果。
高风险动作应设置确认或审批。模型给出格式正确的 JSON,不等于调用被授权、外部系统成功执行或业务结果正确。
7. MCP:统一连接,不替代产品治理
Model Context Protocol 采用主机、客户端与服务器架构,并通过能力协商声明可用功能。它能减少不同 AI 应用连接资源与工具时的定制接口,但协议连接只是系统的一层。
采用 MCP 时仍要定义服务器信任边界、最小权限、用户授权、数据暴露、超时、审计和版本兼容。MCP 不是 Agent 规划器,也不会自动判断工具结果是否正确。
8. 评测集:所有选型的共同尺子
评测集至少包含真实任务输入、期望或评分规则、关键失败切片、指标方向、阈值和版本。对生成式系统还应保存逐条输出与解释,避免只看一个平均分。
RAG、微调、Agent、模型或提示变化都应在同一锁定测试集上比较,再结合线上监测验证。离线评测能支持发布决策,但不能替代真实用户、生产权限、延迟、成本和事故数据。
RAG、Agent、MCP 有什么区别,怎样组合
三者解决的是不同层级的问题:RAG 负责为回答找到相关材料,Agent 负责决定下一步做什么,MCP 负责用一致协议连接可用资源与工具。 它们不是三个互斥框架,也没有固定的“高级替代低级”顺序。
| 用户任务 | 最小可行结构 | 为什么 | 不要先做什么 |
|---|---|---|---|
| 从已批准文档回答制度问题 | 检索 + 生成,先做 RAG 基线 | 核心不确定性是能否找到并依据正确材料回答 | 不要因为流程有两步就先引入自主 Agent |
| 查询订单后发起退款 | 工具调用 + 明确工作流;高风险步骤人工确认 | 核心是读取和改变外部状态,权限与幂等比自由规划更重要 | 不要把模型生成的参数直接当作已授权动作 |
| 在多个系统调查故障并形成处置建议 | 受限 Agent + 工具;连接层可采用 MCP | 步骤取决于中间结果,需要动态选择数据源和动作 | 不要开放未登记工具或省略预算、停止与接管条件 |
| 先查知识库,再按结果调用业务系统 | RAG 作为检索能力,Agent 负责编排,MCP 可统一连接 | 检索、决策和连接分别承担知识、控制与接口职责 | 不要把 MCP 服务器存在误报为 Agent 已可靠完成任务 |
一个组合系统仍应分层验收:先测检索是否找到正确材料,再测 Agent 是否选择正确动作,再测 MCP 或其他连接层是否在正确身份与权限下完成调用,最后测端到端任务、人工接管、延迟和成本。端到端成功率不能替代分层失败记录,否则无法判断应该改语料、提示、规划、工具还是权限。
从需求到技术的五步判断
- 先写用户任务与失败代价,不先写技术名词。
- 判断问题来自缺知识、行为不稳定、需要行动,还是根本没有可靠评测。
- 选择最小方案:先基线,再依次增加检索、重排、训练或工具循环。
- 用同一评测集比较质量、风险、延迟、成本和维护复杂度。
- 把权限、人工接管、监测与回滚写进发布门槛。
更具体的方案可继续查看 RAG 产品决策指南、RAG 与微调选择矩阵、AI Agent 产品经理指南与评测集模板。若要核对固定选型问题实际展示哪些来源,可查看千问、Kimi、Gemini 的 RAG 与微调引用来源基准;该研究保留逐运行 URL 和零目标结果,不把抓取、品牌词或时间兜底当作无品牌可见性证明。
使用边界
这些定义用于产品沟通,不替代各平台当前实现文档。RAG、Agent 与 MCP 在不同框架中的具体接口可能变化;公开论文或云平台指南中的结果也不能直接外推到另一套数据和业务。所有选型都应绑定自己的任务、数据、权限、版本和评测证据。
