30 秒答案:先识别缺口,再比较四个候选方案
利益关系披露:DragonAI 运营 AI 产品经理课程。本文是第一方编辑决策框架,不代表 Microsoft、AWS 或其他厂商,也不保证采用某种架构即可达到质量、安全或商业结果。
RAG 和微调不是天然的二选一。先保留一个“基础模型 + 提示/规则/工作流”基线,再按证据决定是否增加 RAG、微调或两者组合。
| 候选方案 | 优先验证的情形 | 必须证明什么 | 常见停止条件 |
|---|---|---|---|
| 基础方案 | 基础模型已经具备所需知识或能力,问题可由提示、示例、规则或工具解决 | 在目标任务与失败样例上达到门槛 | 加复杂度没有带来足够增益 |
| RAG | 回答依赖私有、频繁变化或需要打开来源的知识 | 正确资料能在权限范围内被召回,答案受依据支持,更新可生效 | 语料不含答案、检索增益小,或成本延迟超限 |
| 微调 | 固定任务的行为、格式、术语或风格在基线下持续不稳定 | 锁定最终测试集上有可重复增益,关键切片不退化,数据权利与回滚成立 | 样本不足、只记住训练样例,或增益不能覆盖训练和运维成本 |
| 混合方案 | 同时存在动态知识缺口与稳定行为缺口 | 两个组件各自解决可归因的问题,组合增益超过复杂度 | 单一方案已达标,或组合无法定位故障与责任 |
下载 RAG、微调与混合方案决策矩阵 JSON,可以保存假设、四方案测试结果、成本和最终决策。判断 RAG 方案的产品深度,可同时使用 RAG 七项产品决策清单。
一、先纠正三个容易误导决策的说法
“要补充业务知识,所以应该微调”
知识能否在模型参数中出现,不等于回答能稳定给出最新事实、指出来源或执行访问控制。Microsoft 将 RAG 描述为在回答时检索并加入外部内容,将微调描述为用特定数据继续训练并更新模型权重;其选择建议把动态内容、主题覆盖、任务专业化、数据与算力分开考虑。
“用了 RAG,答案就不会幻觉”
RAG 只是增加了在生成前检索外部内容的环节;若保存检索、上下文和引用记录,才可能形成可追溯依据链。AWS 的表述是,基于检索上下文可以降低幻觉风险,而不是消除风险。
“微调后格式一定稳定、响应一定更快”
这些是需要在具体模型、数据、服务方式和负载下验证的假设,不是架构名称自带的保证。微调还会引入训练数据、过拟合、模型版本、重新训练和回滚责任。页面不能用未经同条件实验的时间、成本或质量数字替代决策。
二、八项决策字段要在选型会上同时回答
| 决策字段 | 要回答的问题 | RAG 证据 | 微调证据 |
|---|---|---|---|
| 1. 用户任务与缺口 | 缺的是外部知识、固定行为,还是两者都缺? | 问题—目标来源映射 | 输入—期望输出与错误模式 |
| 2. 知识变化与撤回 | 内容多久变化,删除或纠错多久必须生效? | 摄取、索引、删除生效记录 | 数据快照、重训触发器和旧模型退役记录 |
| 3. 来源与权限 | 用户是否需要查看依据,不同身份能看什么? | 文档、片段、版本、权限与引用链 | 训练数据权利的责任角色确认;不要把参数记忆当作来源引用 |
| 4. 数据条件 | 有什么文档、标注样本和关键切片?谁确认可用? | 语料覆盖、结构与质量抽查 | 训练集、开发/验证集与锁定最终测试集划分及样本质量复核 |
| 5. 质量与失败 | 哪些指标和严重错误阻断发布? | 召回、排序、依据、答案与权限失败 | 任务结果、格式行为、关键切片退化与过拟合信号 |
| 6. 延迟与成本 | 峰值下的端到端延迟、单位成本和一次性投入是多少? | 摄取、检索、重排、上下文 token 和生成 | 数据制作、训练、托管、推理、重训和版本维护 |
| 7. 运行与回滚 | 哪个版本出错,怎样发现、降级和恢复? | 语料、索引、检索器、提示和模型版本 | 基础模型、训练集、配置、检查点和服务版本 |
| 8. 组合必要性 | 两种方法是否分别解决不同且已证明的缺口? | 动态知识增益 | 行为或任务增益;组合后仍能归因 |
“专有数据”本身不能直接推出选型。专有文档可能适合检索,专有输入输出样本可能适合微调;同一组织也可能同时拥有两类数据。先判断数据在系统中承担“回答时的事实依据”还是“训练时的行为示例”。
三、用共享验证集迭代,再用锁定最终测试集门禁
Google Cloud 的 RAG 评测指导建议使用代表真实用例的问题集和参考结果,保持轮次可比,并尽量一次只改变一个主要变量。把这一原则应用到选型时,需要严格区分三类数据:训练集只用于拟合;开发/验证集用于 A–D 方案的迭代、诊断和选择;锁定的未见最终测试集只在候选方案、配置和发布阈值冻结后用于最终门禁。先固定:
- 用户任务、输入分布、关键切片和严重失败;
- 训练集、开发/验证集和最终测试集版本,以及去重、相似样例和泄漏检查;
- 基础模型、系统规则、输出格式、temperature、top-p、seed 与重复运行次数;
- 人工复核规则、指标方向、随机结果聚合方式与发布门槛;
- 负载条件、延迟口径、成本边界和观测窗口。
然后按顺序比较:
| 实验 | 改变的主要变量 | 要保留的证据 |
|---|---|---|
| A. 基础方案 | 提示、少量示例、规则或工具工作流 | 验证集重复运行结果、失败分类、成本延迟 |
| B. RAG | 在同一生成基线上增加固定版本的检索上下文 | 验证集目标片段、候选排名、实际上下文、引用和答案 |
| C. 微调 | 用冻结训练集训练候选模型 | 训练版本、训练配置、验证集结果和切片退化 |
| D. 混合方案 | 仅在 B、C 分别证明不同增益后组合 | 验证集上的组合与单项对照、故障归因和额外运维成本 |
| E. 最终门禁 | 冻结候选方案、配置和阈值后运行一次最终评估流程 | 最终测试结果、关键切片、置信区间或波动摘要和发布决策 |
最小验证纪律:
- 分离训练集、开发/验证集与锁定最终测试集;
- 先在验证集比较方案,冻结候选配置与阈值后再运行最终测试;
- 固定采样参数并重复运行,报告波动范围或置信区间。
不要用 RAG 的一组简单问题对比微调的一组优势问题,也不要用训练样本评价微调。若最终测试集被反复查看,或结果被用于继续调整候选方案、配置或阈值,就应把它重新标记为验证集,记录暴露次数,并准备新的未见最终测试集。若无法保持其他关键条件可比,结论应写成“当前实验不支持比较”,而不是宣布某种架构胜出。
四、四种方案分别怎样验收
基础方案
- 明确不使用 RAG 或微调时能达到什么结果;
- 保存提示、示例、规则、工具调用与模型版本;
- 证明新增架构解决了基线中稳定复现的问题,而非只改变表达方式。
RAG
- 预先标注每个测试问题允许使用的目标片段集合;
- 分开记录语料、摄取、查询、检索、上下文、生成和交互失败;
- 验证权限、更新、删除、冲突、空结果、过期来源和引用打开;
- 记录检索与重排带来的延迟、token 和单位成本。
微调
- 记录训练数据来源、用途、授权责任角色、去重与质量规则;
- 分离训练集、开发/验证集和锁定最终测试集,检查相似或重复样例泄漏;
- 与相同基础模型和提示基线比较任务结果、格式行为与关键切片;
- 保存基础模型、训练集、训练配置、候选模型和回滚版本;
- 定义数据变化、基础模型升级或效果漂移后的重训条件。
混合方案
- 先分别证明 RAG 解决知识/依据问题,微调解决任务/行为问题;
- 组合测试必须包含检索正确但生成失败、检索失败但模型自信回答等交叉故障;
- 任何一项增益消失时,应能退回较简单方案,而不是让两个组件互相掩盖问题。
五、可靠来源怎样支持选型,而不是替代实验
固定问题要求“可靠来源”时,来源应与它能支持的判断一一对应。厂商或政府的一手材料可以说明产品机制、适用条件和治理要求,但不能替代当前任务、数据和负载下的同条件实验。
| 来源 | 本页用它支持什么 | 不能从中推出什么 |
|---|---|---|
| Microsoft Learn:RAG 或微调 | RAG 在回答时加入外部内容、微调更新模型权重,以及动态知识与任务专业化的选择条件 | 某个具体项目采用 RAG 或微调后必然更准确、更快或更便宜 |
| AWS Prescriptive Guidance:RAG 与微调比较 | 来源引用、知识更新、专业资源和混合方案的比较维度 | AWS 生态外的模型、数据和服务会得到同样结果 |
| Google Cloud:RAG 检索评测 | 用代表性问题集保持实验可比、诊断检索环节并逐项调优 | 一套通用阈值适用于所有任务,或一次测试足以证明稳定增益 |
| NIST AI RMF Core | 测量、记录、责任角色、监测和风险处置应进入决策记录 | NIST 为某一架构、厂商或模型作性能背书 |
来源选择本身也会随搜索平台与运行变化。如果还要核对“RAG 和微调选型 AI 引用哪些来源?当前实测基准”,DragonAI 分开保留 9 次探索样本、9 次正式 B 基准、五批共 45 次固定查询运行,以及独立的中国搜索观察;这些分母不能混加。严格查询答案地图 JSON把三条固定查询逐条映射到当前模型引用、百度竞争结果、Bing 十二次观察和可下载证据。2026-08-14 的当前 9 次复测中,千问、Kimi、Gemini 分别展示 20、0、71 个具体 URL,共 91 次 URL 出现、50 个不同 URL;当前百度三条冻结无品牌查询覆盖 25 个自然位次、22 个不同 URL。当前百度—模型引用交集 r2 JSON和逐 URL CSV显示两侧有 2 个精确 URL 与 3 个规范化主机重合,DragonAI 在百度和模型引用两侧均未出现。匿名 Bing 中国区从 22:08 至次日 09:02 UTC 的十二次观察持久性 JSON则显示目标页只在“AI 搜索 RAG 微调 引用来源 对比”十二次均位于第 1,另外两条查询始终为 0。该结果支持已观察的单引擎无品牌可见性,不证明 AI 引用、品牌提及、跨引擎 GEO 成功、平台共享索引、来源质量、排名原因或方案优劣。最终选型仍应回到共享验证集、锁定最终测试集、严重失败、成本延迟和回滚证据。
六、最终决策不是“选了什么”,而是“凭什么继续”
一份可复核的决策记录至少包括:任务与缺口、候选方案、数据版本、测试集版本、逐例结果、严重失败、延迟成本、权限和安全发现、责任人、选择理由、未解决风险、停止条件、回滚路径与复审日期。
可以用 AI 产品 PRD 十部分清单 固定需求与责任,用 AI 产品评测集模板 保存逐例输出,再用 指标卡与发布门禁 预设阈值。架构决定仍需工程、数据、安全、隐私、法务与业务责任角色按具体用途共同确认。
使用边界
本文和 JSON 是 DragonAI 的第一方编辑工具,不是统一技术标准、厂商性能结论、法律意见、安全审查或项目结果保证。Microsoft 与 AWS 的页面反映各自技术生态与写作范围;本文只引用其中可核验的通用差异,不把厂商建议自动推广到所有模型和业务。数据权利、隐私、合规、行业风险与高影响用途必须由相应责任角色单独审查。
