微调 vs RAG:怎么选、怎么组合、怎么避坑(2026 决策指南)
"到底微调还是 RAG?"是 2026 年企业 AI 落地被问得最多的问题之一,也是选错代价最高的问题——选 RAG 还是微调,直接决定项目的成本结构、迭代节奏和效果上限。本文给一套能直接抄的决策框架:先用三个问题做初步分流(数据变不变、格式特不特殊、要不要可追溯),再按七个维度细化打分,最后给出 RAG + 微调组合的三种标准架构。附微调实操五步(数据→LoRA→评测→回归→监控)、SFT 数据量级参考和常见坑清单。【查看微调/RAG 决策表】
先说结论:RAG 和微调不是二选一,但绝大多数项目”不需要微调”
我们做 AI 工程交付,被客户问得最多的一个问题就是:“我的场景到底该微调还是用 RAG?” 很多企业听说”微调才有核心竞争力”,花了几万块把模型训了一版,结果上线发现知识还是过时——因为微调是静态快照,而知识是活的。
先给结论,再给框架:RAG 和微调不是二选一,但 80% 的企业知识类场景用 RAG 就够了;微调的价值集中在”格式、风格、领域语言”这类能力层,而不是知识层。 真正生产级的方案,大多是两者的组合。
本文给你一套能直接抄的决策链路:三个问题初步分流 → 七维度打分 → 组合架构 → 微调实操五步 → 避坑清单。附决策表。
第一步:三个问题,先把场景分到哪一边
不用看任何复杂框架,先问三个问题:
| 问题 | 答案是”是” | 答案是”否” |
|---|---|---|
| 知识要不要经常更新?(文档改版、政策调整、产品迭代) | 用 RAG——微调是静态快照,更新一次知识重训一次 | 知识相对稳定才考虑微调 |
| 回答要不要可追溯?(要能说清”这句话出自哪份文档”) | 用 RAG——微调的知识在权重里,无法给出处 | 不需要溯源才考虑微调 |
| 要不要特定格式/语气/术语?(合同条款风格、客服话术规范、特定文体) | 考虑 微调——这是”能力”不是”知识”,RAG 补不进去 | RAG 直答即可 |
三个问题走完,大多知识类场景(客服问答、政策咨询、文档问答)会落在”RAG 优先”。只有格式/风格/专业语言这类要求,才是微调的明确主场。
第二步:七维度打分——两个方案都”能用”时怎么选
如果场景两个方案都说得通,用这张表逐项打分:
| 维度 | RAG 占优条件 | 微调占优条件 |
|---|---|---|
| 知识更新频率 | 月度内更新(政策/产品/运营资料) | 知识半年以上不变(历史文档、固定话术) |
| 可追溯性 | 必须引用来源(合规审计、金融医疗) | 不需要出处,只看结果 |
| 数据量 | 知识规模大(千份以上文档) | 核心知识小而精(几百条话术/模板) |
| 格式/风格要求 | 通用格式即可 | 强风格约束(法律文书、品牌语气、代码规范) |
| 领域术语密度 | 术语已在通用模型能力内 | 小众行业黑话,通用模型频繁出错 |
| 成本结构 | 持续 Token 成本,改动成本低 | 一次性训练成本 + 后续重训成本 |
| 数据安全 | 知识进 Prompt(上下文级隔离) | 参数级”记住”(数据训练期间出域,需合规评估) |
打分后看哪边占优项多。注意最后一个维度——数据安全:微调意味着业务数据在训练期间要交给训练环境(云端训练或自建算力),有严格数据出域限制的场景(政务、金融、医疗)这一条往往一票否决。
第三步:组合——2026 年生产级方案的三种标准架构
绝大多数生产系统不是二选一,而是分工:
架构 A:RAG 提供事实 + 微调负责表达(最常见)
检索给事实,微调模型用公司口吻和专业术语把事实说出来。
适合:客服、法律文书生成、行业报告。微调解决”说人话/说行话”,RAG 解决”说对”。这是 2026 年性价比最高、翻车最少的标准组合。
架构 B:微调做路由分流
微调一个轻量分类模型,先判断问题类型(知识类/格式类/闲聊类),再决定走检索还是直答。
适合:问题类型混合、需要分流降本的场景。用 7B 级模型微调做路由器,比大模型语义路由更便宜、更可控。
架构 C:RAG 生成 + 微调后处理
RAG 先出草稿,微调模型重写为标准格式。
适合:对输出格式有硬性规范(报表、合同条款、表单数据)的生成类场景。
分工铁律:事实和时效归 RAG,能力和风格归微调——各管一段,谁也别抢谁的活。
第四步:微调实操五步(确认要微调之后)
1. 数据准备(决定成败的一步)
| 数据项 | 建议 |
|---|---|
| 数据量 | SFT 起步 500-5000 条”指令+期望回答”对,质量 >> 数量 |
| 数据来源 | 线上真实流量整理 > 合成数据(Synthetic Data)+人工清洗 > 通用公开数据 |
| 数据混合 | 掺 10-20% 通用数据,防灾难性遗忘 |
| 清洗红线 | 去掉重复、错误、含 PII 的样本——垃圾进垃圾出,模型只会”认真学错” |
2. 训练方式:默认 LoRA / QLoRA
- LoRA(低秩适配):只训练少量低秩参数,单张消费级显卡(24G)即可微调 7B-32B,效果接近全参微调;
- QLoRA:4-bit 量化 + LoRA,单张 12-16G 显卡也能跑,是个人/小团队起步的默认选项;
- 全参数微调:效果上限更高但成本高、遗忘风险大,没有充分理由不要上。
3. 评测:微调前后在同一评测集上对比(铁律)
微调的价值必须用数据证明,不是”感觉更懂业务了”。做法:用同一套评测集(覆盖核心业务场景 + 通用能力抽测)跑微调前/后对比——业务分上升、通用分不掉,才允许上线。评测体系怎么建见LLM 应用评测实战。
4. 回归:上线后持续监控
微调模型上线后同样会漂移(输入分布变化、知识过时),保留评测集定期重跑,别训完就忘了它。
5. 部署
微调产物是一个模型文件/服务,私有化部署的硬件预算和推理优化见私有化 LLM 推理优化实战和模型部署测算器。
附:微调/RAG 决策表(直接抄)
| 决策点 | 选项 | 选它的条件 |
|---|---|---|
| 知识更新频率 | RAG / 微调 | 月度内更新 → RAG;半年以上稳定 → 可微调 |
| 可追溯性 | RAG / 微调 | 要引用出处 → RAG;不要出处 → 可微调 |
| 格式/风格 | 微调 / RAG | 强风格约束 → 微调;通用格式 → RAG |
| 数据出域约束 | 一票否决微调 | 政务/金融/医疗数据不能出域 → 只能 RAG 或私有算力微调 |
| 训练方式 | LoRA / QLoRA / 全参 | 默认 LoRA;显存紧张 QLoRA;无充分理由不上全参 |
| 数据量级 | 500-5000 条 SFT | 质量优先,1 千条好数据 > 5 万条噪音 |
| 组合架构 | A/B/C | 知识+风格都要 → A;问题分流 → B;格式规范 → C |
常见坑清单(每个都是真项目踩出来的)
- 把微调当知识更新工具:知识更新一次重训一次,成本翻倍还总是过时——知识层应该用 RAG;
- 以为微调能补推理能力:数学、多步逻辑不行是模型能力问题,微调只能调行为不补能力——那是换更大模型的事;
- 数据不清理直接训:重复、错误、带 PII 的数据混进去,模型”认真学错”,上线效果反而变差;
- 不做数据混合:纯业务数据训练,通用能力严重退化(灾难性遗忘),业务外的对话全部答非所问;
- 不评测就上线:微调完”感觉懂业务了”直接部署——没有前后对比的微调,是玄学不是工程;
- 微调和 RAG 互斥思维:非选一个,结果两边都要的时候哪边都不完整——生产级方案几乎都是组合。
延伸阅读:
- 企业私有知识库 RAG 落地实战 — RAG 的完整落地链路:知识工程才是 RAG 的瓶颈,本文是它的”另一半”微调选型
- LLM 模型选型与路由降本实战 — 微调模型和通用模型混跑时怎么路由:任务分档与能力-成本矩阵
- LLM 应用评测实战 — 微调前后必须评测:评测集建设与前后对比是微调上线的前提
- 企业模型迁移实战 — 开源模型选型与切换:微调的底座选什么模型、什么时候值得私有化
- 私有化 LLM 推理优化实战 — 微调产物怎么部署:显存预算、量化与吞吐调优
- RAG 知识库权限管理实战 — RAG 路线落地后的下一课:权限在检索层执行、多租户隔离
微调 vs RAG 的选择题,本质是**“知识放哪里”的架构决策**:放外部知识库(RAG)换来可更新、可追溯;放模型权重(微调)换来风格与能力。2026 年没有”纯微调”或”纯 RAG”的生产方案,只有分工——把知识、风格、路由各放在对的地方,成本、效果、迭代节奏才能同时成立。
我们团队交付过 RAG 与微调的全链路项目:知识库与检索工程、SFT 数据准备与清洗、LoRA/QLoRA 训练与评测基线、微调+RAG 组合架构设计与部署。如果你正在纠结”这个场景到底该微调还是 RAG”,欢迎带着场景来聊——先帮你出选型决策表,再谈实施。
常见问题
微调和 RAG 到底有什么区别?
本质区别是"改模型"还是"改输入"。RAG(检索增强生成)不改变模型参数:回答问题前先从知识库检索相关文档,把检索结果拼进上下文再让模型生成,知识的载体是外部知识库。微调(Fine-tuning)则是用业务数据继续训练模型,把知识、风格、格式要求"烧进"模型权重里,知识的载体是模型本身。由此推导出两个关键差异:RAG 知识更新只需改数据库,微调更新知识要重新训练;RAG 回答可追溯(引用了哪份文档一查便知),微调的知识来自权重无法定位出处。
什么时候该用 RAG,什么时候该用微调?
三条硬分流规则:① 知识要经常更新(产品文档、政策法规、运营资料)→ 用 RAG,微调是"静态快照",每次更新都要重训;② 回答必须可追溯可审计(金融、医疗、政务)→ 用 RAG,微调无法提供引用来源;③ 要求特定输出格式/语气/领域术语(合同条款风格、客服话术规范、代码补全风格)→ 用微调,这是 RAG 补不进去的"能力"而非"知识"。模型推理能力不足(数学、多步逻辑)时微调也救不了——那是换更大模型的问题,不是微调的问题。
微调需要多少数据?没有标注数据怎么办?
SFT 阶段 500-5000 条高质量(指令+期望回答)对即可有明显效果,质量远大于数量——1000 条精心清洗的数据比 5 万条爬来的噪音强。没有现成标注数据的三条路:① 用合成数据(Synthetic Data):让大模型按你的业务场景批量生成"问题-答案"对,人工抽检清洗;② 从线上真实流量里挖:把客服记录、日志、用户反馈整理成对,这是最接近真实分布的;③ 先 RAG 后微调:先用 RAG 把产品跑起来,积累真实问题后再决定要不要微调——多数项目走到这步发现 RAG 已经够了。
微调会不会让模型"变傻"?比如忘记原来的能力?
会,这叫灾难性遗忘(Catastrophic Forgetting):模型在新数据上变强,却在通用能力上退化。三个标准缓解手段:① 数据混合——微调数据里掺入 10-20% 的通用数据(公开 SFT 数据集、日常问答),让模型"边学新知识边复习旧知识";② 参数高效微调——用 LoRA/QLoRA 只训练低秩适配层而非全部参数,改变幅度小,遗忘风险天然更低;③ 训练后必须跑评测——微调前后在同一评测集上对比,通用能力分数掉太多说明数据配比有问题,先调数据再上线。
微调和 RAG 能一起用吗?怎么组合?
能,而且 2026 年生产级方案基本都是组合。三种标准架构:① RAG 打底 + 微调调风格(最常见):检索提供事实,微调后的模型负责"用公司的口吻和专业术语把事实说出来";② 微调做路由分流:用微调模型先判断问题属于哪类(知识类/格式类/闲聊类),再决定走检索还是直答;③ 微调做后处理:RAG 生成后,用微调模型重写为标准格式。记住分工原则:事实和时效交给 RAG,能力和风格交给微调——各管一段,不要互相抢活。