← 返回博客

微调 vs RAG:怎么选、怎么组合、怎么避坑(2026 决策指南)

"到底微调还是 RAG?"是 2026 年企业 AI 落地被问得最多的问题之一,也是选错代价最高的问题——选 RAG 还是微调,直接决定项目的成本结构、迭代节奏和效果上限。本文给一套能直接抄的决策框架:先用三个问题做初步分流(数据变不变、格式特不特殊、要不要可追溯),再按七个维度细化打分,最后给出 RAG + 微调组合的三种标准架构。附微调实操五步(数据→LoRA→评测→回归→监控)、SFT 数据量级参考和常见坑清单。【查看微调/RAG 决策表】

先说结论:RAG 和微调不是二选一,但绝大多数项目”不需要微调”

我们做 AI 工程交付,被客户问得最多的一个问题就是:“我的场景到底该微调还是用 RAG?” 很多企业听说”微调才有核心竞争力”,花了几万块把模型训了一版,结果上线发现知识还是过时——因为微调是静态快照,而知识是活的。

先给结论,再给框架:RAG 和微调不是二选一,但 80% 的企业知识类场景用 RAG 就够了;微调的价值集中在”格式、风格、领域语言”这类能力层,而不是知识层。 真正生产级的方案,大多是两者的组合。

本文给你一套能直接抄的决策链路:三个问题初步分流 → 七维度打分 → 组合架构 → 微调实操五步 → 避坑清单。附决策表。


第一步:三个问题,先把场景分到哪一边

不用看任何复杂框架,先问三个问题:

问题答案是”是”答案是”否”
知识要不要经常更新?(文档改版、政策调整、产品迭代)RAG——微调是静态快照,更新一次知识重训一次知识相对稳定才考虑微调
回答要不要可追溯?(要能说清”这句话出自哪份文档”)RAG——微调的知识在权重里,无法给出处不需要溯源才考虑微调
要不要特定格式/语气/术语?(合同条款风格、客服话术规范、特定文体)考虑 微调——这是”能力”不是”知识”,RAG 补不进去RAG 直答即可

三个问题走完,大多知识类场景(客服问答、政策咨询、文档问答)会落在”RAG 优先”。只有格式/风格/专业语言这类要求,才是微调的明确主场。


第二步:七维度打分——两个方案都”能用”时怎么选

如果场景两个方案都说得通,用这张表逐项打分:

维度RAG 占优条件微调占优条件
知识更新频率月度内更新(政策/产品/运营资料)知识半年以上不变(历史文档、固定话术)
可追溯性必须引用来源(合规审计、金融医疗)不需要出处,只看结果
数据量知识规模大(千份以上文档)核心知识小而精(几百条话术/模板)
格式/风格要求通用格式即可强风格约束(法律文书、品牌语气、代码规范)
领域术语密度术语已在通用模型能力内小众行业黑话,通用模型频繁出错
成本结构持续 Token 成本,改动成本低一次性训练成本 + 后续重训成本
数据安全知识进 Prompt(上下文级隔离)参数级”记住”(数据训练期间出域,需合规评估)

打分后看哪边占优项多。注意最后一个维度——数据安全:微调意味着业务数据在训练期间要交给训练环境(云端训练或自建算力),有严格数据出域限制的场景(政务、金融、医疗)这一条往往一票否决。


第三步:组合——2026 年生产级方案的三种标准架构

绝大多数生产系统不是二选一,而是分工:

架构 A:RAG 提供事实 + 微调负责表达(最常见)

检索给事实,微调模型用公司口吻和专业术语把事实说出来。

适合:客服、法律文书生成、行业报告。微调解决”说人话/说行话”,RAG 解决”说对”。这是 2026 年性价比最高、翻车最少的标准组合。

架构 B:微调做路由分流

微调一个轻量分类模型,先判断问题类型(知识类/格式类/闲聊类),再决定走检索还是直答。

适合:问题类型混合、需要分流降本的场景。用 7B 级模型微调做路由器,比大模型语义路由更便宜、更可控。

架构 C:RAG 生成 + 微调后处理

RAG 先出草稿,微调模型重写为标准格式。

适合:对输出格式有硬性规范(报表、合同条款、表单数据)的生成类场景。

分工铁律:事实和时效归 RAG,能力和风格归微调——各管一段,谁也别抢谁的活。


第四步:微调实操五步(确认要微调之后)

1. 数据准备(决定成败的一步)

数据项建议
数据量SFT 起步 500-5000 条”指令+期望回答”对,质量 >> 数量
数据来源线上真实流量整理 > 合成数据(Synthetic Data)+人工清洗 > 通用公开数据
数据混合掺 10-20% 通用数据,防灾难性遗忘
清洗红线去掉重复、错误、含 PII 的样本——垃圾进垃圾出,模型只会”认真学错”

2. 训练方式:默认 LoRA / QLoRA

  • LoRA(低秩适配):只训练少量低秩参数,单张消费级显卡(24G)即可微调 7B-32B,效果接近全参微调;
  • QLoRA:4-bit 量化 + LoRA,单张 12-16G 显卡也能跑,是个人/小团队起步的默认选项;
  • 全参数微调:效果上限更高但成本高、遗忘风险大,没有充分理由不要上。

3. 评测:微调前后在同一评测集上对比(铁律)

微调的价值必须用数据证明,不是”感觉更懂业务了”。做法:用同一套评测集(覆盖核心业务场景 + 通用能力抽测)跑微调前/后对比——业务分上升、通用分不掉,才允许上线。评测体系怎么建见LLM 应用评测实战

4. 回归:上线后持续监控

微调模型上线后同样会漂移(输入分布变化、知识过时),保留评测集定期重跑,别训完就忘了它。

5. 部署

微调产物是一个模型文件/服务,私有化部署的硬件预算和推理优化见私有化 LLM 推理优化实战模型部署测算器


附:微调/RAG 决策表(直接抄)

决策点选项选它的条件
知识更新频率RAG / 微调月度内更新 → RAG;半年以上稳定 → 可微调
可追溯性RAG / 微调要引用出处 → RAG;不要出处 → 可微调
格式/风格微调 / RAG强风格约束 → 微调;通用格式 → RAG
数据出域约束一票否决微调政务/金融/医疗数据不能出域 → 只能 RAG 或私有算力微调
训练方式LoRA / QLoRA / 全参默认 LoRA;显存紧张 QLoRA;无充分理由不上全参
数据量级500-5000 条 SFT质量优先,1 千条好数据 > 5 万条噪音
组合架构A/B/C知识+风格都要 → A;问题分流 → B;格式规范 → C

常见坑清单(每个都是真项目踩出来的)

  1. 把微调当知识更新工具:知识更新一次重训一次,成本翻倍还总是过时——知识层应该用 RAG;
  2. 以为微调能补推理能力:数学、多步逻辑不行是模型能力问题,微调只能调行为不补能力——那是换更大模型的事;
  3. 数据不清理直接训:重复、错误、带 PII 的数据混进去,模型”认真学错”,上线效果反而变差;
  4. 不做数据混合:纯业务数据训练,通用能力严重退化(灾难性遗忘),业务外的对话全部答非所问;
  5. 不评测就上线:微调完”感觉懂业务了”直接部署——没有前后对比的微调,是玄学不是工程;
  6. 微调和 RAG 互斥思维:非选一个,结果两边都要的时候哪边都不完整——生产级方案几乎都是组合。

延伸阅读:

微调 vs RAG 的选择题,本质是**“知识放哪里”的架构决策**:放外部知识库(RAG)换来可更新、可追溯;放模型权重(微调)换来风格与能力。2026 年没有”纯微调”或”纯 RAG”的生产方案,只有分工——把知识、风格、路由各放在对的地方,成本、效果、迭代节奏才能同时成立。

我们团队交付过 RAG 与微调的全链路项目:知识库与检索工程、SFT 数据准备与清洗、LoRA/QLoRA 训练与评测基线、微调+RAG 组合架构设计与部署。如果你正在纠结”这个场景到底该微调还是 RAG”,欢迎带着场景来聊——先帮你出选型决策表,再谈实施。

常见问题

微调和 RAG 到底有什么区别?

本质区别是"改模型"还是"改输入"。RAG(检索增强生成)不改变模型参数:回答问题前先从知识库检索相关文档,把检索结果拼进上下文再让模型生成,知识的载体是外部知识库。微调(Fine-tuning)则是用业务数据继续训练模型,把知识、风格、格式要求"烧进"模型权重里,知识的载体是模型本身。由此推导出两个关键差异:RAG 知识更新只需改数据库,微调更新知识要重新训练;RAG 回答可追溯(引用了哪份文档一查便知),微调的知识来自权重无法定位出处。

什么时候该用 RAG,什么时候该用微调?

三条硬分流规则:① 知识要经常更新(产品文档、政策法规、运营资料)→ 用 RAG,微调是"静态快照",每次更新都要重训;② 回答必须可追溯可审计(金融、医疗、政务)→ 用 RAG,微调无法提供引用来源;③ 要求特定输出格式/语气/领域术语(合同条款风格、客服话术规范、代码补全风格)→ 用微调,这是 RAG 补不进去的"能力"而非"知识"。模型推理能力不足(数学、多步逻辑)时微调也救不了——那是换更大模型的问题,不是微调的问题。

微调需要多少数据?没有标注数据怎么办?

SFT 阶段 500-5000 条高质量(指令+期望回答)对即可有明显效果,质量远大于数量——1000 条精心清洗的数据比 5 万条爬来的噪音强。没有现成标注数据的三条路:① 用合成数据(Synthetic Data):让大模型按你的业务场景批量生成"问题-答案"对,人工抽检清洗;② 从线上真实流量里挖:把客服记录、日志、用户反馈整理成对,这是最接近真实分布的;③ 先 RAG 后微调:先用 RAG 把产品跑起来,积累真实问题后再决定要不要微调——多数项目走到这步发现 RAG 已经够了。

微调会不会让模型"变傻"?比如忘记原来的能力?

会,这叫灾难性遗忘(Catastrophic Forgetting):模型在新数据上变强,却在通用能力上退化。三个标准缓解手段:① 数据混合——微调数据里掺入 10-20% 的通用数据(公开 SFT 数据集、日常问答),让模型"边学新知识边复习旧知识";② 参数高效微调——用 LoRA/QLoRA 只训练低秩适配层而非全部参数,改变幅度小,遗忘风险天然更低;③ 训练后必须跑评测——微调前后在同一评测集上对比,通用能力分数掉太多说明数据配比有问题,先调数据再上线。

微调和 RAG 能一起用吗?怎么组合?

能,而且 2026 年生产级方案基本都是组合。三种标准架构:① RAG 打底 + 微调调风格(最常见):检索提供事实,微调后的模型负责"用公司的口吻和专业术语把事实说出来";② 微调做路由分流:用微调模型先判断问题属于哪类(知识类/格式类/闲聊类),再决定走检索还是直答;③ 微调做后处理:RAG 生成后,用微调模型重写为标准格式。记住分工原则:事实和时效交给 RAG,能力和风格交给微调——各管一段,不要互相抢活。

本文来自 AI Enable Harness 一线交付实践。需要同类系统或优化服务?

📡 本文同步发布平台: CSDN 知乎

订阅博客更新

新文章发布后第一时间邮件通知。不定期发送,不推销。

订阅 →