Back to blog
    healthcareragfine-tuningclinical-aicomparisondecision-support

    临床决策支持中微调 vs RAG:何时各有胜出

    医疗保健 AI 该用 RAG 还是微调?答案取决于临床任务。本指南比较两种方案在 8 个医疗用例中的表现,涵盖准确度、延迟、成本、HIPAA 影响和混合架构。

    Edward Xi Yang

    在医疗领域,"应该用 RAG 还是微调?"这个问题问错了方向。该问的是:对于这项具体的临床任务,哪种方案给出的结果更安全、更准确?各自又会带来什么样的 HIPAA 影响?

    答案因任务而异。有些临床流程必须用检索增强生成,因为底层数据每周都在变;有些则必须用微调模型,因为输出的一致性和格式合规性没有商量余地。效果最好的临床 AI 系统里,很多是两者都用。

    本指南拆解两种方案各自的胜出场景,在 8 项医疗任务上做横向对比,讲清混合模式的做法,并给出一套适用于任何新建临床 AI 部署的决策框架。

    两种方案的工作原理(快速回顾)

    检索增强生成(RAG)

    RAG 在生成之前加了一步检索。系统先在知识库(临床指南、药物数据库、文献)里搜索,取回相关文档,作为上下文喂给模型。模型再基于取回的内容生成回答。

    **优势:**能拿到当前信息,来源可引用可核查,数据变化时无需重新训练。

    **劣势:**速度较慢(检索加生成),效果依赖检索质量,需要维护文档库,基础设施更复杂。

    微调

    微调通过在领域样本上训练来修改模型权重,知识被固化进模型本身。推理时模型直接从内部知识生成,不做外部检索。

    **优势:**推理快(只有生成一步),输出格式稳定,领域词汇嵌入权重之中,推理架构更简单。

    **劣势:**更新知识必须重新训练,可能自信地产生幻觉,训练数据的整理需要投入。

    RAG 在医疗领域的胜出场景

    当底层信息变动频繁、且具体事实的准确性比输出格式更要紧时,RAG 是正确的选择。

    1. 药物相互作用检查

    药理数据一直在更新。新药获批、黑框警告、新发现的相互作用、处方集调整,每个月都在发生。半年前训练的微调模型不知道上周刚获批的药。

    **RAG 做法:**查询时从当前的药物数据库(DrugBank、FDA 标签数据库、院内处方集)中检索,模型基于最新数据生成回答。

    **微调为什么在这里失效:**模型得每月重训才能保持最新。漏掉一条相互作用更新就可能伤害患者,这个风险水平无法接受。

    2. 临床实践指南

    AHA、ACS、ACOG 等机构发布的指南是有版本的文档,更新周期从每季度到每年不等。2025 版 AHA/ACC 高血压指南与它所取代的 2017 版在若干实质问题上存在出入。

    **RAG 做法:**为每份指南的当前版本建索引。临床医生询问某种病症的处理方式时,检索相关章节,生成回答并引用具体的指南建议。

    **微调为什么在这里失效:**指南一更新就得重训。更麻烦的是,模型可能把过时建议和现行建议混在一起,临床医生无从判断它用的是哪个版本。

    3. 文献检索与证据获取

    临床医生需要看到当前的研究:PubMed、UpToDate、Cochrane Reviews。医学文献每周新增数千篇论文。

    **RAG 做法:**为经过筛选的医学文献子集建索引,检索相关摘要和全文片段,生成带引用的综述。

    **微调为什么在这里失效:**没有哪种训练节奏跟得上发表量。持续更新索引的 RAG 是唯一可行的路子。

    4. 处方集与保险核查

    医院处方集和保险覆盖规则变动频繁,事先授权的要求每季度都在调整。要给出有用的回答,模型需要当前数据。

    **RAG 做法:**查询时从当前的处方集数据库和支付方政策文档中检索。

    微调在医疗领域的胜出场景

    当输出格式的一致性、领域词汇和分类准确度比获取变动中的事实更要紧时,微调是正确的选择。

    1. 临床病历生成

    SOAP 病历、入院记录(H&P)、操作记录,这些都遵循多年不变的既定格式。词汇是领域专用的,但很稳定。关键要求是一致性:每份病历都应遵循同样的结构、同样的术语惯例,达到同样的文书标准。

    **微调做法:**用院内 400 到 600 份高质量临床病历样本训练。模型学会该机构特有的格式、词汇和文书写法。

    **RAG 为什么在这里失效:**这里没有东西可检索。模型要做的是按学到的格式生成结构化文本,加一步检索只会增加延迟,对质量没有帮助。

    2. 医学编码(ICD-10、CPT)

    医学编码是在一套庞大但相对稳定的码表上做模式匹配。ICD-10-CM 约有 7.2 万个编码,CPT 约有 1 万个。编码每年更新一次,不是每天。任务本身是分类:给定临床文书,指派正确的编码。

    **微调做法:**用数千组(文书,编码)配对训练,模型学会临床语言与计费编码之间的映射关系。

    **RAG 为什么在这里失效:**你可以检索编码的描述,但难点在于判断哪些编码适用于某个具体的临床场景。这是模式识别任务,不是检索任务。

    3. 患者分诊分类

    急诊科分诊需要一致而迅速的分类。给定一组症状和生命体征,指派 ESI(急诊严重度指数)等级。这套逻辑稳定、基于规则,且需要在 500ms 内跑完。

    **微调做法:**用带有已验证 ESI 等级的历史分诊数据训练,模型学会稳定一致地分类。

    **RAG 为什么在这里失效:**延迟。分诊决策需要近乎即时。加一步检索(200 到 800ms)会让响应时间翻倍。分类任务从检索中得不到好处,模型需要的是内化的模式识别能力。

    4. 出院摘要生成

    出院摘要遵循机构模板。内容取自患者的住院过程,但生成任务本身受格式约束。结构一致、详略得当、医学术语规范,这是判定成功的标准。

    **微调做法:**用符合机构质量标准的去标识化出院摘要训练。

    **RAG 为什么在这里失效:**生成格式是学出来的行为。检索这一步得去搜患者本人的记录(一项患者匹配任务,HIPAA 影响不小),徒增复杂度,摘要格式也不会更好。

    正面对比:8 项医疗任务

    临床任务RAG 评分微调评分最佳方案关键原因
    药物相互作用检查9/103/10RAG数据每周变化
    临床指南问答8/104/10RAG来源有版本、可更新
    文献检索9/102/10RAG语料库持续增长
    处方集核查8/103/10RAG支付方规则每季度变
    临床病历生成3/109/10微调格式一致性至关重要
    医学编码4/108/10微调属于模式分类任务
    患者分诊2/109/10微调延迟加分类
    出院摘要3/108/10微调基于模板的生成

    **规律:**如果任务是用稳定的领域知识以一致的格式生成文本,就微调。如果任务需要拿到当前、持续变动的信息,并给出可核查的来源,就用 RAG。

    混合模式:两者兼得

    效果最好的临床 AI 系统会把两种方案结合起来。微调模型负责生成(格式、词汇、结构),RAG 则对照当前指南做事实核查。

    示例:出院指导

    1. 微调模型生成出院指导文档。它知道格式、合适的阅读难度和机构模板,会起草用药说明、活动限制、随访安排和预警症状。

    2. RAG 层核查具体主张,逐条对照当前数据:

      • 用药剂量是否符合现行指南?
      • 药物相互作用是否已考虑在内?
      • 活动限制是否与当前的术后方案一致?
      • 随访间隔是否符合当前的诊疗标准?
    3. 系统协调两者之间的任何分歧。如果微调模型给出的剂量与当前处方集冲突,系统会把它标记出来,交临床医生复核。

    架构

    Patient Data
         │
         ▼
    ┌──────────────────────┐
    │ Fine-Tuned Model      │ ← Generates structured output
    │ (Discharge adapter)   │    Format, vocabulary, template
    └──────────┬───────────┘
               │
               ▼
        Draft Document
               │
               ▼
    ┌──────────────────────┐
    │ RAG Fact-Checker      │ ← Validates facts against
    │                       │    current guidelines, formulary,
    │ Sources:              │    drug database
    │ - Drug database       │
    │ - Clinical guidelines │
    │ - Formulary           │
    └──────────┬───────────┘
               │
               ▼
    ┌──────────────────────┐
    │ Reconciliation Layer  │ ← Flags discrepancies
    │                       │    for clinician review
    └──────────┬───────────┘
               │
               ▼
      Final Document + Flags
    

    这套模式让你同时拿到微调的速度与一致性,以及 RAG 带来的准确性保障。微调模型运行需要 200 到 400ms,RAG 事实核查再加 500 到 1000ms,合计不到 1.5 秒,对出院规划这类非紧急流程是可以接受的。

    HIPAA 影响:一个关键差异

    很多团队会在这里漏掉一项重要的架构决策。

    RAG 的 HIPAA 考量

    RAG 需要一个文档库:装着知识库内容的向量数据库或搜索索引。如果知识库里含有源自患者记录的临床内容,就可能含有 PHI。即便是去标识化的临床指南,一旦与患者查询结合,也可能变成与 PHI 相关联的内容。

    具体的 HIPAA 影响:

    • **向量数据库在合规范围之内。**它必须满足 HIPAA 安全规则的全部要求:静态与传输中的加密、访问控制、审计日志。
    • **嵌入向量可能编码了 PHI。**如果你对含有患者信息的临床文档做了嵌入,嵌入向量本身可能被认定为 PHI。这方面尚无确立的法律先例,但多数合规官采取的保守解释是按 PHI 对待。
    • **基础设施复杂度上升。**RAG 会把一个向量数据库、一个嵌入模型和一条检索管线纳入你的 HIPAA 范围,每个组件都需要单独做安全评估。
    • **查询日志可能含有 PHI。**如果临床医生这样查询 RAG 系统:"患者 John Smith 的二甲双胍推荐剂量是多少?",这条查询日志就含有 PHI。

    微调的 HIPAA 考量

    微调的 HIPAA 情况更简单:

    • **训练数据可以去标识化。**训练前先跑一条稳健的去标识化管线。完成去标识化之后,训练数据不属于 PHI,训练出的模型权重也不属于 PHI。
    • **推理是自包含的。**没有外部数据存储需要防护。模型跑在医院自己的硬件上,处理输入、生成输出。HIPAA 范围就是推理服务器和应用层。
    • **纳入范围的组件更少。**没有向量数据库,没有嵌入模型,没有检索管线。基础设施更少意味着攻击面更小,合规文档也更简单。

    **结论:**微调降低了 HIPAA 基础设施的复杂度,RAG 则增加了需要防护和审计的组件。RAG 依然有它合理的用武之地,只是选它的时候要有意识,清楚这份合规成本。

    延迟对比:对临床流程的影响

    在临床场景里,延迟很关键。要 5 秒才响应的系统会被无视;1 秒之内响应的系统会被融进日常流程。

    方案检索时间生成时间总延迟
    仅微调200-500ms200-500ms
    仅 RAG200-800ms400-800ms600-1600ms
    混合(微调加 RAG 核查)300-600ms(并行)200-500ms500-1100ms

    延迟最要紧的场合

    • **急诊分诊:**要求 500ms 以内。只用微调。
    • **床旁决策支持:**最好在 1 秒以内。用微调,或用带缓存检索的混合模式。
    • **文书辅助:**2 秒以内可接受。任何方案都行。
    • **出院规划:**5 秒以内可接受。混合模式最合适。
    • **研究类查询:**10 秒以内可接受。用做全面检索的 RAG。

    方案要与临床场景匹配。300ms 的微调模型够用的地方,别上 2 秒的 RAG 管线。

    决策框架

    任何新的临床 AI 任务都可以走这套流程:

    第 1 步:底层数据的变动频率高于每季度一次吗?

    • 是 → RAG(或混合方案中的 RAG 部分)
    • 否 → 进入第 2 步

    第 2 步:输出格式的一致性是关键要求吗?

    • 是 → 微调(或混合方案中的微调部分)
    • 否 → 进入第 3 步

    第 3 步:需要亚秒级延迟吗?

    • 是 → 只用微调
    • 否 → 进入第 4 步

    第 4 步:任务需要可核查的来源引用吗?

    • 是 → RAG
    • 否 → 微调

    第 5 步:任务同时涉及格式受约束的生成和事实核查吗?

    • 是 → 混合模式
    • 否 → 用第 1 到 4 步中得分最高的那个

    大多数临床 AI 部署最后会用上 2 到 3 个微调适配器,外加 1 到 2 条 RAG 管线,风险最高的流程则采用混合模式。

    医疗规模下的成本对比

    以一家中型医院(200 到 400 张床位)在 5 个科室部署 AI 为例:

    微调成本模型

    项目成本频率
    训练(5 个 LoRA 适配器)$500-$1,500每季度
    推理服务器(1 块 GPU)$200-$500/月持续
    模型管理工具$100-$300/月持续
    年度合计$5,600-$13,200

    RAG 成本模型

    项目成本频率
    向量数据库托管$200-$800/月持续
    嵌入模型推理$100-$400/月持续
    文档接入管线$500-$2,000每季度
    推理服务器(1 块 GPU)$200-$500/月持续
    知识库维护$500-$1,500/月持续
    年度合计$14,000-$42,000

    混合成本模型

    项目成本频率
    微调部分$5,600-$13,200每年
    RAG 部分(子集)$8,000-$25,000每年
    集成与编排$1,000-$3,000每年
    年度合计$14,600-$41,200

    单用微调比单用 RAG 便宜 60% 到 70%。混合方案比全套 RAG 略便宜,因为只有确实需要 RAG 的任务才动用 RAG 基础设施,每次查询都走一遍就没有必要了。

    为你的机构做出选择

    不要因为 RAG 时髦就默认选它,也不要因为微调更简单就默认选它。用上面的决策框架,逐项临床任务独立评估。

    先从影响最大的临床流程入手,通常是临床文书或编码辅助,部署合适的方案,测量结果。然后再扩展到其他流程,根据每项任务的具体要求选择 RAG 或微调。

    在临床 AI 上拿到最好结果的机构,都是给每项任务挑最合适的方案,并搭建一套两种方案都支持得住的架构。

    延伸阅读

    就本文向 AI 提问

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.

    Keep reading