医疗大模型微调是什么?零基础入门到实战精通
1.项目背景首先整个项目的灵感源于一档名为《十字路口》的播客中分享的“2024年最令人惊艳的十大AI落地项目”之一。项目详情如下某全国万店连锁药房推出驻店销售APP可对到店客户的病情描述进行录音并转为文字输入大模型。大模型输出对应药品介绍及推销文案辅助销售人员完成高利润药品的推荐。与传统AI辅助应用不同该APP专门针对利润较高的药品设计推荐逻辑同时通过自然流畅的交互设计降低顾客的推销感知。例如销售人员会以“帮您查询最新会员优惠信息”等话术解释操作在维护顾客信任的同时提升互动质量。公开数据显示引入该APP后连锁药店利润显著增长30%。值得关注的是药品行业中价格与利润并非正相关因此模型的推荐策略设计尤为关键。此外APP降低了对销售人员专业背景的依赖简化招聘流程的同时有效压缩人力成本为连锁药店创造了更多成本优化空间与发展机遇。然后我们团队又回顾了一下中国近10年的互联网发展史。发现我们非常善于解决老百姓最后X公里这件事。例如共享单车满足了短途出行需求尤其在城市场景下助力人们轻松实现从公共交通站点到目的地的“最后一公里”衔接。三通一达京东快递这些物流企业依托高效配送网络打通了从城市电商仓库或站点到消费者家门口的“最后五公里”配送链路大幅提升了网购商品送达的便利性。各类外卖平台以美团、饿了么为例其服务范畴不仅涵盖便捷的餐食配送还延伸至日用品、药品等多品类的即时配送领域极大丰富了消费者的生活选择压缩了等待时长让“足不出户享尽各类服务”成为现实。最后我们开动脑洞发现能不能这个真实的案例之上做一层扩展呢。然后我又做了一个用户场景的分析如下所示到此我们基本就敲定了模拟一个线上问诊购药的APP。在保证推荐高利润药品的同时解决最后的配送问题。2.技术架构及选型最初版本的产品核心架构在项目开始之初我们的思路是首先用户输入病情描述随后经RAG检索增强并结合prompt输入大模型生成推荐结果。接着用户查看病情解析和药品推荐后下单购买药品。最后用户完成订单。在此流程中AI Agent会处理若干特定问题例如是否需要呼叫配送、客户选择时效优先还是低费用优先、哪个平台提成回扣较高等。若有需要还将执行呼叫跑腿和跑腿配送操作。从中可见我们本意是借助Agent进行一些判断同时将获取各平台跑腿价格和下单接口封装为工具。然而由于Agent的推理本质上也是通过Prompt实现的且Prompt由人工编写这意味着需要反复调整同时推理结果存在不稳定性。这会大幅增加整个项目的集成复杂度且在时间有限的情况下我们最终放弃了Agent方案。随后确定了以下版本的技术架构方案最终敲定版本的技术架构图基础层以Qwen - VL - Chat作为大模型底座借助其多模态能力达成医疗图像的识别与解答。同时选取BGE - M3作为向量模型Chroma数据库作为向量数据库用以搭建药品和医疗知识补充的知识库。最后运用Nginx进行请求映射。接口层采用Swift:OpenAI API与LangServe:Restful API发挥承上启下的作用实现大模型与业务能力的串联整合。能力层打造“通用知识对话”“医疗问答”“药品咨询”“意图识别”“报告诊断书识别”等能力。展现层通过PC、Web展示Demo最终效果。3.多模态模型微调这次比赛项目我们为了保险起见采用了双轨机制。一组使用Qwen-VL-Chat进行微调另一组使用LLaVA1.5-7b-hf进行微调选择7b是因为算力有限实属无奈。后边会分别介绍两组的微调过程和结果分析说明3.1 Qwen-VL-Chat 微调采用了魔搭推荐的SWIFT框架进行微调微调方式为LoRA同时使用了transformer中默认的计算QKV大矩阵的训练的方式。^( t r a n s f o r m e r . h )( ? ! .*( l m _ h e a d | o u t p u t | e m b | w t e | s h a r e d )).*1为了不出现因为专业能力提升导致通识能力大步退化甚至出现灾难性遗忘。在微调时也插入了一部分通识数据包括alpaca-zh中文版的Alpaca数据集,alpaca-cleanedAlpaca数据集的清理版本。原始的Alpaca数据集可能包含一些噪声和不规范的数据sharegpt-gpt4由社区贡献的GPT-4模型的训练数据集包含了大量高质量的文本数据用于训练和微调GPT-4模型,swift-mix是一个混合数据集通常用于训练和微调Swift框架下的模型。包含了多种类型的数据如文本、图像、音频等旨在提供一个综合性的训练数据集。注由于Qwen-VL-Chat是一个多模态大模型所以在补充了基本预料数据集以外还补充了swift-mix这种混合数据集。以此来保障其多模态的通识能力。2医疗专业数据补充基于medical-zh-instruct、Chinese-medical-dialogue、ChatMed_Consult_Dataset、disc-med-sft-zh(多轮对话)、UCSD26(多轮对话)、llava-med-zh-instruct(图文)数据集抽样40W数据进行微调。相关微调参数为–learning_rate 1e-4 --warmup_ratio 0.03 --max_length 2048 --batch_size 4 – weight_decay 0.1 --gradient_accumulation_steps 16微调过程监控记录在微调的过程中训练损失(train/loss)虽然存在波动但是整体上还是呈现下降趋势训练准确率(train accuracy)也存在波动但是整体上准确率还是呈现上升趋势。学习率(train learning rate)先从一个非常小的值逐渐达到峰值后降低避免初期学习率过高导致模型不稳定。GPU内存使用量也是初始阶段呈上升趋势达到约38G然后保持稳定。ARC_E 通用评测数据测评结果在通用评测数据ARC_E上qwen-vl-chat-sft微调后和qwen-vl-chat微调前分别取得了0.7259和0.7698的准确率表明经过微调后的模型在原有通用能力上并没有太大的下降。最后可以看一下微调效果对比微调后具备追问能力同时回答的更加详细医疗图像微调前后效果比对微调前模型无法正确识别上传的CT图像只能给出模糊的回答如“抱歉我无法识别这些图像”、“对不起您上传的图像内并未包含识别到的信息”。而微调后模型能够正确识别出上传的CT图像显示的是COVID-19肺炎的症状并给出了具体的解释“CT图像显示肺部有斑片状密度增高影这与COVID-19肺炎的特征相符。”至此经过了两轮的微调后基本达到了作为本次项目底座的能力。3.2 LLaVA 1.5 - 7b - hf 微调同时我们也尝试了使用LLaVA1.5-7b-hf作为初始的通用领域多模态对话模型再将模型训练到生物医学领域。对于基于LLaVA1.5-7b-hf的医疗大模型微调实践共计尝试了3次微调。本次使用了LLaMA-Factory框架进行微调使用的数据集包括1ava-med-zh-instruct-60k 包含60,000条中文指令专门用于医疗领域的中文指令数据集数据示例{ instruction:根据病历描述给出初步诊断建议。, input:患者主诉头痛伴有恶心和呕吐持续两天。, output:初步诊断偏头痛。建议进行头部CT检查以排除其他原因。 }2PMC-15M 是一个包含1500万篇医学文献的数据集这些文献来自PubMed CentralPMC这是一个由美国国家医学图书馆NLM维护的免费全文生物医学和生命科学期刊数据库.数据示例{ pmcid:PMC123456, title:Effect of Exercise on Cardiovascular Health, abstract:This study examines the impact of regular exercise on cardiovascular health in adults., body:Introduction: Regular physical activity has been shown to have numerous health benefits..., authors:[John Doe,Jane Smith], journal:Journal of Cardiology, year:2022, doi:10.1001/jama.2022.12345, keywords:[exercise,cardiovascular health,physical activity] }第一次微调过程及结果其实第一次微调也仅仅是使用一个中文数据集 一个英文医学论文库组成的数据集进行尝试。本来是计划根据第一次结果来调整后边的微调策略。但是第一次微调完成后发现几乎是没有效果的。于是就有第二次的尝试增加了X-ray-6k包含6000张胸部X光片。并在Prompt上增加统一user的提问‘根据X射线图像分析心脏和肺部的情况’。然而在训练过程中我们遇到了一些挑战模型看到输入的图片无法理解并一本正经胡说八道出现灾难性遗忘资源消耗过大针对这些问题我们进行了原因分析。发现特定任务微调后导致模型遵循通用指令能力变弱的主要原因是任务数据集的信息分布与原始LLM的信息分布之间存在差距。简单直白的说就是模型被玩坏了…最后我进行第三次微调。第三次微调过程及结果第三次微调在原来的基础上利用llava-med-zh-instruct-60k数据集的知识蒸馏让模型学习医疗领域通用指令。使用X-ray-6k数据集增加轮次微调使模型充分学习解剖胸片的能力。时为了匹配两个数据集我们设置了每个数据集的最大样本数max_samples为6000并保持了它们之间的权重平衡。然后由于提供的孙阿里有限我们只完成了1.5轮的训练。虽然解决了灾难性遗忘的问题但在实际应用中仍存在问题。由于比赛时间比较有限。我们直接选择Qwen-VL-Chat作为大模型底座直接放弃LLaVA-1.5-7b微调的模型。不过通过这两次微调我们也总结出来2个最核心的经验1 数据集非常重要。在微调前一定要多花时间精力找数据集。最好是在某个行业有比较好的认可性的同时有足够的负样本、可以做数据增强、有通用的蒸馏数据的。不然很容易微调以后把模型玩坏。2模型选择最好能结合清晰的目标选择模型以及模型的大小。尽量在节约资源的情况下发挥不同类型或不同大小模型的最大能力。例如本次项目的LLaVA其实在选型的时候团队还没有确定项目和场景。并且llava1.5-7b-hf模型不够强大本身存在胡言乱语的现象。所以这个选择属实有点草率了。4.RAG检索增强我们是在网上down了一些医疗论文和相关药品说明的数据。然后通过BGE-3M模型Embedding后存储到了一个Chroma DB中。在RAG层面上我们做了Multi - Query ParentDocumentRetriever组合尝试。同时借鉴了ColBERT的思想当需要更高粒度的嵌入时对文档和查询中的每个标记使用受上下文影响的嵌入以获得精细的查询-文档相似性分数。同时对于数据还做了一些传统数据加工工作例如数据清洗 、 格式标准化 、 质量监控 、 反馈循环。这里就不再赘述了。但是客观的说整个RAG部分做的并不好命中召回不高。截止在比赛答辩前其实也一直在尝试但一直没有找到一个比较好的策略。5.最终效果展示Demo 操作面板演示效果 - 1最终在答辩前其实是实现了最初的目标能力的。1药品推荐可以根据症状描述推荐一些药物。但是推荐药品的重复率非常高。2医疗咨询可以做简单的医疗问题回答并回答基本病理。3英文问答由于Qwen-VL-Chat在微调时数据集比较全面和均衡包含一部分英文数据集。所以在英文文档方面表现还算不错。4医疗影像识别对于骨折CT阴影都可以很好的识别到。但是具体病症存在胡说八道的情况例如骨折位置说错将新冠肺炎的胸片表现说成是肺结核。不过你用现在的通义千问去试效果也是一样的。可能医学领域确实比较复杂吧。我其实也不知道现在有哪家这方面可以做的非常好的之前调研过一个百度的百度AI用药助手连医学影像识别能力都没有。讯飞晓医的小程序也一样只能上传药盒或者药品说明书并不支持医疗图像。或者说这个领域是不是都是专业的模型提供商并没有很好的开源产品有知道的大佬也可以给我留言解答一下我的疑惑。5诊断书/病例识别对于诊断书病例血常规可以做好比较好的识别。但在推荐药品时也是胡乱推荐或一直推荐重复的药品。6能力组合对于一个复杂的对话其实可以看到整个能力链 医疗图像识别 -- 症状追问 -- 药品推荐。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取