中医知识怎么喂给大模型:中文 LLM 中医方向的选型与微调避坑

发布时间:2026/9/6 22:32:46
中医知识怎么喂给大模型:中文 LLM 中医方向的选型与微调避坑 中医知识怎么喂给大模型:中文 LLM 中医方向的选型与微调避坑【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型以规模较小、可私有化部署、训练成本较低的模型为主包括底座模型垂直领域微调及应用数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM如果你的任务是做一个能理解病历、会讲方剂配伍的中医问答助手,第一站不该是挑底座模型,而是先查资源清单。Awesome-Chinese-LLM 是一份专门整理开源中文大语言模型的仓库,以规模较小、可私有化部署、训练成本低的模型为主,中医药方向的模型与指令数据集都收录在 doc/Medical.md 里,每条记录固定四个字段:基座模型、训练数据、算力消耗、院校来源。这张参数表本身就是最好的选型依据。先分清两件事:通用医疗模型不等于中医药模型医疗方向的中文 LLM 大致分两条线。一条是通用医疗:华佗GPT、扁鹊(BianQue)、DoctorGLM、MeChat,训练数据来自医学问答、医患对话、临床指南,擅长解释疾病和药物。另一条是中医药专用:ChatMed-TCM 和 ShenNong-TCM-LLM,数据围绕方剂、中药、辨证论治展开。两条线的差别在数据,不在模型。底座可能同为 LLaMA-7B,但通用医疗模型回答感冒吃什么中成药只会给你科普;中医场景要的是按证型组方,这种能力只能靠 TCM 指令数据微调出来,换底座换不掉。说实话,如果产品面向医院临床,更稳的路径是先选通用医疗模型、再自己补中医药数据;如果是中医药院校教学、科普或养生咨询场景,直接上 TCM 专用模型,能省掉一半工作量。数据从哪来:知识图谱加自指令,而不是人工标注中医药方向两个代表性数据集出自同一条技术路线:以开源中医药知识图谱为基础,采用以实体为中心的自指令方法(entity-centric self-instruct),围绕图谱中的实体(中药、方剂、穴位等)让 ChatGPT 批量生成指令样本。ChatMed_TCM_Dataset:ChatMed 项目开源,配合 50 万 条中文在线问诊及其 ChatGPT 回复构成训练集。ShenNong_TCM_Dataset:神农(ShenNong-TCM)项目开源,同样基于中医药知识图谱构建。一个要留心的细节:README 里写 ChatMed-TCM 使用 2.6 万 条指令数据,而 doc/Medical.md 对应条目写的是 11 万。同一份仓库两处口径不一致,引用数字前建议以各模型项目的原始说明为准。这也是用 awesome 类仓库的通病:它提供的是索引,不是权威数据表,核对成本得自己付。算力与 LoRA 参数:一次微调到底花多少这一节是实操测算。把 doc/Medical.md 里几个项目的算力字段拉出来对比:项目底座微调方式算力消耗ChatMedLLaMA-7BLoRA4 x NVIDIA 3090ShenNong-TCMChinese-Alpaca-Plus-7BLoRA(rank16)未注明,微调代码与 ChatMed 同库DoctorGLMChatGLM-6B未注明1 x A100-80G,约 13 小时扁鹊元语 / ChatGLM-6B全参8 x 4090,1 个 epoch 约 16 天结论很直接:LoRA 是 TCM 微调的主流选择,4 张 3090 的门槛实验室可行;全参微调成本高出数量级。ShenNong 的LoraConfig(r16, ...)属于保守配置,7B 级底座做领域适配,秩取 8~16 通常够用,再大收益递减还更容易过拟合。两个普遍会踩的坑。一是上下文窗口:这一代 7B 级模型大多只支持 2k~4k,病历稍长就要截断,截断点切在方剂组成中间时效果明显劣化,预处理阶段要自己做分块与拼接。二是中文词表:LLaMA 原生 tokenizer 对中文覆盖差,ShenNong 选的是 Chinese-Alpaca-Plus 这类中文增强底座而不是原版 LLaMA。选底座时,中文分词质量比参数量更关键。落地前的三个检查项数据合规:问诊对话涉及患者隐私,ChatMed 训练用的是公开在线问诊语料,自己的数据先脱敏再入库。能力边界:7B 级模型做知识问答、医案检索、教学辅助是够用的;开方结果只当草稿,最终处方必须执业医师复核,这一点别指望模型自己守住。评测方法:先用 cMedQA 这类公开医疗问答集跑基线,再自建一份 200 条以内的 TCM 小评测集,覆盖辨证、方剂、药物三类问题,不要只凭 demo 效果下结论。延伸阅读想逐项目对比基座、数据与算力,直接读 doc/Medical.md;底座模型参数量、上下文窗口与商用授权的横向对比表在 README.md 的常见底座模型细节概览一节。本地运行:git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型以规模较小、可私有化部署、训练成本较低的模型为主包括底座模型垂直领域微调及应用数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考