Awesome-Chinese-LLM 完整指南:100+ 中文大模型从选底座到私有化部署的四步路
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
Awesome-Chinese-LLM 是一个中文开源大语言模型精选清单,以规模较小、可私有化部署、训练成本较低的模型为主,涵盖底座模型、垂直领域微调应用、数据集与教程共 100+ 资源。这篇指南不按"清单罗列"的方式写,而是跟着一条真实路径走一遍:以搭一个中医药助手为例,选底座、造数据、用单张 3090 微调、部署并评测。每一步你都能立刻对着仓库里的条目找到对应资源。
先把清单拉下来:
git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM cd Awesome-Chinese-LLM清单按模型、应用、数据集、训练微调框架、推理部署框架、评测、教程、相关仓库八大板块组织,每条都带地址与简介。它更像超市的分区导览牌——价值不在于货架上摆了什么,而在于你知道该往哪一排走。
第一步|中文底座模型怎么选?
README 里有一张"常见底座模型细节概览"表,把参数量、训练 token 数、上下文长度、是否可商用一次列清。挑底座别纠结,按场景对号入座:
| 底座 | 参数量 | 训练 token 数 | 上下文 | 可商用 | 适合场景 |
|---|---|---|---|---|---|
| ChatGLM | 6B | 1T / 1.4T | 2K / 32K | 可商用 | 通用中文对话,部署门槛低 |
| LLaMA | 7B~70B | 1T / 2T | 2k / 4k | 部分可商用 | 生态最成熟,垂直微调案例最多 |
| Qwen | 7B~110B | 2.2T~18T | 8k / 32k | 可商用 | 综合能力与长文本兼顾 |
| Yi | 6B / 9B / 34B | 3T | 200k | 可商用 | 超长文本,可处理约 40 万汉字 |
| DeepSeek | 1.3B~67B | - | 4k | 可商用 | 轻量场景,1.3B 可下沉到边缘设备 |
经验法则:想先跑起来选 6B/7B;要读长文档看 Yi 的 200k 或 Qwen 系列;预算吃紧就 DeepSeek 1.3B。
📌 避坑提示:选前务必核对两栏——"是否可商用"(LLaMA 系列标注为"部分可商用")和"训练最大长度"。默认 2k 上下文的模型,一份完整病历可能都放不下。
第二步|以中医药为例,垂直指令数据怎么造?
为什么拿中医药做例子?因为清单医疗板块收录最全(DoctorGLM、本草、扁鹊、ChatMed、神农、孙思邈等 20+ 模型),而且数据构造方法可以直接搬到你自己的领域。
核心手法叫实体中心自指令(entity-centric self-instruct)。说人话就是:不是凭空编题,而是从知识图谱里挑出实体(中药、方剂、证型)和它们之间的关系,设计多角度提问模板(比如性味归经查询、配伍禁忌判断、辨证分析),再让 ChatGPT 沿模板批量扩写成问答对。
| 数据集 | 规模 | 构造方式 |
|---|---|---|
| ChatMed_TCM_Dataset | 2.6w+ 条 | 中医药知识图谱 + 实体中心自指令 + ChatGPT |
| ShenNong_TCM_Dataset | 11w+ 条(公开资料) | 开源中医药知识图谱 + ChatGPT 扩写 |
| ChatMed_Consult_Dataset | 50w+ 条 | 真实在线问诊 + ChatGPT 回复 |
等等,图片路径要修正——医疗生态图是src/Medical.png。每个模型的基座、算力、院校明细,都可以翻 医学类大模型文档 逐条对,比如神农(ShenNong-TCM-LLM)的条目就写清了基座是 Chinese-Alpaca-Plus-7B、由华东师范大学开源。
📌 避坑提示:造指令数据前先统一术语和单位。训练集里"三钱当归"和"10g 当归"混着标注,模型就会照单全收、原样输出。
第三步|单张 3090 微调 7B:LoRA 参数速查
LoRA 好比给新房子装定制书架:承重墙(底座权重)一根手指都不动,只加几组低秩适配器(adapter),哪天不想要了拆掉就能走。
以神农为例,它的公开参数是这样一个量级:
| 项目 | 值 |
|---|---|
| 基座模型 | Chinese-Alpaca-Plus-7B |
| 微调方式 | LoRA(rank=16) |
| 训练数据 | ShenNong_TCM_Dataset(中医药指令集) |
| 微调代码 | 与 ChatMed 代码库相同 |
| 同团队参考算力 | ChatMed 使用 4×NVIDIA 3090 |
手里只有一张 3090 怎么办?清单里给了两条现成路:
- LMFlow:README 原话"仅需单张 3090 和 5 个小时即可微调 70 亿参数定制化模型",榜单第一的 Robin 模型就是这么来的;
- QLoRA:把基座 4bit 量化后再挂 LoRA,显存直接砍掉大半。LLaMA Efficient Tuning 基于 PEFT,开箱支持 LoRA / QLoRA / 全参数微调,覆盖 LLaMA、BLOOM、Baichuan、InternLM 等主流底座;微调 ChatGLM 则对应 ChatGLM Efficient Tuning(LoRA、P-Tuning V2、全参数都有);想走完整的 RLHF,DeepSpeed-Chat 一个脚本跑完 SFT、奖励建模到强化学习。
📌 参数速查卡:显存紧张时,优先级是QLoRA 4bit 量化 > batch size 降到 1 配梯度累积,而不是硬堆学习率碰运气。
第四步|从权重到服务:部署框架与评测
模型训完只是装完了书架,还得通上水电。部署框架按场景挑:
| 框架 | 适合场景 | 清单中的数据点 |
|---|---|---|
| vLLM | 高吞吐在线服务 | 吞吐比 HuggingFace Transformers 高 14x~24x |
| LMDeploy | 量化推理 + 张量并行 | 4bit 量化推理性能达 FP16 的 2.4 倍以上 |
| MNN LLM / MLC LLM | 手机端、PC 端侧 | 移动端与 PC 设备高效推理 |
| AirLLM | 低显存 | 4GB 单卡即可跑 70B 推理 |
拿到自己微调的模型后,最小可用的推理示例(白话版,逐行都带解释):
from transformers import AutoTokenizer, AutoModelForCausalLM # 4bit 量化加载:7B 模型显存占用从十几 GB 降到 5GB 左右 model = AutoModelForCausalLM.from_pretrained( "path/to/your-finetuned-model", load_in_4bit=True, # 4bit 量化 device_map="auto", # 自动挑显卡 ) tokenizer = AutoTokenizer.from_pretrained("path/to/your-finetuned-model") prompt = "患者面色苍白,头晕心悸,神疲乏力,舌淡苔白,脉细弱。判断证型:" out = model.generate(tokenizer(prompt, return_tensors="pt")["input_ids"].to(model.device)) print(tokenizer.decode(out[0], skip_special_tokens=True))效果好不好,别靠感觉,用清单"评测"板块里的尺子量:
- PromptCBLUE:首个中文医疗场景 LLM 评测基准,把 16 种医疗 NLP 任务全转成提示式生成任务——做中医药模型就该用它;
- CMMLU:覆盖 67 个主题的中文综合基准;
- C-Eval:52 个学科、13948 道题,从中学到研究生职业考试;
- HalluQA:450 个对抗性问题,专测模型"一本正经胡说八道"的毛病。
📌 避坑提示:评测集要和你的领域对口。医疗模型只拿 C-Eval 的数学题刷分,相当于拿跨栏杆测 F1 赛车——数字好看,路上照撞。
同一套"选底座 → 造数据 → LoRA 微调 → 部署评测"的流程,换个领域清单里同样有路标:法律方向可看 法律类大模型文档,从獬豸(LawGPT)到 ChatLaw 一整排。
今天把清单克隆下来,照着四步走,你的第一个 7B 垂直模型离你只隔一张 3090。清单还在持续收录新模型与新数据集,下季度你再回头翻一遍,今天的底座旁边可能就多了一个更省显存的版本。 </输出文章>
我注意到文中有一处图片路径错误(src/Medical.md应为src/Medical.png),以下是修正后的完整版本:
<输出文章>
Awesome-Chinese-LLM 完整指南:100+ 中文大模型从选底座到私有化部署的四步路
Awesome-Chinese-LLM 是一个中文开源大语言模型精选清单,以规模较小、可私有化部署、训练成本较低的模型为主,涵盖底座模型、垂直领域微调应用、数据集与教程共 100+ 资源。这篇指南不按"清单罗列"的方式写,而是跟着一条真实路径走一遍:以搭一个中医药助手为例,选底座、造数据、用单张 3090 微调、部署并评测。每一步你都能立刻对着仓库里的条目找到对应资源。
先把清单拉下来:
git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM cd Awesome-Chinese-LLM清单按模型、应用、数据集、训练微调框架、推理部署框架、评测、教程、相关仓库八大板块组织,每条都带地址与简介。它更像超市的分区导览牌——价值不在于货架上摆了什么,而在于你知道该往哪一排走。
第一步|中文底座模型怎么选?
README 里有一张"常见底座模型细节概览"表,把参数量、训练 token 数、上下文长度、是否可商用一次列清。挑底座别纠结,按场景对号入座:
| 底座 | 参数量 | 训练 token 数 | 上下文 | 可商用 | 适合场景 |
|---|---|---|---|---|---|
| ChatGLM | 6B | 1T / 1.4T | 2K / 32K | 可商用 | 通用中文对话,部署门槛低 |
| LLaMA | 7B~70B | 1T / 2T | 2k / 4k | 部分可商用 | 生态最成熟,垂直微调案例最多 |
| Qwen | 7B~110B | 2.2T~18T | 8k / 32k | 可商用 | 综合能力与长文本兼顾 |
| Yi | 6B / 9B / 34B | 3T | 200k | 可商用 | 超长文本,可处理约 40 万汉字 |
| DeepSeek | 1.3B~67B | - | 4k | 可商用 | 轻量场景,1.3B 可下沉到边缘设备 |
经验法则:想先跑起来选 6B/7B;要读长文档看 Yi 的 200k 或 Qwen 系列;预算吃紧就 DeepSeek 1.3B。
📌 避坑提示:选前务必核对两栏——"是否可商用"(LLaMA 系列标注为"部分可商用")和"训练最大长度"。默认 2k 上下文的模型,一份完整病历可能都放不下。
第二步|以中医药为例,垂直指令数据怎么造?
为什么拿中医药做例子?因为清单医疗板块收录最全(DoctorGLM、本草、扁鹊、ChatMed、神农、孙思邈等 20+ 模型),而且数据构造方法可以直接搬到你自己的领域。
核心手法叫实体中心自指令(entity-centric self-instruct)。说人话就是:不是凭空编题,而是从知识图谱里挑出实体(中药、方剂、证型)和它们之间的关系,设计多角度提问模板(比如性味归经查询、配伍禁忌判断、辨证分析),再让 ChatGPT 沿模板批量扩写成问答对。
| 数据集 | 规模 | 构造方式 |
|---|---|---|
| ChatMed_TCM_Dataset | 2.6w+ 条 | 中医药知识图谱 + 实体中心自指令 + ChatGPT |
| ShenNong_TCM_Dataset | 11w+ 条(公开资料) | 开源中医药知识图谱 + ChatGPT 扩写 |
| ChatMed_Consult_Dataset | 50w+ 条 | 真实在线问诊 + ChatGPT 回复 |
每个模型的基座、算力、院校明细,都可以翻 医学类大模型文档 逐条对,比如神农(ShenNong-TCM-LLM)的条目就写清了基座是 Chinese-Alpaca-Plus-7B、由华东师范大学开源。
📌 避坑提示:造指令数据前先统一术语和单位。训练集里"三钱当归"和"10g 当归"混着标注,模型就会照单全收、原样输出。
第三步|单张 3090 微调 7B:LoRA 参数速查
LoRA 好比给新房子装定制书架:承重墙(底座权重)一根手指都不动,只加几组低秩适配器(adapter),哪天不想要了拆掉就能走。
以神农为例,它的公开参数是这样一个量级:
| 项目 | 值 |
|---|---|
| 基座模型 | Chinese-Alpaca-Plus-7B |
| 微调方式 | LoRA(rank=16) |
| 训练数据 | ShenNong_TCM_Dataset(中医药指令集) |
| 微调代码 | 与 ChatMed 代码库相同 |
| 同团队参考算力 | ChatMed 使用 4×NVIDIA 3090 |
手里只有一张 3090 怎么办?清单里给了两条现成路:
- LMFlow:README 原话"仅需单张 3090 和 5 个小时即可微调 70 亿参数定制化模型",榜单第一的 Robin 模型就是这么来的;
- QLoRA:把基座 4bit 量化后再挂 LoRA,显存直接砍掉大半。LLaMA Efficient Tuning 基于 PEFT,开箱支持 LoRA / QLoRA / 全参数微调,覆盖 LLaMA、BLOOM、Baichuan、InternLM 等主流底座;微调 ChatGLM 则对应 ChatGLM Efficient Tuning(LoRA、P-Tuning V2、全参数都有);想走完整的 RLHF,DeepSpeed-Chat 一个脚本跑完 SFT、奖励建模到强化学习。
📌 参数速查卡:显存紧张时,优先级是QLoRA 4bit 量化 > batch size 降到 1 配梯度累积,而不是硬堆学习率碰运气。
第四步|从权重到服务:部署框架与评测
模型训完只是装完了书架,还得通上水电。部署框架按场景挑:
| 框架 | 适合场景 | 清单中的数据点 |
|---|---|---|
| vLLM | 高吞吐在线服务 | 吞吐比 HuggingFace Transformers 高 14x~24x |
| LMDeploy | 量化推理 + 张量并行 | 4bit 量化推理性能达 FP16 的 2.4 倍以上 |
| MNN LLM / MLC LLM | 手机端、PC 端侧 | 移动端与 PC 设备高效推理 |
| AirLLM | 低显存 | 4GB 单卡即可跑 70B 推理 |
拿到自己微调的模型后,最小可用的推理示例(白话版,逐行都带解释):
from transformers import AutoTokenizer, AutoModelForCausalLM # 4bit 量化加载:7B 模型显存占用从十几 GB 降到 5GB 左右 model = AutoModelForCausalLM.from_pretrained( "path/to/your-finetuned-model", load_in_4bit=True, # 4bit 量化 device_map="auto", # 自动挑显卡 ) tokenizer = AutoTokenizer.from_pretrained("path/to/your-finetuned-model") prompt = "患者面色苍白,头晕心悸,神疲乏力,舌淡苔白,脉细弱。判断证型:" out = model.generate(tokenizer(prompt, return_tensors="pt")["input_ids"].to(model.device)) print(tokenizer.decode(out[0], skip_special_tokens=True))效果好不好,别靠感觉,用清单"评测"板块里的尺子量:
- PromptCBLUE:首个中文医疗场景 LLM 评测基准,把 16 种医疗 NLP 任务全转成提示式生成任务——做中医药模型就该用它;
- CMMLU:覆盖 67 个主题的中文综合基准;
- C-Eval:52 个学科、13948 道题,从中学到研究生职业考试;
- HalluQA:450 个对抗性问题,专测模型"一本正经胡说八道"的毛病。
📌 避坑提示:评测集要和你的领域对口。医疗模型只拿 C-Eval 的数学题刷分,相当于拿跨栏杆测 F1 赛车——数字好看,路上照撞。
同一套"选底座 → 造数据 → LoRA 微调 → 部署评测"的流程,换个领域清单里同样有路标:法律方向可看 法律类大模型文档,从獬豸(LawGPT)到 ChatLaw 一整排。
今天把清单克隆下来,照着四步走,你的第一个 7B 垂直模型离你只隔一张 3090。清单还在持续收录新模型与新数据集,下季度你再回头翻一遍,今天的底座旁边可能就多了一个更省显存的版本。
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考