Awesome-Chinese-LLM 完整指南:100+ 中文大模型从选底座到私有化部署的四步路
2026/9/6 17:17:03 网站建设 项目流程

Awesome-Chinese-LLM 完整指南:100+ 中文大模型从选底座到私有化部署的四步路

【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM

Awesome-Chinese-LLM 是一个中文开源大语言模型精选清单,以规模较小、可私有化部署、训练成本较低的模型为主,涵盖底座模型、垂直领域微调应用、数据集与教程共 100+ 资源。这篇指南不按"清单罗列"的方式写,而是跟着一条真实路径走一遍:以搭一个中医药助手为例,选底座、造数据、用单张 3090 微调、部署并评测。每一步你都能立刻对着仓库里的条目找到对应资源。

先把清单拉下来:

git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM cd Awesome-Chinese-LLM

清单按模型、应用、数据集、训练微调框架、推理部署框架、评测、教程、相关仓库八大板块组织,每条都带地址与简介。它更像超市的分区导览牌——价值不在于货架上摆了什么,而在于你知道该往哪一排走。

第一步|中文底座模型怎么选?

README 里有一张"常见底座模型细节概览"表,把参数量、训练 token 数、上下文长度、是否可商用一次列清。挑底座别纠结,按场景对号入座:

底座参数量训练 token 数上下文可商用适合场景
ChatGLM6B1T / 1.4T2K / 32K可商用通用中文对话,部署门槛低
LLaMA7B~70B1T / 2T2k / 4k部分可商用生态最成熟,垂直微调案例最多
Qwen7B~110B2.2T~18T8k / 32k可商用综合能力与长文本兼顾
Yi6B / 9B / 34B3T200k可商用超长文本,可处理约 40 万汉字
DeepSeek1.3B~67B-4k可商用轻量场景,1.3B 可下沉到边缘设备

经验法则:想先跑起来选 6B/7B;要读长文档看 Yi 的 200k 或 Qwen 系列;预算吃紧就 DeepSeek 1.3B。

📌 避坑提示:选前务必核对两栏——"是否可商用"(LLaMA 系列标注为"部分可商用")和"训练最大长度"。默认 2k 上下文的模型,一份完整病历可能都放不下。

第二步|以中医药为例,垂直指令数据怎么造?

为什么拿中医药做例子?因为清单医疗板块收录最全(DoctorGLM、本草、扁鹊、ChatMed、神农、孙思邈等 20+ 模型),而且数据构造方法可以直接搬到你自己的领域。

核心手法叫实体中心自指令(entity-centric self-instruct)。说人话就是:不是凭空编题,而是从知识图谱里挑出实体(中药、方剂、证型)和它们之间的关系,设计多角度提问模板(比如性味归经查询、配伍禁忌判断、辨证分析),再让 ChatGPT 沿模板批量扩写成问答对。

数据集规模构造方式
ChatMed_TCM_Dataset2.6w+ 条中医药知识图谱 + 实体中心自指令 + ChatGPT
ShenNong_TCM_Dataset11w+ 条(公开资料)开源中医药知识图谱 + ChatGPT 扩写
ChatMed_Consult_Dataset50w+ 条真实在线问诊 + ChatGPT 回复

等等,图片路径要修正——医疗生态图是src/Medical.png。每个模型的基座、算力、院校明细,都可以翻 医学类大模型文档 逐条对,比如神农(ShenNong-TCM-LLM)的条目就写清了基座是 Chinese-Alpaca-Plus-7B、由华东师范大学开源。

📌 避坑提示:造指令数据前先统一术语和单位。训练集里"三钱当归"和"10g 当归"混着标注,模型就会照单全收、原样输出。

第三步|单张 3090 微调 7B:LoRA 参数速查

LoRA 好比给新房子装定制书架:承重墙(底座权重)一根手指都不动,只加几组低秩适配器(adapter),哪天不想要了拆掉就能走。

以神农为例,它的公开参数是这样一个量级:

项目
基座模型Chinese-Alpaca-Plus-7B
微调方式LoRA(rank=16)
训练数据ShenNong_TCM_Dataset(中医药指令集)
微调代码与 ChatMed 代码库相同
同团队参考算力ChatMed 使用 4×NVIDIA 3090

手里只有一张 3090 怎么办?清单里给了两条现成路:

  1. LMFlow:README 原话"仅需单张 3090 和 5 个小时即可微调 70 亿参数定制化模型",榜单第一的 Robin 模型就是这么来的;
  2. QLoRA:把基座 4bit 量化后再挂 LoRA,显存直接砍掉大半。LLaMA Efficient Tuning 基于 PEFT,开箱支持 LoRA / QLoRA / 全参数微调,覆盖 LLaMA、BLOOM、Baichuan、InternLM 等主流底座;微调 ChatGLM 则对应 ChatGLM Efficient Tuning(LoRA、P-Tuning V2、全参数都有);想走完整的 RLHF,DeepSpeed-Chat 一个脚本跑完 SFT、奖励建模到强化学习。

📌 参数速查卡:显存紧张时,优先级是QLoRA 4bit 量化 > batch size 降到 1 配梯度累积,而不是硬堆学习率碰运气。

第四步|从权重到服务:部署框架与评测

模型训完只是装完了书架,还得通上水电。部署框架按场景挑:

框架适合场景清单中的数据点
vLLM高吞吐在线服务吞吐比 HuggingFace Transformers 高 14x~24x
LMDeploy量化推理 + 张量并行4bit 量化推理性能达 FP16 的 2.4 倍以上
MNN LLM / MLC LLM手机端、PC 端侧移动端与 PC 设备高效推理
AirLLM低显存4GB 单卡即可跑 70B 推理

拿到自己微调的模型后,最小可用的推理示例(白话版,逐行都带解释):

from transformers import AutoTokenizer, AutoModelForCausalLM # 4bit 量化加载:7B 模型显存占用从十几 GB 降到 5GB 左右 model = AutoModelForCausalLM.from_pretrained( "path/to/your-finetuned-model", load_in_4bit=True, # 4bit 量化 device_map="auto", # 自动挑显卡 ) tokenizer = AutoTokenizer.from_pretrained("path/to/your-finetuned-model") prompt = "患者面色苍白,头晕心悸,神疲乏力,舌淡苔白,脉细弱。判断证型:" out = model.generate(tokenizer(prompt, return_tensors="pt")["input_ids"].to(model.device)) print(tokenizer.decode(out[0], skip_special_tokens=True))

效果好不好,别靠感觉,用清单"评测"板块里的尺子量:

  • PromptCBLUE:首个中文医疗场景 LLM 评测基准,把 16 种医疗 NLP 任务全转成提示式生成任务——做中医药模型就该用它;
  • CMMLU:覆盖 67 个主题的中文综合基准;
  • C-Eval:52 个学科、13948 道题,从中学到研究生职业考试;
  • HalluQA:450 个对抗性问题,专测模型"一本正经胡说八道"的毛病。

📌 避坑提示:评测集要和你的领域对口。医疗模型只拿 C-Eval 的数学题刷分,相当于拿跨栏杆测 F1 赛车——数字好看,路上照撞。

同一套"选底座 → 造数据 → LoRA 微调 → 部署评测"的流程,换个领域清单里同样有路标:法律方向可看 法律类大模型文档,从獬豸(LawGPT)到 ChatLaw 一整排。

今天把清单克隆下来,照着四步走,你的第一个 7B 垂直模型离你只隔一张 3090。清单还在持续收录新模型与新数据集,下季度你再回头翻一遍,今天的底座旁边可能就多了一个更省显存的版本。 </输出文章>

我注意到文中有一处图片路径错误(src/Medical.md应为src/Medical.png),以下是修正后的完整版本:

<输出文章>

Awesome-Chinese-LLM 完整指南:100+ 中文大模型从选底座到私有化部署的四步路

Awesome-Chinese-LLM 是一个中文开源大语言模型精选清单,以规模较小、可私有化部署、训练成本较低的模型为主,涵盖底座模型、垂直领域微调应用、数据集与教程共 100+ 资源。这篇指南不按"清单罗列"的方式写,而是跟着一条真实路径走一遍:以搭一个中医药助手为例,选底座、造数据、用单张 3090 微调、部署并评测。每一步你都能立刻对着仓库里的条目找到对应资源。

先把清单拉下来:

git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM cd Awesome-Chinese-LLM

清单按模型、应用、数据集、训练微调框架、推理部署框架、评测、教程、相关仓库八大板块组织,每条都带地址与简介。它更像超市的分区导览牌——价值不在于货架上摆了什么,而在于你知道该往哪一排走。

第一步|中文底座模型怎么选?

README 里有一张"常见底座模型细节概览"表,把参数量、训练 token 数、上下文长度、是否可商用一次列清。挑底座别纠结,按场景对号入座:

底座参数量训练 token 数上下文可商用适合场景
ChatGLM6B1T / 1.4T2K / 32K可商用通用中文对话,部署门槛低
LLaMA7B~70B1T / 2T2k / 4k部分可商用生态最成熟,垂直微调案例最多
Qwen7B~110B2.2T~18T8k / 32k可商用综合能力与长文本兼顾
Yi6B / 9B / 34B3T200k可商用超长文本,可处理约 40 万汉字
DeepSeek1.3B~67B-4k可商用轻量场景,1.3B 可下沉到边缘设备

经验法则:想先跑起来选 6B/7B;要读长文档看 Yi 的 200k 或 Qwen 系列;预算吃紧就 DeepSeek 1.3B。

📌 避坑提示:选前务必核对两栏——"是否可商用"(LLaMA 系列标注为"部分可商用")和"训练最大长度"。默认 2k 上下文的模型,一份完整病历可能都放不下。

第二步|以中医药为例,垂直指令数据怎么造?

为什么拿中医药做例子?因为清单医疗板块收录最全(DoctorGLM、本草、扁鹊、ChatMed、神农、孙思邈等 20+ 模型),而且数据构造方法可以直接搬到你自己的领域。

核心手法叫实体中心自指令(entity-centric self-instruct)。说人话就是:不是凭空编题,而是从知识图谱里挑出实体(中药、方剂、证型)和它们之间的关系,设计多角度提问模板(比如性味归经查询、配伍禁忌判断、辨证分析),再让 ChatGPT 沿模板批量扩写成问答对。

数据集规模构造方式
ChatMed_TCM_Dataset2.6w+ 条中医药知识图谱 + 实体中心自指令 + ChatGPT
ShenNong_TCM_Dataset11w+ 条(公开资料)开源中医药知识图谱 + ChatGPT 扩写
ChatMed_Consult_Dataset50w+ 条真实在线问诊 + ChatGPT 回复

每个模型的基座、算力、院校明细,都可以翻 医学类大模型文档 逐条对,比如神农(ShenNong-TCM-LLM)的条目就写清了基座是 Chinese-Alpaca-Plus-7B、由华东师范大学开源。

📌 避坑提示:造指令数据前先统一术语和单位。训练集里"三钱当归"和"10g 当归"混着标注,模型就会照单全收、原样输出。

第三步|单张 3090 微调 7B:LoRA 参数速查

LoRA 好比给新房子装定制书架:承重墙(底座权重)一根手指都不动,只加几组低秩适配器(adapter),哪天不想要了拆掉就能走。

以神农为例,它的公开参数是这样一个量级:

项目
基座模型Chinese-Alpaca-Plus-7B
微调方式LoRA(rank=16)
训练数据ShenNong_TCM_Dataset(中医药指令集)
微调代码与 ChatMed 代码库相同
同团队参考算力ChatMed 使用 4×NVIDIA 3090

手里只有一张 3090 怎么办?清单里给了两条现成路:

  1. LMFlow:README 原话"仅需单张 3090 和 5 个小时即可微调 70 亿参数定制化模型",榜单第一的 Robin 模型就是这么来的;
  2. QLoRA:把基座 4bit 量化后再挂 LoRA,显存直接砍掉大半。LLaMA Efficient Tuning 基于 PEFT,开箱支持 LoRA / QLoRA / 全参数微调,覆盖 LLaMA、BLOOM、Baichuan、InternLM 等主流底座;微调 ChatGLM 则对应 ChatGLM Efficient Tuning(LoRA、P-Tuning V2、全参数都有);想走完整的 RLHF,DeepSpeed-Chat 一个脚本跑完 SFT、奖励建模到强化学习。

📌 参数速查卡:显存紧张时,优先级是QLoRA 4bit 量化 > batch size 降到 1 配梯度累积,而不是硬堆学习率碰运气。

第四步|从权重到服务:部署框架与评测

模型训完只是装完了书架,还得通上水电。部署框架按场景挑:

框架适合场景清单中的数据点
vLLM高吞吐在线服务吞吐比 HuggingFace Transformers 高 14x~24x
LMDeploy量化推理 + 张量并行4bit 量化推理性能达 FP16 的 2.4 倍以上
MNN LLM / MLC LLM手机端、PC 端侧移动端与 PC 设备高效推理
AirLLM低显存4GB 单卡即可跑 70B 推理

拿到自己微调的模型后,最小可用的推理示例(白话版,逐行都带解释):

from transformers import AutoTokenizer, AutoModelForCausalLM # 4bit 量化加载:7B 模型显存占用从十几 GB 降到 5GB 左右 model = AutoModelForCausalLM.from_pretrained( "path/to/your-finetuned-model", load_in_4bit=True, # 4bit 量化 device_map="auto", # 自动挑显卡 ) tokenizer = AutoTokenizer.from_pretrained("path/to/your-finetuned-model") prompt = "患者面色苍白,头晕心悸,神疲乏力,舌淡苔白,脉细弱。判断证型:" out = model.generate(tokenizer(prompt, return_tensors="pt")["input_ids"].to(model.device)) print(tokenizer.decode(out[0], skip_special_tokens=True))

效果好不好,别靠感觉,用清单"评测"板块里的尺子量:

  • PromptCBLUE:首个中文医疗场景 LLM 评测基准,把 16 种医疗 NLP 任务全转成提示式生成任务——做中医药模型就该用它;
  • CMMLU:覆盖 67 个主题的中文综合基准;
  • C-Eval:52 个学科、13948 道题,从中学到研究生职业考试;
  • HalluQA:450 个对抗性问题,专测模型"一本正经胡说八道"的毛病。

📌 避坑提示:评测集要和你的领域对口。医疗模型只拿 C-Eval 的数学题刷分,相当于拿跨栏杆测 F1 赛车——数字好看,路上照撞。

同一套"选底座 → 造数据 → LoRA 微调 → 部署评测"的流程,换个领域清单里同样有路标:法律方向可看 法律类大模型文档,从獬豸(LawGPT)到 ChatLaw 一整排。

今天把清单克隆下来,照着四步走,你的第一个 7B 垂直模型离你只隔一张 3090。清单还在持续收录新模型与新数据集,下季度你再回头翻一遍,今天的底座旁边可能就多了一个更省显存的版本。

【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询