- 文档
- 教程
- 知识库
- 人工智能
【免费下载链接】ai-guide
程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI 工具用法(Cursor / Claude Code / TRAE / Codex / Copilot)、AI 开发框架教程(Spring AI / LangChain)、AI 产品变现指南,帮你快速掌握 AI 技术,走在时代前沿。本项目为开源文档 aiguide,已升级为鱼皮 AI 导航网站
本文以 ai-guide 仓库中 DeepSeek 开源项目 文档为骨架,系统梳理 DeepSeek 官方在 GitHub 开源的十余个模型仓库(R1/V3/V2、Coder 系列、VL 系列、Math、Janus、DreamCraft3D 等),并盘点社区围绕 DeepSeek 构建的集成、部署与复现类开源项目。结合仓库内 DeepSeek 技术解析文档,你将理解每个项目背后的架构要点(MoE、MLA、GRPO、蒸馏等),学会按任务场景快速选型、上手使用。
一、DeepSeek 开源版图:为什么值得关注
DeepSeek 自 2023 年成立以来,以"开源 + 高性价比"路线在基础大模型赛道快速站稳脚跟。据仓库内技术解析文档,DeepSeek 于 2023 年 11 月发布 DeepSeek Coder,随后推出 DeepSeek LLM 67B;2024 年 5 月 DeepSeek-V2 以多头潜在注意力(MLA)与高性价比引发市场关注;2025 年 1 月开源的 DeepSeek-R1 更将开源模型的推理能力推至新高度,可对标 OpenAI 闭源的 o1 系列模型(详见 DeepSeek技术解读:从V3到R1的MoE架构创新)。
目前 DeepSeek 的官方开源仓库分布在 GitHub 的 deepseek-ai 组织下,覆盖通用语言模型、推理模型、代码模型、数学模型、多模态视觉-语言模型、多模态生成模型六大类;同时社区生态中也涌现出集成、复现、部署三大类衍生项目。先看官方开源项目的完整清单:
| 项目名称 | 项目链接 | 简介 |
|---|---|---|
| DeepSeek-R1 | https://github.com/deepseek-ai/DeepSeek-R1 | DeepSeek的旗舰语言模型,提供高质量的响应,支持多种自然语言处理任务 |
| DeepSeek-V3 | https://github.com/deepseek-ai/DeepSeek-V3 | DeepSeek的第三个版本,采用创新的混合专家架构(MoE),支持多模态搜索 |
| DeepSeek-V2 | https://github.com/deepseek-ai/DeepSeek-V2 | 一款强大、经济高效的专家混合语言模型 |
| DeepSeek-Coder-V2 | https://github.com/deepseek-ai/DeepSeek-Coder-V2 | 采用混合专家(Mixture-of-Experts,MoE)架构,突破闭源模型在代码智能中的壁垒 |
| DeepSeek-Coder | https://github.com/deepseek-ai/DeepSeek-Coder | 用于辅助代码编写的AI工具,支持多种编程语言 |
| DeepSeek-LLM | https://github.com/deepseek-ai/DeepSeek-LLM | 提供准确可靠答案的综合语言模型 |
| Janus | https://github.com/deepseek-ai/Janus | 统一的多模态理解与生成模型 |
| DreamCraft3D | https://github.com/deepseek-ai/DreamCraft3D | 基于引导扩散先验的分层3D生成模型的官方实现 |
| DeepSeek-Math | https://github.com/deepseek-ai/DeepSeek-Math | 通过增强模型的数学理解和推理能力,突破传统语言模型在数学领域的限制,可处理符号计算、定理证明等复杂数学推理任务 |
| DeepSeek-MoE | https://github.com/deepseek-ai/DeepSeek-MoE | 创新的混合专家架构模型,支持高效推理 |
| DeepSeek-VL2 | https://github.com/deepseek-ai/DeepSeek-VL2 | 用于先进多模态理解的专家混合视觉-语言模型 |
| DeepSeek-VL | https://github.com/deepseek-ai/DeepSeek-VL | 通过深度学习技术增强视觉和语言的融合,解决复杂的视觉-语言任务 |
二、官方开源项目逐个拆解
2.1 DeepSeek-R1:旗舰推理模型
DeepSeek-R1 是 DeepSeek 的旗舰推理(Reasoning)模型,也是当前开源世界中推理能力最具代表性的作品之一。它建立在 DeepSeek-V3 的 MoE 架构之上,总参数 671B、每个 Token 激活 37B 参数,上下文长度 128K。
据仓库内 DeepSeek-R1的四个训练阶段 文档,R1 的训练分为两个 SFT 阶段和两个 RL 阶段:
- 冷启动(CoT SFT):用人工收集的数千条高质量长链思维(CoT)数据对基座模型 DeepSeek-V3-Base 做监督微调,解决直接从基座启动强化学习导致的输出混乱、语言混杂问题;
- 面向推理的强化学习(RL):采用 GRPO(分组相对策略优化)算法,以准确性奖励 + 格式奖励 + 语言一致性奖励驱动模型在数学、代码、科学等推理密集型任务上提升;
- 拒绝采样与 SFT:从上一阶段 RL 检查点做拒绝采样,筛选出约 60 万条高质量推理轨迹,再混合约 20 万条非推理数据(写作、事实问答等),对模型进行两轮监督微调;
- 全场景强化学习与对齐:推理任务沿用规则奖励,通用任务使用奖励模型评估人类偏好,最终得到兼顾推理能力、实用性与无害性的 R1 模型。
R1 仓库还包含其"无监督觉醒"前身DeepSeek-R1-Zero(纯强化学习、无 SFT 训练的实验模型,验证了大模型推理能力可以仅通过 RL 涌现)以及蒸馏出的DeepSeek-R1-Distill 系列小模型。据仓库技术文档,蒸馏系列覆盖 Qwen2.5(1.5B/7B/14B/32B)与 Llama(8B/70B)等多个基座,使 Dense 稠密小模型也获得不错的推理能力,适合资源受限场景(详见 DeepSeek技术解读:从V3到R1的MoE架构创新)。
2.2 DeepSeek-V3:MoE 架构的通用基座
DeepSeek-V3 是 R1 的基座模型,也是 DeepSeek 技术创新的集大成者。据仓库技术解析文档,其关键架构事实包括:
- 参数规模:总参数 671B,每个 Token 仅激活约 37B 参数,参数量与 GPT-4 大致同一数量级;
- DeepSeekMoE 架构:每个 MoE 层包含 1 个共享专家 + 256 个路由专家,全模型共 58 个 MoE 层、14906 个专家,每个 Token 激活 8 个路由专家;共享专家负责提取跨任务的共性特征以减少参数冗余,路由专家按门控权重被稀疏激活;
- 多头潜在注意力(MLA):对注意力键值做低秩联合压缩,显著减小 KV 缓存、降低推理内存占用与成本;
- 无辅助损失负载均衡:为每个专家维护可动态调整的偏置项,在不引入辅助损失函数的前提下平衡专家负载,避免"路由崩溃",并辅以序列级负载均衡;
- 多令牌预测(MTP):主模型之外叠加 MTP 模块同时预测多个未来 Token,提升训练数据利用效率与推理生成速度;
- 高效训练体系:基于自研 HAI-LLM 框架,使用 FP8 混合精度训练、DualPipe 双向流水线、跨节点 All-to-All 通信内核等软硬件协同优化,以 14.8 万亿 Token 数据完成预训练,上下文分两阶段扩展到 128K。
对于想要低成本自建大模型基座、做二次微调或部署到私有环境的团队,V3 仓库是首选入口;对推理链路、成本控制等技术细节感兴趣的读者,可进一步阅读仓库内 DeepSeek-V3 高效训练关键技术分析。
2.3 DeepSeek-V2:经济高效的 MoE 先导
DeepSeek-V2 发布于 2024 年 5 月,是 DeepSeek 在 MoE 架构上打出的重要一役。它是首个大规模引入多头潜在注意力(MLA)的模型,通过将 KV 缓存压缩为低秩潜向量,大幅降低推理时的显存与带宽开销;配合 DeepSeekMoE 架构,实现了高性价比的推理。据仓库技术文档,V2 之后 DeepSeek 还发布了 V2.5 迭代版本,并用于生成 V3 的非推理 SFT 数据。V2 仓库适合研究 MLA 机制演进与 MoE 负载均衡策略的开发者,其架构思路在 V3、R1 中得到了延续。
2.4 DeepSeek-Coder 系列:代码智能双雄
- DeepSeek-Coder:DeepSeek 最早发布的代码模型(2023 年 11 月),支持多种编程语言,用于辅助代码编写、代码补全与生成任务,是 DeepSeek 切入基础大模型赛道的起点。
- DeepSeek-Coder-V2:在 Coder 基础上引入混合专家(MoE)架构,主打"突破闭源模型在代码智能中的壁垒"。据仓库内学习资料,其对应论文《DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence》介绍了从数据构建、预训练、指令微调到强化学习的完整训练流程。
两个仓库均提供模型权重、推理脚本与评测配置,是研究开源代码大模型、搭建企业级代码智能助手的重要参考。
2.5 DeepSeek-LLM:通用语言基座
DeepSeek-LLM 是 DeepSeek 的通用语言模型(含 67B 参数版本),提供准确可靠的自然语言问答能力。据仓库学习资料中收录的论文摘要,该项目在扩展开源语言模型方面的做法是使用约 2 万亿 Token 的多语言数据集进行预训练。它适合作为理解 DeepSeek 早期训练路线(预训练数据配比、SFT、RLHF 对齐)的起点仓库。
2.6 DeepSeek-Math:数学推理专项
DeepSeek-Math 专注数学理解与推理,通过增强模型的数学能力,突破传统语言模型在数学领域的限制,能够处理符号计算、定理证明等更复杂的数学推理任务。它可作为数学解题、科研辅助、教育场景模型的选型参考,也为理解 R1 系列"以数学/代码为 RL 训练主战场"的思路提供了背景。
2.7 DeepSeek-MoE:混合专家架构实验场
DeepSeek-MoE 是 DeepSeek 在 MoE 路线上的早期实验仓库,验证了混合专家架构在训练与推理上的可行性,主打高效推理。相比 V2/V3 的成熟产品级实现,该仓库更适合研究者追溯 MoE 架构在 DeepSeek 内部从实验到落地的演进脉络。
2.8 DeepSeek-VL / DeepSeek-VL2:视觉-语言理解
- DeepSeek-VL:通过深度学习技术增强视觉与语言的融合,解决复杂的视觉-语言任务,是 DeepSeek 在 2024 年初推出的多模态模型(对应论文为《DeepSeek-VL: Towards Real-World Vision-Language Understanding》)。
- DeepSeek-VL2:升级为专家混合(MoE)架构的视觉-语言模型,用于更先进的多模态理解,在图文理解、视觉问答、文档解析等场景表现更优。
这两个仓库适合对开源多模态模型、图文检索与视觉问答感兴趣的开发者,也便于理解 DeepSeek 如何将 MoE 技术从纯语言模型迁移到多模态领域。
2.9 Janus:统一多模态理解与生成
Janus 是 DeepSeek 提出的"统一多模态理解与生成"模型。与常见的"编码器 + 扩散解码器"两段式方案不同,Janus 在单一模型中同时处理图像理解(自回归)与图像生成(扩散)任务,其设计思路对研究多模态大模型架构融合具有参考价值。仓库提供模型权重、训练代码与评测脚本,适合作为多模态生成研究的基线。
2.10 DreamCraft3D:3D 内容生成
DreamCraft3D 是基于引导扩散先验的分层 3D 生成模型的官方实现。它将扩散模型(如 2D 扩散先验)引入 3D 生成管线,通过多阶段优化从单张图片生成高质量 3D 资产,属于 DeepSeek 官方开源项目中少见的 3D 生成方向。对 3D 资产生成、NeRF/3DGS 相关方向感兴趣的开发者可以直接在本仓库中获取完整训练与推理代码。
三、其他相关 DeepSeek 开源项目
围绕 DeepSeek,社区形成了覆盖 API 集成、免费接入、桌面客户端、算法复现、部署教程等维度的衍生生态。完整清单如下:
| 项目名称 | 项目链接 | 简介 |
|---|---|---|
| DeepSeek-API-Integration | https://github.com/deepseek-ai/awesome-deepseek-integration | 整理了DeepSeek API的集成应用,支持多种平台和语言 |
| GPT4Free | https://github.com/xtekky/gpt4free | 提供免费访问DeepSeek V3 & R1等模型的接口 |
| CherryStudio | https://github.com/CherryHQ/cherry-studio | 支持包括DeepSeek-R1在内的多款LLM的桌面客户端 |
| TinyZero | https://github.com/Jiayi-Pan/TinyZero | 伯克利团队复现DeepSeek R1-Zero的项目 |
| simpleRL-reason | https://github.com/hkust-nlp/simpleRL-reason | 港科大团队复现DeepSeek R1-Zero和R1的项目 |
| DeepSeek-Free | https://github.com/deepseek-free/deepseek-free | 提供DeepSeek部署教程和免费API接口 |
| Unlock-DeepSeek | https://github.com/datawhalechina/unlock-deepseek | 面向AI研究爱好者的DeepSeek系列工作解读和复现 |
3.1 DeepSeek-API-Integration(awesome-deepseek-integration)
由 DeepSeek 官方(deepseek-ai 组织)维护的 API 集成资源合集,汇总了多种平台、多种语言调用 DeepSeek API 的接入示例与第三方应用。它是开发者接入 DeepSeek API 时的第一站:无论你使用 Python、JavaScript/TypeScript、Java,还是需要在微信机器人、Web 应用、IDE 插件等场景中接入,都可以在此仓库找到可复用的集成代码。配合 DeepSeek 官方链接 文档中收录的官方 API 文档入口,可快速完成鉴权、调用与错误排查。
3.2 GPT4Free
GPT4Free 是一个提供免费大模型接口的知名开源项目,其功能列表中包含对 DeepSeek V3 & R1 等模型的访问接口。适合个人学习、低流量实验场景,用于快速验证 DeepSeek 模型的输出效果;若用于生产环境,应优先考虑官方 API 或自建部署,以保障服务稳定性与数据安全。
3.3 CherryStudio
CherryStudio 是支持多款 LLM 的桌面客户端,内置对 DeepSeek-R1 等模型的支持,可同时管理 API 调用与本地模型。据仓库内 DeepSeek 学习资料 收录的教程,社区常用"CherryStudio + 硅基流动"的方式实现 DeepSeek 的零代码本地部署,尤其适合算力有限、又希望保护数据隐私的个人用户。这也是普通用户体验 DeepSeek-R1 满血版的最便捷入口之一。
3.4 TinyZero 与 simpleRL-reason:R1 的复现研究
- TinyZero:加州大学伯克利分校团队的项目,复现 DeepSeek R1-Zero 的纯强化学习路线。其价值在于以极低成本验证"无监督微调、纯 RL 即可涌现推理能力"这一核心发现,为学术研究和小规模复现提供了轻量基线。
- simpleRL-reason:香港科技大学 NLP 团队的项目,复现 DeepSeek R1-Zero 和 R1 的强化学习训练流程,代码结构简洁,适合作为 RL 训练推理模型的入门教材。
两者都是理解 R1 训练机制(GRPO、规则奖励、格式奖励、语言一致性奖励)的重要参考实现,与仓库内 DeepSeek-R1的四个训练阶段 文档相互印证。
3.5 DeepSeek-Free 与 Unlock-DeepSeek:部署与学习
- DeepSeek-Free:提供 DeepSeek 部署教程与免费 API 接口,目标用户是希望低成本快速体验或部署 DeepSeek 模型的开发者和个人用户。仓库内 DeepSeek 官方链接 文档也收录了该团队整理的免费使用指南。
- Unlock-DeepSeek:由 Datawhale 开源社区维护,面向 AI 研究爱好者对 DeepSeek 系列工作进行解读和复现,覆盖 R1/V3 等核心模型的技术拆解与代码实践,是系统学习 DeepSeek 原理的优质中文资料。
四、选型与上手建议
综合官方仓库与社区项目,可以按以下思路快速落地:
- 按任务选模型:推理密集型任务(数学、代码、逻辑)优先选择 DeepSeek-R1 或其蒸馏小模型(如 R1-Distill-Qwen-32B、R1-Distill-Llama-70B);通用对话、内容创作、知识问答等场景选择 DeepSeek-V3;需要视觉理解选择 DeepSeek-VL2;代码补全与生成选择 DeepSeek-Coder-V2。
- 按接入方式选路径:需要稳定生产服务时,使用 DeepSeek 官方 API(参考 awesome-deepseek-integration 的集成示例);对数据隐私敏感或追求可控性时,参考 DeepSeek-Free 的部署教程做私有化部署;个人体验与调试则可用 CherryStudio 桌面客户端快速上手。
- 按研究目的选仓库:研究 MoE 架构与训练效率看 V3 与 DeepSeek-MoE;研究强化学习推理复现看 TinyZero 与 simpleRL-reason;系统学习系列技术解读看 Unlock-DeepSeek 及仓库内技术解析文档。
五、延伸阅读
- DeepSeek 开源项目(本文出处)
- DeepSeek 官方链接:官网、网页版、App、GitHub 组织与社区账号
- DeepSeek 学习资料:教程、论文与技术研究资料汇总
- DeepSeek 资源汇总首页
- DeepSeek技术解读:从V3到R1的MoE架构创新:MLA、DeepSeekMoE、FP8、DualPipe 架构详解
- DeepSeek-R1 技术全景解析:V3 / R1-Zero / R1 三条技术路线对比
- DeepSeek-R1的四个训练阶段:R1 冷启动、推理 RL、拒绝采样 SFT、全场景 RL 四阶段
- DeepSeek-V3 高效训练关键技术分析:从模型架构、并行策略、通信优化到显存优化
- 文档
- 教程
- 知识库
- 人工智能
【免费下载链接】ai-guide
程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI 工具用法(Cursor / Claude Code / TRAE / Codex / Copilot)、AI 开发框架教程(Spring AI / LangChain)、AI 产品变现指南,帮你快速掌握 AI 技术,走在时代前沿。本项目为开源文档 aiguide,已升级为鱼皮 AI 导航网站
相关推荐
vue-i18n 工具链全景指南:官方插件、Loader、模块与第三方生态
vue i18n 工具链全景指南:官方插件、Loader、模块与第三方生态 vue i18n 是 Vue.js 的国际化(i18n)插件,围绕它官方与社区沉淀了
前端国际化Rust 工具链全景指南:为 C 开发者准备的 Rust Tooling Ecosystem 速查手册
Rust 工具链全景指南:为 C 开发者准备的 Rust Tooling Ecosystem 速查手册 本文基于 RustTraining 仓库 csharp
文档教程SenseVoice开源生态全景:从模型到生产环境的第三方工具链与社区贡献指南
SenseVoice开源生态全景:从模型到生产环境的第三方工具链与社区贡献指南 引言:为什么选择SenseVoice生态? 语音识别技术在智能交互、语音助手、无
人工智能大模型语音音频微调本地部署
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考