Llama 3 权重下载与跑通全解:从申请签名 URL 到跑起聊天推理只要10分钟
【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3
下载中途被 403 打断、校验环节看到 FAILED 一脸懵?Meta Llama 3 官方仓库提供了从权重到本地推理的最短路径:仓库内含完整的模型实现、推理示例和 download.sh 脚本,一条路走完「下载 → 校验 → 跑通」。本文带你用 10 分钟完成整个流程。
读完你将获得:
- 申请权限、获取签名 URL 的完整流程
- download.sh 脚本的操作与交互式提问应对
- MD5 校验方法与断点防坑手段
- torchrun 推理命令与常见报错速查表
这个仓库能帮你做什么:Llama 3 权重 + 最小推理代码
llama3 是 Meta 官方的 Llama 3 站点,提供 8B 到 70B 参数的预训练与指令微调模型权重,外加一套「加载权重 → 跑推理」的最小代码示例。llama/ 目录下是核心实现(模型、tokenizer、生成逻辑);顶层有两个可直接运行的例子:example_chat_completion.py 对应聊天场景,example_text_completion.py 对应文本续写场景。
动手前先做前置条件检查:
- 装了PyTorch/CUDA的 Python 环境(README 建议用 conda 环境)
- 安装了wget和md5sum(脚本下载与校验都依赖它们)
- 足够磁盘空间:8B 模型是单个权重文件,70B 模型是 8 个分片(
consolidated.0.pth到consolidated.7.pth),体积约为 8B 的 8 倍 - 已在官网同意 Llama 许可并通过审核(下一节细讲)
先申请权限:拿到签名下载 URL
权重下载需要 Meta 审核,不开放直链:
- 访问 Meta Llama 官网,注册账号并同意许可条款
- 申请获批后,会收到一封包含**签名 URL(Presigned URL)**的邮件
- 手动复制该 URL,供下一步粘贴使用
💡 注意:签名链接24 小时后失效,且下载次数有限。后面如果看到
403: Forbidden,基本就是链接过期了,重新申请一个新 URL 即可。
用官方脚本下载权重,应对交互式提问
克隆仓库并进入目录:
# 克隆 llama3 仓库并进入目录 git clone https://gitcode.com/GitHub_Trending/ll/llama3 cd llama3原地安装仓库依赖(会按 requirements.txt 自动装好 torch、fairscale、fire、tiktoken、blobfile):
# 以可编辑模式安装 llama3 包 pip install -e .运行官方下载脚本:
# 运行官方下载脚本 bash download.sh脚本会依次提出两个问题:
- Enter the URL from email—— 粘贴你刚才复制的签名 URL
- Enter the list of models to download—— 用逗号、不带空格地输入
8B、8B-instruct、70B、70B-instruct中的若干项;直接回车则四个全下
预期结果:脚本先下载 LICENSE 与 USE_POLICY,再为每个模型创建独立目录(如Meta-Llama-3-8B-Instruct/),内含consolidated.0.pth权重、params.json、tokenizer.model、checklist.chk;每个模型下载完会自动执行 MD5 校验。
💡 提示:开发测试也可走 Hugging Face 渠道(先在模型页接受许可),
pip install huggingface-hub后用这条命令拉取原生格式权重:# 从 Hugging Face 下载 original 原生权重 huggingface-cli download meta-llama/Meta-Llama-3-8B-Instruct \ --include "original/*" --local-dir Meta-Llama-3-8B-Instruct
用 MD5 校验下载文件,防断点防错包
每个模型目录自带校验清单checklist.chk,随时可以手动复核:
# 手动复核 8B Instruct 模型目录的 MD5 cd Meta-Llama-3-8B-Instruct && md5sum -c checklist.chk结果怎么判读:
- 每行都显示
... OK→ 文件完整,放心继续 - 出现
FAILED→ 对应文件不完整,删除该文件重新下载(wget 支持断点续传),再跑一次校验 - 打开
params.json核对维度、层数、注意力头数、词表大小等关键参数,也能快速确认架构是否符合预期
⚠️ 注意:脚本在 arm64 机器上改用
md5命令、x86 上用md5sum。Apple Silicon 上看到的校验输出会略有差异,含义相同。
用 torchrun 跑起聊天推理,确认模型可用
不同模型需要的并行卡数不同:
| 模型 | nproc_per_node (MP) |
|---|---|
| 8B | 1 |
| 70B | 8 |
以 8B-Instruct 为例运行聊天示例:
# 运行 8B-Instruct 聊天示例,单卡 torchrun --nproc_per_node 1 example_chat_completion.py \ --ckpt_dir Meta-Llama-3-8B-Instruct/ \ --tokenizer_path Meta-Llama-3-8B-Instruct/tokenizer.model \ --max_seq_len 512 --max_batch_size 6预期结果:终端依次打印示例内置的几组对话(蛋黄酱做法、巴黎旅游等)和模型回答,回答后以分隔线收尾——看到这些输出,说明模型已可用。
参数调整提醒:
max_seq_len必须≤ 8192(上下文窗口上限);它和max_batch_size共同决定预分配的 KV cache 大小,显存紧张就调小- 若使用预训练模型(不带 Instruct),模型没针对对话微调,改用 example_text_completion.py,提示词要写成「期望回答是其自然延续」的形式
常见报错与下一步
最容易踩的几个坑速查:
| 报错 | 原因 | 处理 |
|---|---|---|
403: Forbidden | 签名 URL 过期或下载次数用尽 | 重新申请新 URL,再跑 download.sh |
checklist.chk: FAILED | 文件下载不完整 | 删除对应.pth文件,重新下载并校验 |
| OOM / 显存不足 | 70B 需多卡,或 batch 设太大 | 改用 8B,或 70B 按 MP=8 跑 |
接下来你可以立即做三件事:
- 把
ckpt_dir换成自己下载的模型目录,复跑推理示例,感受不同尺寸的效果差异 - 阅读 MODEL_CARD.md,了解模型的能力与局限
- 注意 README 已把本仓库标记为 deprecated——Llama 3.1 起相关内容合并进了 llama-models 系列仓库,需要更新环境时先去那里查看
合规提示:模型使用须遵守 USE_POLICY.md 条款,商用或对外提供服务前请先通读。
【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考