Llama 3 权重下载与跑通全解:从申请签名 URL 到跑起聊天推理只要10分钟
2026/9/21 20:00:52 网站建设 项目流程

Llama 3 权重下载与跑通全解:从申请签名 URL 到跑起聊天推理只要10分钟

【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3

下载中途被 403 打断、校验环节看到 FAILED 一脸懵?Meta Llama 3 官方仓库提供了从权重到本地推理的最短路径:仓库内含完整的模型实现、推理示例和 download.sh 脚本,一条路走完「下载 → 校验 → 跑通」。本文带你用 10 分钟完成整个流程。

读完你将获得:

  • 申请权限、获取签名 URL 的完整流程
  • download.sh 脚本的操作与交互式提问应对
  • MD5 校验方法与断点防坑手段
  • torchrun 推理命令与常见报错速查表

这个仓库能帮你做什么:Llama 3 权重 + 最小推理代码

llama3 是 Meta 官方的 Llama 3 站点,提供 8B 到 70B 参数的预训练指令微调模型权重,外加一套「加载权重 → 跑推理」的最小代码示例。llama/ 目录下是核心实现(模型、tokenizer、生成逻辑);顶层有两个可直接运行的例子:example_chat_completion.py 对应聊天场景,example_text_completion.py 对应文本续写场景。

动手前先做前置条件检查

  • 装了PyTorch/CUDA的 Python 环境(README 建议用 conda 环境)
  • 安装了wgetmd5sum(脚本下载与校验都依赖它们)
  • 足够磁盘空间:8B 模型是单个权重文件,70B 模型是 8 个分片(consolidated.0.pthconsolidated.7.pth),体积约为 8B 的 8 倍
  • 已在官网同意 Llama 许可并通过审核(下一节细讲)

先申请权限:拿到签名下载 URL

权重下载需要 Meta 审核,不开放直链:

  1. 访问 Meta Llama 官网,注册账号并同意许可条款
  2. 申请获批后,会收到一封包含**签名 URL(Presigned URL)**的邮件
  3. 手动复制该 URL,供下一步粘贴使用

💡 注意:签名链接24 小时后失效,且下载次数有限。后面如果看到403: Forbidden,基本就是链接过期了,重新申请一个新 URL 即可。

用官方脚本下载权重,应对交互式提问

克隆仓库并进入目录:

# 克隆 llama3 仓库并进入目录 git clone https://gitcode.com/GitHub_Trending/ll/llama3 cd llama3

原地安装仓库依赖(会按 requirements.txt 自动装好 torch、fairscale、fire、tiktoken、blobfile):

# 以可编辑模式安装 llama3 包 pip install -e .

运行官方下载脚本:

# 运行官方下载脚本 bash download.sh

脚本会依次提出两个问题:

  1. Enter the URL from email—— 粘贴你刚才复制的签名 URL
  2. Enter the list of models to download—— 用逗号、不带空格地输入8B8B-instruct70B70B-instruct中的若干项;直接回车则四个全下

预期结果:脚本先下载 LICENSE 与 USE_POLICY,再为每个模型创建独立目录(如Meta-Llama-3-8B-Instruct/),内含consolidated.0.pth权重、params.jsontokenizer.modelchecklist.chk每个模型下载完会自动执行 MD5 校验

💡 提示:开发测试也可走 Hugging Face 渠道(先在模型页接受许可),pip install huggingface-hub后用这条命令拉取原生格式权重:

# 从 Hugging Face 下载 original 原生权重 huggingface-cli download meta-llama/Meta-Llama-3-8B-Instruct \ --include "original/*" --local-dir Meta-Llama-3-8B-Instruct

用 MD5 校验下载文件,防断点防错包

每个模型目录自带校验清单checklist.chk,随时可以手动复核:

# 手动复核 8B Instruct 模型目录的 MD5 cd Meta-Llama-3-8B-Instruct && md5sum -c checklist.chk

结果怎么判读:

  • 每行都显示... OK→ 文件完整,放心继续
  • 出现FAILED→ 对应文件不完整,删除该文件重新下载(wget 支持断点续传),再跑一次校验
  • 打开params.json核对维度、层数、注意力头数、词表大小等关键参数,也能快速确认架构是否符合预期

⚠️ 注意:脚本在 arm64 机器上改用md5命令、x86 上用md5sum。Apple Silicon 上看到的校验输出会略有差异,含义相同。

用 torchrun 跑起聊天推理,确认模型可用

不同模型需要的并行卡数不同:

模型nproc_per_node (MP)
8B1
70B8

以 8B-Instruct 为例运行聊天示例:

# 运行 8B-Instruct 聊天示例,单卡 torchrun --nproc_per_node 1 example_chat_completion.py \ --ckpt_dir Meta-Llama-3-8B-Instruct/ \ --tokenizer_path Meta-Llama-3-8B-Instruct/tokenizer.model \ --max_seq_len 512 --max_batch_size 6

预期结果:终端依次打印示例内置的几组对话(蛋黄酱做法、巴黎旅游等)和模型回答,回答后以分隔线收尾——看到这些输出,说明模型已可用。

参数调整提醒:

  • max_seq_len必须≤ 8192(上下文窗口上限);它和max_batch_size共同决定预分配的 KV cache 大小,显存紧张就调小
  • 若使用预训练模型(不带 Instruct),模型没针对对话微调,改用 example_text_completion.py,提示词要写成「期望回答是其自然延续」的形式

常见报错与下一步

最容易踩的几个坑速查:

报错原因处理
403: Forbidden签名 URL 过期或下载次数用尽重新申请新 URL,再跑 download.sh
checklist.chk: FAILED文件下载不完整删除对应.pth文件,重新下载并校验
OOM / 显存不足70B 需多卡,或 batch 设太大改用 8B,或 70B 按 MP=8 跑

接下来你可以立即做三件事:

  1. ckpt_dir换成自己下载的模型目录,复跑推理示例,感受不同尺寸的效果差异
  2. 阅读 MODEL_CARD.md,了解模型的能力与局限
  3. 注意 README 已把本仓库标记为 deprecated——Llama 3.1 起相关内容合并进了 llama-models 系列仓库,需要更新环境时先去那里查看

合规提示:模型使用须遵守 USE_POLICY.md 条款,商用或对外提供服务前请先通读。

【免费下载链接】llama3The official Meta Llama 3 GitHub site项目地址: https://gitcode.com/GitHub_Trending/ll/llama3

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询