如果你最近经常刷 AI 新闻,很难不眼花。Qwen、DeepSeek、MiniMax、混元、Wan 接连开源,语言、图片、视频模型一起上新,后面还跟着一排像暗号一样的型号
另一边,越来越多人在买大内存 Mac、迷你主机和大显存显卡,说是要“在本地跑 AI”。普通人最想问的其实就几件事:这些模型有什么用?为什么值得专门买硬件?我的电脑能跑哪个?装好以后又有多好用?
我把这些问题整理成了一张选型地图:先判断自己有没有必要本地部署,再盘一遍当前值得关注的语言、图片和视频模型,顺手讲清名字、参数、压缩版本、使用许可和电脑配置。盘点完,我还会把模型真正装进 Mac 和 Windows,用文字、看图、分镜和视频任务检查它们到底好不好用。
读完之后,你不必记住所有模型,但会知道自己需要哪一类、电脑能不能带动,以及它值不值得你折腾一个晚上。
目录(AI相关文章尾部跳转)
一、为什么大家开始把 AI 搬回家
二、先看面板:五步筛掉不属于你的模型
三、语言赛区:国产六雄比的不是同一件事
四、图片赛区:会画只是入场券
五、视频赛区:最强的模型,可能根本进不了你的显卡
六、硬件赛区:你的电脑,究竟装得下谁?该不该买AIPC?
七、同一张图,两代千问谁更会当导演
八、把提示词交给 H3,成片才是答案
九、最后,给你看一段视频
一、为什么大家开始把 AI 搬回家
大多数人不需要立刻买新电脑。
本地模型有点像把一位 AI 助手搬进家里。云端 AI 住在别人的机房,你通过网络找它干活;本地 AI 住在你的电脑里,文件可以留在本机,断网后也能运行。
你遇到下面任何一种情况,才值得认真研究本地部署:
你的情况 | 本地模型能帮什么 |
|---|---|
经常处理合同、未公开图片或私人素材 | 让文件尽量留在自己的电脑里 |
网络不稳,或者需要离线工作 | 没网时仍能使用 |
每天都要批量整理文件、图片和素材 | 可以和本地文件夹、脚本、剪辑软件配合 |
需要一个长期不变的固定版本 | 自己保留同一份模型,工作流更稳定 |
如果你一个月只问几次问题,只想用最新的模型,也不想处理安装和更新,继续用在线 AI 更省心。本地运行会占磁盘、吃内存或显存,还会用掉时间和电费。
还有一个容易踩坑的词:“开源模型”。
有些模型只是把可运行的文件开放下载,训练数据和训练代码并没有全部公开。更准确的叫法是“开放权重”。这个区别不是学术抬杠,因为能下载,不等于能随意商用。
许可证可以理解成模型自带的“使用合同”。下载前找到模型页里的 License,至少把下面四件事查清楚:
能不能用于收费项目或公司业务;
生成的图片、视频公开发布时,要不要注明 AI 或模型名称;
能不能用自己的材料继续训练,或者和别的模型合并,做成自己的版本;
能不能把原模型或修改后的版本再次分享给别人。
Apache 2.0、MIT 通常比较宽松,但仍可能要求保留版权与许可说明;Non-Commercial 表示模型文件只能用于非商业场景。厂商自己写的社区许可,还可能限制商用规模、要求发布时注明模型,或者限制使用地区。只看“开源”两个字就默认什么都能做,很容易出问题。
二、先看面板:五步筛掉不属于你的模型
完整模型名被拆成四段信息,按顺序看就行。
先拿一个真实跑过的名字开刀:
Qwen3.5-35B-A3B-6bit
它像 Wi-Fi 密码,其实只要拆成四块:
你看到的 | 翻译成人话 | 对选型有什么用 |
|---|---|---|
Qwen3.5 | 品牌和版本 | 用来区分家族与代际 |
35B | 模型总共约 350 亿参数 | 数字越大,通常越占空间 |
A3B | 每次干活时大约启用 30 亿参数 | 它用了“专家分工”的 MoE 结构 |
6bit | 压缩后的精度 | 位数越低,通常越省内存 |
模型名里的 B 约等于十亿,T 约等于一万亿。参数量可以粗略帮你判断模型有多大,却不能直接代表它有多聪明。
MoE 可以想成一家有很多专家的公司。所有专家的档案都要存在电脑里,每次任务只请几位出来工作。所以它可能跑得很快,下载文件却依然很大。
再看另一个已经实测的版本:
Qwen3.8-27B-8bit
它没有 A3B,每次任务都会动用整个 27B 模型。这种“全员一起工作”的结构叫稠密模型。所以 3.8 的数字看起来更小,实际运行可能比 3.5 慢很多。
“量化”就是给模型做压缩,4bit / 6bit / 8bit 是不同的压缩档位。压得越厉害,模型越容易装进电脑,回答质量也可能受到影响。选型时先看它能不能装下,再看实测质量。
后缀不用全背。普通用户优先找 Instruct / Chat,这是已经学会按要求回答的版本;Base 主要留给开发者继续训练。Thinking 更愿意花时间推理,通常也更慢;VL / Vision 表示能看图片或视频,但“能看”不等于“能画”。
剩下三个词只管文件怎么运行:MLX 适合 Apple 芯片 Mac;GGUF 是 Mac、Windows、Linux 都常见的格式;safetensors 只是文件格式,不能说明模型强不强。
但看懂名字只是开始。为了不让后面的全景再次变成名单,给你一条五步筛选线:
步骤 | 要回答的问题 | 游戏里的说法 |
|---|---|---|
1. 任务 | 我要聊天、读图、改图,还是生成视频?最终要交付什么? | 先选赛区 |
2. 设备 | 我有多少可用的内存或显存?用 Mac 还是 NVIDIA 显卡? | 看召唤成本 |
3. 许可 | 能否商用、公开发布、继续训练,或者把修改版分享给别人? | 查通行证 |
4. 候选 | 在前三项都满足的模型里留下最多三个 | 组队,不囤卡 |
5. 实测 | 用自己的十个真实任务比较质量、速度和稳定性 | 上场打一局 |
后面看到任何榜单,都按这五步走。先排除用不上、装不下和许可不合适的模型,剩下的才值得下载。
三、语言赛区:国产六雄比的不是同一件事
语言模型榜单很像总成绩表,可榜上的模型并不在做同一份工作。有的负责冲能力上限,有的负责进入普通电脑。看一家厂商时,要把“今年最新的旗舰”与“这家已经开放、适合个人设备的型号”分开。
六家都在做语言模型,但擅长的任务、开放的小型号,以及现成工具和教程的数量都不同。
把六家的官方模型库放在一起看,千问的个人型号最齐;但能在普通电脑上运行的国产模型,远不止千问一家。
表里的“多模态”,指一个模型除了文字,还能处理图片、视频等内容;“长上下文”,指它一次能读进去更多材料。
国产阵营 | 英雄称号 | 2026 年旗舰看什么 | 个人设备有哪些真实入口 | 一句话结论 |
|---|---|---|---|---|
Qwen | 全栈工程师 | Qwen3.8 同时有个人设备可以研究的 27B,以及面向实验和服务器的两款 MoE | Qwen3.5 有 0.8B、2B、4B、9B、35B-A3B,另有 27B 等版本与大量压缩格式 | 尺寸、看图能力和运行格式最齐,最容易找到适合自己电脑的一档 |
DeepSeek | 推理判题王 | V4-Pro-0813、V4-Flash-0731 主攻推理、代码和一次读取很长的材料 | R1 蒸馏版有 1.5B、7B、8B、14B、32B、70B | 个人电脑可以跑 R1 蒸馏版;它学了 R1 的推理方法,并非缩小后的 V4 |
Kimi | 长卷侦察员 | K3 是 2.8T 的多模态旗舰 | Kimi-VL-A3B 和 Moonlight-16B-A3B 都是总参数约 16B、每次激活约 3B | 有个人候选,但型号梯队没有千问那么宽;A3B 也不代表只需存 3B 权重 |
GLM | 任务指挥官 | GLM-5/5.2 面向长任务、代码,以及让 AI 自己调用工具、分多步干活 | GLM-Z1-9B、GLM-4.1V-9B、GLM-4.6V-Flash,以及 31B 的 GLM-4.7-Flash | 文字和看图都有中小型号,普通设备完全可以研究 |
MiniMax | 跨媒体导演 | M3 是 427B、可处理多种内容的旗舰 | 官方有 SynLogic-7B 等专用研究模型,但通用语言主线没有完整的小尺寸梯队 | 普通人想装通用聊天模型,暂时不必优先从 MiniMax 开始 |
混元 | 重工业总工 | Hy3 是 295B 总参数、每次激活约 21B 的 MoE | 通用语言有 0.5B、1.8B、4B、7B;看图还有 Youtu-VL-4B、Penguin-VL-2B/8B | 它和千问一样覆盖小模型,只是社区教程和现成量化相对少 |
“蒸馏”和“A3B”很容易看错。DeepSeek-R1-Distill-Qwen-7B 是把大模型的推理方法教给一个 7B 底座,它不是 DeepSeek V4 的迷你版。Kimi-VL-A3B 的 A3B 表示每次大约激活 3B 参数,完整的 16B 权重仍要下载和存放。
海外模型也有大有小:Gemma 有轻量版本,gpt-oss-20b 适合本地推理和调用工具,Llama 的教程与衍生版本很多,Mistral 则以小模型和多语言见长。按自己的任务挑候选即可,不需要一次全装。
下面先按任务找候选;电脑能装多大的模型,第六章再看。
你要做的事 | 应该找什么能力 | 第一批可测试的国产候选 |
|---|---|---|
日常聊天、改写和文档摘要 | 4B–9B 的 Instruct/Chat 模型 | Qwen3.5-4B/9B、Hunyuan-4B/7B、GLM-Z1-9B |
数学推理、代码分析 | 推理版或代码版,不要求看图 | DeepSeek-R1-Distill-7B/14B、GLM-Z1-9B、Qwen 对应尺寸的推理/代码型号 |
看图片、表格、PDF 和写分镜 | 名字或模型页明确写着 VL/Vision | Qwen3.5-4B/9B、GLM-4.1V-9B、Kimi-VL-A3B、Youtu-VL-4B |
处理很长的材料 | 一次能读进很多内容,还要实测长文是否读得稳 | Kimi-VL-A3B、Qwen 和 GLM 的多模态型号 |
只偶尔写文案、又想用最新旗舰 | 不需要本地部署 | 直接用云端 |
四、图片赛区:会画只是入场券
图片模型已经分出好几门功课:文字排版、修图、角色一致和参考图控制。只看一张官方样片,就像只看球员的定妆照,根本不知道上场会不会掉链子。
先用四个问题缩小范围:你要从零画,还是改现有图片?图里有没有中文?角色要不要一直长得一样?结果准备自己玩,还是拿去接商单?
阵营 | 英雄称号 | 它最适合解决什么 | 使用前先知道 |
|---|---|---|---|
Ideogram 4 | 海报排字手 | 画面里有文字、海报和明确版式 | 这个 NF4 压缩版采用非商业许可,下载前还要同意条款 |
Qwen Image | 中文排版师 | 汉字、信息图和知识型画面 | 在线新版本上线,不等于同名模型文件已经开放;本地安装前要核对官方下载页和许可 |
HiDream-O1-Image | 修图老炮 | 一套模型里做生成、编辑和人物一致 | 采用 MIT 许可,但现成教程和工作流程还不如 Stable Diffusion 多 |
FLUX.2 [dev] | 质感重装画师 | 高质感生成、修图和多张参考图 | 原版体量大,模型许可也不是 Apache/MIT;先找明确的压缩版本和省内存教程 |
Stable Diffusion | 模组百宝箱 | 用风格小模块 LoRA、构图控制工具 ControlNet 和其他插件精确控制画面 | 需要自己组合模型、插件和参数,上手要多花一些时间 |
HunyuanImage 3.0 | 重型图像总工 | 观察生成、理解、编辑和多图融合的能力上限 | 官方本地示例默认使用多张显卡,普通人不适合从它开始 |
不用背这六个名字,按任务留下候选就行:
中文海报和信息图:先看 Qwen Image、Ideogram 4。
修现有图片或保持同一个人物:先看 HiDream-O1-Image、FLUX.2。
固定画风、姿势和构图:Stable Diffusion 的控制工具与教程最多。
观察能力上限可以看 HunyuanImage 3.0;偶尔生成几张图,直接用云端更省事。
接商单时要查两份规则:模型文件能不能商用,生成的图片能不能商用。两者可能不同。一个产品能在线使用,也不能证明它的最新模型文件已经开放下载。
五、视频赛区:最强的模型,可能根本进不了你的显卡
有的模型能自己生成声音,有的主打 720p 单卡运行,还有的只适合研究机构。
视频模型最吃硬件。一张图只处理一个画面,视频还要连续管动作、镜头、角色长相和声音。2026 年的看点已经从“让图片动起来”,变成了能不能听懂参考素材、保持人物一致、控制镜头,甚至把对白和环境声一起做出来。
进步很快,硬件要求也很高。分辨率越高、时长越长,通常越吃显存,也要等得更久。选模型时,要一起看它能接收哪些素材、会不会自己生成声音、实际分辨率、最低显存、耗时和许可证。
阵营 | 英雄称号 | 它最适合解决什么 | 使用前先知道 |
|---|---|---|---|
MiniMax H3 | 声画导演 | 同时参考文字、图片、视频和音频,连画面与立体声一起生成 | 本地 H3-Base 直接生成 768p;做到 2K 还要再跑一套放大流程,并且使用专门的社区许可 |
Wan2.2 TI2V-5B | 720p 实干派 | 用同一个 5B 模型做文生视频和图生视频 | 官方输出为 720p、24fps(每秒 24 帧),采用 Apache 2.0;单张显卡运行时至少需要 24GB 显存 |
HunyuanVideo 1.5 | 显存精算师 | 用“把部分计算暂放到内存”的办法降低显存门槛 | 官方写的最低显存是 14GB,但参考环境是 Linux;Windows 仍需单独实测 |
LTX-2.5 | 声画挑战者 | 自己同时生成画面和声音,支持多镜头,也能用自己的材料继续训练 | 压缩版怎么安装、能否商用,都要按具体版本确认 |
MAGI-2 | 八卡极限组 | 展示开放视频模型的研究上限 | 官方要求八张面向机房的高端 NVIDIA 显卡,个人设备不用考虑 |
选视频模型时,也按任务缩小范围:
画面、对白和环境声一起做:先看 MiniMax H3。
从文字或图片生成标准 720p 短片:先看 Wan2.2 TI2V-5B。
愿意多用系统内存换取更低显存要求:可以研究 HunyuanVideo 1.5。
LTX-2.5 适合继续研究声音、多镜头和训练;MAGI-2 看看结果即可,不必当作个人安装目标。
“消费级”只是说这张显卡普通人可以买到,并不代表每一张消费显卡都能运行同一个模型。
如果只是偶尔生成几支短片,又想随时用最新模型,云端通常更省事。本地视频更适合三类人:愿意等待、会反复使用同一套流程,并且希望素材留在自己电脑里。
六、硬件赛区:你的电脑,究竟装得下谁?该不该买AIPC?
统一内存是 CPU 和 GPU 共用一池资源;普通独立显卡电脑的系统内存和显存则是两池资源,不能直接相加。
模型选型最后会落到一个很朴素的问题:它能不能住进你的电脑?
文中的 CPU 是电脑的主处理器,GPU 是擅长同时做大量计算的图形处理器,也是很多 AI 程序真正使用的部分。
正准备买电脑:先选硬件类型
先别急着比较跑分。2026 年名字里带“AI”的电脑,至少已经分成下面六类。它们的用途差别很大:
硬件类型 | 常见代表 | 适合做什么 | 买前先知道 |
|---|---|---|---|
NPU AI PC | Intel Core Ultra、AMD Ryzen AI、Snapdragon X 系列笔记本 | NPU 是一块低功耗 AI 专用芯片,适合会议降噪、实时字幕、系统搜索和受支持的小模型 | Copilot+ PC 要求 NPU 达到 40+ TOPS。TOPS 是每秒理论计算量,这个数字不能证明机器能流畅运行 27B 大模型 |
Apple 统一内存电脑 | Apple 芯片 Mac | CPU 和负责图形计算的部分共用一大池内存,适合本地语言、看图和 MLX 软件 | 内存大能放下较大的模型,但很多为 NVIDIA 显卡开发的图片、视频插件不能直接在 Mac 上运行 |
大内存 APU / 迷你工作站 | Ryzen AI Max+ 395 一类设备 | APU 可以理解成处理器和集成显卡装在一起并共用内存;这类设备最多有 128GB 统一内存 | 大内存解决模型能否放下,AMD 驱动和具体软件是否支持,才决定它能否顺利运行 |
NVIDIA 独显电脑 | GeForce RTX、RTX PRO 台式机和工作站 | NVIDIA 的 CUDA 加速平台拥有大量现成教程和插件,图片、视频流程最成熟 | 系统内存和显卡自带的显存不能直接相加;能装下模型,也未必跑得快 |
桌面 AI 工作站 | NVIDIA DGX Spark 与其他采用 GB10 芯片的设备 | 配有 128GB 统一内存和整套 NVIDIA AI 软件;官方定位是最高运行 200B 模型、继续训练 70B 模型 | 它采用 Arm 处理器和 DGX OS,软件环境不同于常见的 Windows 电脑。官方说“支持 200B”,也没有承诺所有 200B 模型都跑得快 |
国产 AI 专用机原型 | 小米 AI Cube | 已公开演示在本地切换 120B 大模型和 3B 小模型,说明国产厂商也在做专门运行本地 AI 的桌面盒子 | 目前仍是原型机。价格、量产时间、完整规格和第三方模型兼容性,都还不能当成确定信息 |
选购时可以这样记:AI PC 主要看低功耗 NPU,本地大模型先看内存,本地画图和视频先看显存与软件支持。 TOPS 表示理论计算量,参数量表示模型规模,内存或显存决定模型能否装下。三个数字各管一件事,不能混在一起比较。
已经有电脑:直接看内存或显存
回到目前最常见的个人设备,Mac 和 NVIDIA 台式机的优势也不在同一个地方。
Apple 芯片 Mac 使用“统一内存”,处理器和图形部分可以共用这池内存。它像一间共用仓库,比较容易放下较大的语言和看图模型。但标称容量不会全部交给模型,系统和其他软件也要占一部分。
NVIDIA 显卡则像一张速度很快的专用工作台。图片、视频、ComfyUI 和大量现成插件都优先支持它。但请记住:系统内存和显卡显存是两件事。 比如一台电脑有 32GB 系统内存、8GB 显存,判断图片和视频模型时,先看的仍然是 8GB 显存。
下面这些范围更适合拿来选择第一个模型。机器经过专门调试后可能跑得更多,新手从这里开始更稳妥。语言、图片和视频的要求不同,所以分成两张表。
想聊天、写作、读文档或看图:
你手里的设备 | 建议从哪档开始 | 先明白什么 |
|---|---|---|
只用 CPU,或没有可用的独立显卡 | 1B–4B 量化语言模型 | 能跑,但速度通常慢;先用小模型确认自己是否真有本地需求 |
8–16GB 统一内存的 Apple 芯片 Mac | 1B–7B 量化模型 | 系统也要占内存;8GB 机型要从更小的版本试 |
24–36GB 统一内存的 Apple 芯片 Mac | 7B–14B 量化模型 | 可以把文字和看图模型当主力,但仍要留出系统空间 |
48–64GB 统一内存的 Apple 芯片 Mac | 20B–35B 量化模型,或总体量相近的 MoE | “每次激活得少”会影响速度,不代表整个模型不占内存 |
6–8GB 显存的 NVIDIA 显卡 | 1B–7B 量化模型 | 超出显存后可以借系统内存,但速度会明显变慢 |
12–16GB 显存的 NVIDIA 显卡 | 7B–14B 量化模型 | 适合日常文字、代码和中小型看图模型 |
20–24GB 显存的 NVIDIA 显卡 | 14B–32B 量化模型 | 能不能全放进显存,还要看一次读入多少内容,以及使用什么运行软件 |
48GB 以上显存或多卡 | 更大的量化模型与最新巨型模型 | 开始进入工作站或服务器领域,成本还包括供电、散热和软件配置 |
想在本地画图或生成视频:
你手里的设备 | 图片从哪里开始 | 视频从哪里开始 |
|---|---|---|
没有独立显卡 | 优先用云端,或只测有原生支持的轻量图片模型 | 不建议把本地视频当第一个部署项目 |
Apple 芯片 Mac | 可以跑明确支持 macOS 的图片流程,常见关键词有 MLX、Metal | 能跑某个模型,不代表主流插件都支持;安装前先看项目是否明确写了 macOS |
6–8GB 显存的 NVIDIA 显卡 | 从轻量或优化过的工作流开始 | 优先云端;别用一条社区成功案例代表所有模型 |
12–16GB 显存的 NVIDIA 显卡 | 大多数省过显存的本地图片流程 | 只选别人已经明确跑通的压缩版、内存分担版或低显存流程 |
20–24GB 显存的 NVIDIA 显卡 | 更大的图片模型和更高分辨率 | 可以进入 Wan2.2 5B 这类有官方单卡条件的 720p 路线 |
48GB 以上显存或多卡 | 重型图片模型与多图流程 | 更高分辨率、更长时长和研究型模型 |
AMD 或 Intel 独立显卡 | 先查项目是否明确支持这类显卡 | NVIDIA CUDA 教程不能直接照抄;软件兼容性比纸面显存更早决定能否开始 |
选模型的最小流程就五步:先写任务 → 查许可证 → 看内存或显存 → 留下候选 → 最后用自己的任务实测。
然后准备十道你真的会遇到的任务。写作者放真实文稿,设计师放参考图,程序员放正在维护的代码,视频创作者直接测分镜和提示词。榜单只负责给你候选,这十道题才负责帮你做最后决定。
你可以现在就复制这张选型卡:
text
真实任务: 最终要交付的东西: 设备类型:CPU / Apple 芯片 / NVIDIA / AMD / Intel: 系统内存: 显卡显存(如果有): 操作系统:macOS / Windows / Linux: 是否商用或公开发布: 第一轮候选(最多三个): 十道真实测试题放在哪里:这张卡能填完,后面的安装才值得开始。它比在评论区问“哪个最好”可靠得多,也能避免为了一个根本用不上的模型去买新硬件。
七、同一张图,两代千问谁更会当导演
榜单只能帮我们缩小范围。参数更大、版本更新,都不能直接推出“更适合我”。
我选 Qwen 做这一轮实测,看中的是它同时覆盖文字、看图和多个尺寸,Apple 芯片又有现成的 MLX 版本。Qwen3.5 和 Qwen3.8 还能放进同一台 Mac、同一套运行工具里比较,少掉许多无关变量。
这里才需要把 Qwen3.8 的三个版本分开:
Qwen3.8-27B:个人设备更有机会运行的稠密多模态版。
Qwen3.8-Flash-Next:Qwen4 架构的实验预览,语言主体 125B、每次激活约 6B;整份模型依然很大,并使用 Qwen Community License 1.0。
Qwen3.8-2.4T-A95B:总参数 2.4T、每次激活约 95B,主要面向服务器。
这轮测试选择 27B,因为它能放进本机,也能同时完成文字和看图任务。后两款体量与用途不同,放进同一场个人电脑测试并不公平。
本轮测试机是一台拥有 48GB 统一内存的 Mac M5 Pro。两位参赛者分别是 Qwen3.5-35B-A3B-6bit 和 Qwen3.8-27B-8bit。它们使用同一张 2100×1200 图片、同一份提示词,控制回答随机程度的 temperature 都设为 0。3.8 另外复测一次,因为软件第一次处理图片时要先做准备,耗时会偏高。
两款参赛模型的结构也不同:3.5-35B-A3B 是 MoE,3.8-27B 是稠密模型。
我给它们的考卷很简单:
text
1. 用 180 字向小白解释:什么人需要本地模型,什么人不需要; 2. 提取图片里五项可以直接核对的信息; 3. 把这张图片改成四个视频镜头; 4. 分镜只返回 JSON,不要添加其他格式。JSON 是一种字段整齐、方便程序继续读取的文本格式。四道题会依次检查它能不能把话讲明白、准确看图、写出能拍的分镜,并把结果交给下一套工具继续处理。相比只问一道数学题,这些任务更接近创作者平时会做的事。
先看速度:
任务 | Qwen3.5 | Qwen3.8 复测 | 本机差距 |
|---|---|---|---|
文字科普 | 1.75 秒 | 18.59 秒 | 3.5 约快 10.6 倍 |
图片理解 | 6.81 秒 | 26.01 秒 | 3.5 约快 3.8 倍 |
看图分镜 | 12.20 秒 | 83.85 秒 | 3.5 约快 6.9 倍 |
模型名字里的总参数,不等于每次回答实际要动用的参数。Qwen3.5 的 A3B,正是它跑得快的重要原因。
3.5 的速度几乎是断层领先。可我们还要看答案能不能直接用。
图片信息提取这一题,两者都是 5/5,没拉开差距。到了科普题,3.5 擅自加入“显存低于 16GB 难以流畅运行主流模型”的粗暴红线,把小模型、量化和 Mac 统一内存一刀切掉。3.8 则从数据敏感、离线使用和深度定制三个真实需求出发,还提醒普通问答用户不必为了本地部署买新硬件。
分镜差距更直观。3.5 很快交出四镜,但从“欢迎来到今天的科普短片”起手,还把文件指纹和临时存放地址,也就是哈希和缓存路径,完整写进旁白,像把截图重新念了一遍。3.8 会安排卡片依次亮起、文字逐行打印、终端泛起绿光,动作更具体,旁白也更短,更接近能交给视频模型的拍摄清单。
3.8 也没有满分。提示词要求“只返回严格 JSON”,两个模型都在最外面多套了一层显示代码用的边框,也就是 Markdown 代码框。人在聊天框里看不受影响,交给程序读取时却可能报错。这种小毛刺,榜单通常不会告诉你。
这次三道题不能证明 3.8 在所有任务上都更强,却足以帮我分工:
你更在意什么 | 本机实测更适合谁 |
|---|---|
批量打草稿、快速初筛,之后自己修改 | Qwen3.5 |
重点内容、少量高价值分镜,愿意多等一会儿 | Qwen3.8 |
不允许输出格式出错的自动流程 | 两者都不能直接放行,还要先删掉多余的代码框 |
我最后留下 3.8,理由很简单:少量分镜的可执行性对我更重要。要是一天要批量跑几百条草稿,我会做出相反的选择。
分镜写得像样,只能算纸面得分。把它交给视频模型,能不能拍出来,才是下一道题。
八、把提示词交给 H3,成片才是答案
我把视频赛区里的 MiniMax H3 装到了另一台 Windows 电脑。它的本地 768p 工作流会同时生成画面和音轨,正好适合检查开放视频模型已经走到哪一步。
先看结果:RTX 5070 Ti 16GB 成功生成了 1344×768、约五秒、带声音的视频。完整复测从 Mac 提交任务到下载成片用了 338.26 秒,约 5 分 38 秒;最高显存占用 13,885MiB,约 13.6GiB。
从左到右依次截取生成视频中的五个时间点。它能完成“任务发出—信号移动—台式机响应—结果出现”的连续表达,但连接线和设备位置并非完全稳定。
下面再看这次结果是怎么测出来的。
这台测试机使用 RTX 5070 Ti 16GB 显存和 48GB 系统内存,运行 ComfyUI 0.31.0 与本地压缩版 H3。ComfyUI 可以理解成视频模型的装配台:每个方块负责一步工作,例如加载模型、读取提示词、反复计算画面、把计算结果还原成视频,或者保存文件。把这些方块连起来,最后得到 MP4。
我没有把“网页能打开”当作成功,而是分三次往上加压力:
表里的“帧”可以理解成一张张连续画面,24fps 就是每秒播放 24 帧。MiB / GiB 是电脑记录容量时常见的单位,可以近似看成 MB / GB。
实测 | 输出 | 这次确认了什么 |
|---|---|---|
低分辨率压力测试 | 608×352、124 帧、5.167 秒、20 steps(20 轮生成计算) | 约 61 秒完成;最高记录到 15,452MiB(约 15.1GiB)显存、显卡利用率 99%,没有因为显存不够而中断 |
第一次 768p 成片 | 1344×768、124 帧、24fps、5.167 秒 | 文件里有常见的 H.264 画面和 AAC 双声道音轨,但当时漏记了耗时和最高显存占用 |
768p 复测 | 1344×768、124 帧、24fps、5.167 秒、20 steps(20 轮生成计算) | ComfyUI 自报 336.59 秒;Mac 从提交到下载共 338.26 秒;最高显存占用 13,885MiB(约 13.6GiB),显卡利用率到过 100% |
低分辨率测试与 768p 复测的显存数字来自不同时间,记录方式也不同,不能据此得出“分辨率越低反而越吃显存”。这些数字只能说明各自那次任务发生了什么。
复测时,我没有只靠眼睛盯着任务管理器。我从 Mac 提交任务,同时每 1.5 秒记录一次 Windows 显卡状态。任务编号、决定生成结果随机变化的种子、显卡使用记录和成片信息都保存了下来。以后回看时,可以知道这次任务用了什么设置、跑了多久、显卡占了多少。
这支视频的要求并不复杂:Mac 发出任务,一束金色信号沿着连接线跑向 Windows 台式机,显卡开始工作,最后显示器出现成片。H3 基本拍对了这个顺序,结尾画面也比较稳定。
问题也很明显。提示词只写了一根连接线,画面里却分裂成了多根发光线;镜头移动时,桌面设备的相对位置也会变化。另一支 864×480 测试更明显:当我在最后 1.6 秒同时要求落地、屈膝、滑行、抓梯和回头,约 3.4 秒后角色姿势、外观和镜头方向开始跳变。
我后来把这次失败总结成一句提醒:
五秒视频不要塞进五个连续动作。H3 能把提示词变成一段视频,但不会替你自动删掉过量的导演要求。
音频也要单独检查。复测文件里确实有 32kHz AAC 双声道,音量检测也能测到声音。这只能证明 H3 生成了音频,并把它写进 MP4;声音好不好听、能不能商用,还需要真人试听。
这次结果只代表这台机器和这套五秒任务。换成其他 16GB 显卡,结果可能不同;长视频、多人物和复杂动作,也需要重新测试。
本地跑通的是 H3-Base 768p。完整 2K 还没有在本地跑通。H3 使用自己的社区许可,并未采用 Apache 2.0 或 MIT。公开发布这支成片时,我会注明:
本视频由本地部署的 MiniMax H3 生成。