2026模型全网最全开源盘点:从入门到榨干(含双机实测)
2026/9/6 1:11:00 网站建设 项目流程

如果你最近经常刷 AI 新闻,很难不眼花。Qwen、DeepSeek、MiniMax、混元、Wan 接连开源,语言、图片、视频模型一起上新,后面还跟着一排像暗号一样的型号

另一边,越来越多人在买大内存 Mac、迷你主机和大显存显卡,说是要“在本地跑 AI”。普通人最想问的其实就几件事:这些模型有什么用?为什么值得专门买硬件?我的电脑能跑哪个?装好以后又有多好用?

我把这些问题整理成了一张选型地图:先判断自己有没有必要本地部署,再盘一遍当前值得关注的语言、图片和视频模型,顺手讲清名字、参数、压缩版本、使用许可和电脑配置。盘点完,我还会把模型真正装进 Mac 和 Windows,用文字、看图、分镜和视频任务检查它们到底好不好用。

读完之后,你不必记住所有模型,但会知道自己需要哪一类、电脑能不能带动,以及它值不值得你折腾一个晚上。

目录(AI相关文章尾部跳转)

  • 一、为什么大家开始把 AI 搬回家

  • 二、先看面板:五步筛掉不属于你的模型

  • 三、语言赛区:国产六雄比的不是同一件事

  • 四、图片赛区:会画只是入场券

  • 五、视频赛区:最强的模型,可能根本进不了你的显卡

  • 六、硬件赛区:你的电脑,究竟装得下谁?该不该买AIPC?

  • 七、同一张图,两代千问谁更会当导演

  • 八、把提示词交给 H3,成片才是答案

  • 九、最后,给你看一段视频

一、为什么大家开始把 AI 搬回家

大多数人不需要立刻买新电脑。

本地模型有点像把一位 AI 助手搬进家里。云端 AI 住在别人的机房,你通过网络找它干活;本地 AI 住在你的电脑里,文件可以留在本机,断网后也能运行。

你遇到下面任何一种情况,才值得认真研究本地部署:

你的情况

本地模型能帮什么

经常处理合同、未公开图片或私人素材

让文件尽量留在自己的电脑里

网络不稳,或者需要离线工作

没网时仍能使用

每天都要批量整理文件、图片和素材

可以和本地文件夹、脚本、剪辑软件配合

需要一个长期不变的固定版本

自己保留同一份模型,工作流更稳定

如果你一个月只问几次问题,只想用最新的模型,也不想处理安装和更新,继续用在线 AI 更省心。本地运行会占磁盘、吃内存或显存,还会用掉时间和电费。

还有一个容易踩坑的词:“开源模型”。

有些模型只是把可运行的文件开放下载,训练数据和训练代码并没有全部公开。更准确的叫法是“开放权重”。这个区别不是学术抬杠,因为能下载,不等于能随意商用。

许可证可以理解成模型自带的“使用合同”。下载前找到模型页里的 License,至少把下面四件事查清楚:

  • 能不能用于收费项目或公司业务;

  • 生成的图片、视频公开发布时,要不要注明 AI 或模型名称;

  • 能不能用自己的材料继续训练,或者和别的模型合并,做成自己的版本;

  • 能不能把原模型或修改后的版本再次分享给别人。

Apache 2.0、MIT 通常比较宽松,但仍可能要求保留版权与许可说明;Non-Commercial 表示模型文件只能用于非商业场景。厂商自己写的社区许可,还可能限制商用规模、要求发布时注明模型,或者限制使用地区。只看“开源”两个字就默认什么都能做,很容易出问题。

二、先看面板:五步筛掉不属于你的模型

完整模型名被拆成四段信息,按顺序看就行。

先拿一个真实跑过的名字开刀:

Qwen3.5-35B-A3B-6bit

它像 Wi-Fi 密码,其实只要拆成四块:

你看到的

翻译成人话

对选型有什么用

Qwen3.5

品牌和版本

用来区分家族与代际

35B

模型总共约 350 亿参数

数字越大,通常越占空间

A3B

每次干活时大约启用 30 亿参数

它用了“专家分工”的 MoE 结构

6bit

压缩后的精度

位数越低,通常越省内存

模型名里的 B 约等于十亿,T 约等于一万亿。参数量可以粗略帮你判断模型有多大,却不能直接代表它有多聪明。

MoE 可以想成一家有很多专家的公司。所有专家的档案都要存在电脑里,每次任务只请几位出来工作。所以它可能跑得很快,下载文件却依然很大。

再看另一个已经实测的版本:

Qwen3.8-27B-8bit

它没有 A3B,每次任务都会动用整个 27B 模型。这种“全员一起工作”的结构叫稠密模型。所以 3.8 的数字看起来更小,实际运行可能比 3.5 慢很多。

“量化”就是给模型做压缩,4bit / 6bit / 8bit 是不同的压缩档位。压得越厉害,模型越容易装进电脑,回答质量也可能受到影响。选型时先看它能不能装下,再看实测质量。

后缀不用全背。普通用户优先找 Instruct / Chat,这是已经学会按要求回答的版本;Base 主要留给开发者继续训练。Thinking 更愿意花时间推理,通常也更慢;VL / Vision 表示能看图片或视频,但“能看”不等于“能画”。

剩下三个词只管文件怎么运行:MLX 适合 Apple 芯片 Mac;GGUF 是 Mac、Windows、Linux 都常见的格式;safetensors 只是文件格式,不能说明模型强不强。

但看懂名字只是开始。为了不让后面的全景再次变成名单,给你一条五步筛选线:

步骤

要回答的问题

游戏里的说法

1. 任务

我要聊天、读图、改图,还是生成视频?最终要交付什么?

先选赛区

2. 设备

我有多少可用的内存或显存?用 Mac 还是 NVIDIA 显卡?

看召唤成本

3. 许可

能否商用、公开发布、继续训练,或者把修改版分享给别人?

查通行证

4. 候选

在前三项都满足的模型里留下最多三个

组队,不囤卡

5. 实测

用自己的十个真实任务比较质量、速度和稳定性

上场打一局

后面看到任何榜单,都按这五步走。先排除用不上、装不下和许可不合适的模型,剩下的才值得下载。

三、语言赛区:国产六雄比的不是同一件事

语言模型榜单很像总成绩表,可榜上的模型并不在做同一份工作。有的负责冲能力上限,有的负责进入普通电脑。看一家厂商时,要把“今年最新的旗舰”与“这家已经开放、适合个人设备的型号”分开。

六家都在做语言模型,但擅长的任务、开放的小型号,以及现成工具和教程的数量都不同。

把六家的官方模型库放在一起看,千问的个人型号最齐;但能在普通电脑上运行的国产模型,远不止千问一家。

表里的“多模态”,指一个模型除了文字,还能处理图片、视频等内容;“长上下文”,指它一次能读进去更多材料。

国产阵营

英雄称号

2026 年旗舰看什么

个人设备有哪些真实入口

一句话结论

Qwen

全栈工程师

Qwen3.8 同时有个人设备可以研究的 27B,以及面向实验和服务器的两款 MoE

Qwen3.5 有 0.8B、2B、4B、9B、35B-A3B,另有 27B 等版本与大量压缩格式

尺寸、看图能力和运行格式最齐,最容易找到适合自己电脑的一档

DeepSeek

推理判题王

V4-Pro-0813、V4-Flash-0731 主攻推理、代码和一次读取很长的材料

R1 蒸馏版有 1.5B、7B、8B、14B、32B、70B

个人电脑可以跑 R1 蒸馏版;它学了 R1 的推理方法,并非缩小后的 V4

Kimi

长卷侦察员

K3 是 2.8T 的多模态旗舰

Kimi-VL-A3B 和 Moonlight-16B-A3B 都是总参数约 16B、每次激活约 3B

有个人候选,但型号梯队没有千问那么宽;A3B 也不代表只需存 3B 权重

GLM

任务指挥官

GLM-5/5.2 面向长任务、代码,以及让 AI 自己调用工具、分多步干活

GLM-Z1-9B、GLM-4.1V-9B、GLM-4.6V-Flash,以及 31B 的 GLM-4.7-Flash

文字和看图都有中小型号,普通设备完全可以研究

MiniMax

跨媒体导演

M3 是 427B、可处理多种内容的旗舰

官方有 SynLogic-7B 等专用研究模型,但通用语言主线没有完整的小尺寸梯队

普通人想装通用聊天模型,暂时不必优先从 MiniMax 开始

混元

重工业总工

Hy3 是 295B 总参数、每次激活约 21B 的 MoE

通用语言有 0.5B、1.8B、4B、7B;看图还有 Youtu-VL-4B、Penguin-VL-2B/8B

它和千问一样覆盖小模型,只是社区教程和现成量化相对少

“蒸馏”和“A3B”很容易看错。DeepSeek-R1-Distill-Qwen-7B 是把大模型的推理方法教给一个 7B 底座,它不是 DeepSeek V4 的迷你版。Kimi-VL-A3B 的 A3B 表示每次大约激活 3B 参数,完整的 16B 权重仍要下载和存放。

海外模型也有大有小:Gemma 有轻量版本,gpt-oss-20b 适合本地推理和调用工具,Llama 的教程与衍生版本很多,Mistral 则以小模型和多语言见长。按自己的任务挑候选即可,不需要一次全装。

下面先按任务找候选;电脑能装多大的模型,第六章再看。

你要做的事

应该找什么能力

第一批可测试的国产候选

日常聊天、改写和文档摘要

4B–9B 的

Instruct/Chat

模型

Qwen3.5-4B/9B、Hunyuan-4B/7B、GLM-Z1-9B

数学推理、代码分析

推理版或代码版,不要求看图

DeepSeek-R1-Distill-7B/14B、GLM-Z1-9B、Qwen 对应尺寸的推理/代码型号

看图片、表格、PDF 和写分镜

名字或模型页明确写着

VL/Vision

Qwen3.5-4B/9B、GLM-4.1V-9B、Kimi-VL-A3B、Youtu-VL-4B

处理很长的材料

一次能读进很多内容,还要实测长文是否读得稳

Kimi-VL-A3B、Qwen 和 GLM 的多模态型号

只偶尔写文案、又想用最新旗舰

不需要本地部署

直接用云端

四、图片赛区:会画只是入场券

图片模型已经分出好几门功课:文字排版、修图、角色一致和参考图控制。只看一张官方样片,就像只看球员的定妆照,根本不知道上场会不会掉链子。

先用四个问题缩小范围:你要从零画,还是改现有图片?图里有没有中文?角色要不要一直长得一样?结果准备自己玩,还是拿去接商单?

阵营

英雄称号

它最适合解决什么

使用前先知道

Ideogram 4

海报排字手

画面里有文字、海报和明确版式

这个 NF4 压缩版采用非商业许可,下载前还要同意条款

Qwen Image

中文排版师

汉字、信息图和知识型画面

在线新版本上线,不等于同名模型文件已经开放;本地安装前要核对官方下载页和许可

HiDream-O1-Image

修图老炮

一套模型里做生成、编辑和人物一致

采用 MIT 许可,但现成教程和工作流程还不如 Stable Diffusion 多

FLUX.2 [dev]

质感重装画师

高质感生成、修图和多张参考图

原版体量大,模型许可也不是 Apache/MIT;先找明确的压缩版本和省内存教程

Stable Diffusion

模组百宝箱

用风格小模块 LoRA、构图控制工具 ControlNet 和其他插件精确控制画面

需要自己组合模型、插件和参数,上手要多花一些时间

HunyuanImage 3.0

重型图像总工

观察生成、理解、编辑和多图融合的能力上限

官方本地示例默认使用多张显卡,普通人不适合从它开始

不用背这六个名字,按任务留下候选就行:

  • 中文海报和信息图:先看 Qwen Image、Ideogram 4。

  • 修现有图片或保持同一个人物:先看 HiDream-O1-Image、FLUX.2。

  • 固定画风、姿势和构图:Stable Diffusion 的控制工具与教程最多。

  • 观察能力上限可以看 HunyuanImage 3.0;偶尔生成几张图,直接用云端更省事。

接商单时要查两份规则:模型文件能不能商用,生成的图片能不能商用。两者可能不同。一个产品能在线使用,也不能证明它的最新模型文件已经开放下载。

五、视频赛区:最强的模型,可能根本进不了你的显卡

有的模型能自己生成声音,有的主打 720p 单卡运行,还有的只适合研究机构。

视频模型最吃硬件。一张图只处理一个画面,视频还要连续管动作、镜头、角色长相和声音。2026 年的看点已经从“让图片动起来”,变成了能不能听懂参考素材、保持人物一致、控制镜头,甚至把对白和环境声一起做出来。

进步很快,硬件要求也很高。分辨率越高、时长越长,通常越吃显存,也要等得更久。选模型时,要一起看它能接收哪些素材、会不会自己生成声音、实际分辨率、最低显存、耗时和许可证。

阵营

英雄称号

它最适合解决什么

使用前先知道

MiniMax H3

声画导演

同时参考文字、图片、视频和音频,连画面与立体声一起生成

本地 H3-Base 直接生成 768p;做到 2K 还要再跑一套放大流程,并且使用专门的社区许可

Wan2.2 TI2V-5B

720p 实干派

用同一个 5B 模型做文生视频和图生视频

官方输出为 720p、24fps(每秒 24 帧),采用 Apache 2.0;单张显卡运行时至少需要 24GB 显存

HunyuanVideo 1.5

显存精算师

用“把部分计算暂放到内存”的办法降低显存门槛

官方写的最低显存是 14GB,但参考环境是 Linux;Windows 仍需单独实测

LTX-2.5

声画挑战者

自己同时生成画面和声音,支持多镜头,也能用自己的材料继续训练

压缩版怎么安装、能否商用,都要按具体版本确认

MAGI-2

八卡极限组

展示开放视频模型的研究上限

官方要求八张面向机房的高端 NVIDIA 显卡,个人设备不用考虑

选视频模型时,也按任务缩小范围:

  • 画面、对白和环境声一起做:先看 MiniMax H3。

  • 从文字或图片生成标准 720p 短片:先看 Wan2.2 TI2V-5B。

  • 愿意多用系统内存换取更低显存要求:可以研究 HunyuanVideo 1.5。

  • LTX-2.5 适合继续研究声音、多镜头和训练;MAGI-2 看看结果即可,不必当作个人安装目标。

“消费级”只是说这张显卡普通人可以买到,并不代表每一张消费显卡都能运行同一个模型。

如果只是偶尔生成几支短片,又想随时用最新模型,云端通常更省事。本地视频更适合三类人:愿意等待、会反复使用同一套流程,并且希望素材留在自己电脑里。

六、硬件赛区:你的电脑,究竟装得下谁?该不该买AIPC?

统一内存是 CPU 和 GPU 共用一池资源;普通独立显卡电脑的系统内存和显存则是两池资源,不能直接相加。

模型选型最后会落到一个很朴素的问题:它能不能住进你的电脑?

文中的 CPU 是电脑的主处理器,GPU 是擅长同时做大量计算的图形处理器,也是很多 AI 程序真正使用的部分。

正准备买电脑:先选硬件类型

先别急着比较跑分。2026 年名字里带“AI”的电脑,至少已经分成下面六类。它们的用途差别很大:

硬件类型

常见代表

适合做什么

买前先知道

NPU AI PC

Intel Core Ultra、AMD Ryzen AI、Snapdragon X 系列笔记本

NPU 是一块低功耗 AI 专用芯片,适合会议降噪、实时字幕、系统搜索和受支持的小模型

Copilot+ PC

要求 NPU 达到 40+ TOPS。TOPS 是每秒理论计算量,这个数字不能证明机器能流畅运行 27B 大模型

Apple 统一内存电脑

Apple 芯片 Mac

CPU 和负责图形计算的部分共用一大池内存,适合本地语言、看图和 MLX 软件

内存大能放下较大的模型,但很多为 NVIDIA 显卡开发的图片、视频插件不能直接在 Mac 上运行

大内存 APU / 迷你工作站

Ryzen AI Max+ 395

一类设备

APU 可以理解成处理器和集成显卡装在一起并共用内存;这类设备最多有 128GB 统一内存

大内存解决模型能否放下,AMD 驱动和具体软件是否支持,才决定它能否顺利运行

NVIDIA 独显电脑

GeForce RTX、RTX PRO 台式机和工作站

NVIDIA 的 CUDA 加速平台拥有大量现成教程和插件,图片、视频流程最成熟

系统内存和显卡自带的显存不能直接相加;能装下模型,也未必跑得快

桌面 AI 工作站

NVIDIA DGX Spark

与其他采用 GB10 芯片的设备

配有 128GB 统一内存和整套 NVIDIA AI 软件;官方定位是最高运行 200B 模型、继续训练 70B 模型

它采用 Arm 处理器和 DGX OS,软件环境不同于常见的 Windows 电脑。官方说“支持 200B”,也没有承诺所有 200B 模型都跑得快

国产 AI 专用机原型

小米 AI Cube

已公开演示在本地切换 120B 大模型和 3B 小模型,说明国产厂商也在做专门运行本地 AI 的桌面盒子

目前仍是原型机。价格、量产时间、完整规格和第三方模型兼容性,都还不能当成确定信息

选购时可以这样记:AI PC 主要看低功耗 NPU,本地大模型先看内存,本地画图和视频先看显存与软件支持。 TOPS 表示理论计算量,参数量表示模型规模,内存或显存决定模型能否装下。三个数字各管一件事,不能混在一起比较。

已经有电脑:直接看内存或显存

回到目前最常见的个人设备,Mac 和 NVIDIA 台式机的优势也不在同一个地方。

Apple 芯片 Mac 使用“统一内存”,处理器和图形部分可以共用这池内存。它像一间共用仓库,比较容易放下较大的语言和看图模型。但标称容量不会全部交给模型,系统和其他软件也要占一部分。

NVIDIA 显卡则像一张速度很快的专用工作台。图片、视频、ComfyUI 和大量现成插件都优先支持它。但请记住:系统内存和显卡显存是两件事。 比如一台电脑有 32GB 系统内存、8GB 显存,判断图片和视频模型时,先看的仍然是 8GB 显存。

下面这些范围更适合拿来选择第一个模型。机器经过专门调试后可能跑得更多,新手从这里开始更稳妥。语言、图片和视频的要求不同,所以分成两张表。

想聊天、写作、读文档或看图:

你手里的设备

建议从哪档开始

先明白什么

只用 CPU,或没有可用的独立显卡

1B–4B 量化语言模型

能跑,但速度通常慢;先用小模型确认自己是否真有本地需求

8–16GB 统一内存的 Apple 芯片 Mac

1B–7B 量化模型

系统也要占内存;8GB 机型要从更小的版本试

24–36GB 统一内存的 Apple 芯片 Mac

7B–14B 量化模型

可以把文字和看图模型当主力,但仍要留出系统空间

48–64GB 统一内存的 Apple 芯片 Mac

20B–35B 量化模型,或总体量相近的 MoE

“每次激活得少”会影响速度,不代表整个模型不占内存

6–8GB 显存的 NVIDIA 显卡

1B–7B 量化模型

超出显存后可以借系统内存,但速度会明显变慢

12–16GB 显存的 NVIDIA 显卡

7B–14B 量化模型

适合日常文字、代码和中小型看图模型

20–24GB 显存的 NVIDIA 显卡

14B–32B 量化模型

能不能全放进显存,还要看一次读入多少内容,以及使用什么运行软件

48GB 以上显存或多卡

更大的量化模型与最新巨型模型

开始进入工作站或服务器领域,成本还包括供电、散热和软件配置

想在本地画图或生成视频:

你手里的设备

图片从哪里开始

视频从哪里开始

没有独立显卡

优先用云端,或只测有原生支持的轻量图片模型

不建议把本地视频当第一个部署项目

Apple 芯片 Mac

可以跑明确支持 macOS 的图片流程,常见关键词有 MLX、Metal

能跑某个模型,不代表主流插件都支持;安装前先看项目是否明确写了 macOS

6–8GB 显存的 NVIDIA 显卡

从轻量或优化过的工作流开始

优先云端;别用一条社区成功案例代表所有模型

12–16GB 显存的 NVIDIA 显卡

大多数省过显存的本地图片流程

只选别人已经明确跑通的压缩版、内存分担版或低显存流程

20–24GB 显存的 NVIDIA 显卡

更大的图片模型和更高分辨率

可以进入 Wan2.2 5B 这类有官方单卡条件的 720p 路线

48GB 以上显存或多卡

重型图片模型与多图流程

更高分辨率、更长时长和研究型模型

AMD 或 Intel 独立显卡

先查项目是否明确支持这类显卡

NVIDIA CUDA 教程不能直接照抄;软件兼容性比纸面显存更早决定能否开始

选模型的最小流程就五步:先写任务 → 查许可证 → 看内存或显存 → 留下候选 → 最后用自己的任务实测。

然后准备十道你真的会遇到的任务。写作者放真实文稿,设计师放参考图,程序员放正在维护的代码,视频创作者直接测分镜和提示词。榜单只负责给你候选,这十道题才负责帮你做最后决定。

你可以现在就复制这张选型卡:

text

真实任务: 最终要交付的东西: 设备类型:CPU / Apple 芯片 / NVIDIA / AMD / Intel: 系统内存: 显卡显存(如果有): 操作系统:macOS / Windows / Linux: 是否商用或公开发布: 第一轮候选(最多三个): 十道真实测试题放在哪里:

这张卡能填完,后面的安装才值得开始。它比在评论区问“哪个最好”可靠得多,也能避免为了一个根本用不上的模型去买新硬件。

七、同一张图,两代千问谁更会当导演

榜单只能帮我们缩小范围。参数更大、版本更新,都不能直接推出“更适合我”。

我选 Qwen 做这一轮实测,看中的是它同时覆盖文字、看图和多个尺寸,Apple 芯片又有现成的 MLX 版本。Qwen3.5 和 Qwen3.8 还能放进同一台 Mac、同一套运行工具里比较,少掉许多无关变量。

这里才需要把 Qwen3.8 的三个版本分开:

  • Qwen3.8-27B:个人设备更有机会运行的稠密多模态版。

  • Qwen3.8-Flash-Next:Qwen4 架构的实验预览,语言主体 125B、每次激活约 6B;整份模型依然很大,并使用 Qwen Community License 1.0。

  • Qwen3.8-2.4T-A95B:总参数 2.4T、每次激活约 95B,主要面向服务器。

这轮测试选择 27B,因为它能放进本机,也能同时完成文字和看图任务。后两款体量与用途不同,放进同一场个人电脑测试并不公平。

本轮测试机是一台拥有 48GB 统一内存的 Mac M5 Pro。两位参赛者分别是 Qwen3.5-35B-A3B-6bit 和 Qwen3.8-27B-8bit。它们使用同一张 2100×1200 图片、同一份提示词,控制回答随机程度的 temperature 都设为 0。3.8 另外复测一次,因为软件第一次处理图片时要先做准备,耗时会偏高。

两款参赛模型的结构也不同:3.5-35B-A3B 是 MoE,3.8-27B 是稠密模型。

我给它们的考卷很简单:

text

1. 用 180 字向小白解释:什么人需要本地模型,什么人不需要; 2. 提取图片里五项可以直接核对的信息; 3. 把这张图片改成四个视频镜头; 4. 分镜只返回 JSON,不要添加其他格式。JSON 是一种字段整齐、方便程序继续读取的文本格式。

四道题会依次检查它能不能把话讲明白、准确看图、写出能拍的分镜,并把结果交给下一套工具继续处理。相比只问一道数学题,这些任务更接近创作者平时会做的事。

先看速度:

任务

Qwen3.5

Qwen3.8 复测

本机差距

文字科普

1.75 秒

18.59 秒

3.5 约快 10.6 倍

图片理解

6.81 秒

26.01 秒

3.5 约快 3.8 倍

看图分镜

12.20 秒

83.85 秒

3.5 约快 6.9 倍

模型名字里的总参数,不等于每次回答实际要动用的参数。Qwen3.5 的 A3B,正是它跑得快的重要原因。

3.5 的速度几乎是断层领先。可我们还要看答案能不能直接用。

图片信息提取这一题,两者都是 5/5,没拉开差距。到了科普题,3.5 擅自加入“显存低于 16GB 难以流畅运行主流模型”的粗暴红线,把小模型、量化和 Mac 统一内存一刀切掉。3.8 则从数据敏感、离线使用和深度定制三个真实需求出发,还提醒普通问答用户不必为了本地部署买新硬件。

分镜差距更直观。3.5 很快交出四镜,但从“欢迎来到今天的科普短片”起手,还把文件指纹和临时存放地址,也就是哈希和缓存路径,完整写进旁白,像把截图重新念了一遍。3.8 会安排卡片依次亮起、文字逐行打印、终端泛起绿光,动作更具体,旁白也更短,更接近能交给视频模型的拍摄清单。

3.8 也没有满分。提示词要求“只返回严格 JSON”,两个模型都在最外面多套了一层显示代码用的边框,也就是 Markdown 代码框。人在聊天框里看不受影响,交给程序读取时却可能报错。这种小毛刺,榜单通常不会告诉你。

这次三道题不能证明 3.8 在所有任务上都更强,却足以帮我分工:

你更在意什么

本机实测更适合谁

批量打草稿、快速初筛,之后自己修改

Qwen3.5

重点内容、少量高价值分镜,愿意多等一会儿

Qwen3.8

不允许输出格式出错的自动流程

两者都不能直接放行,还要先删掉多余的代码框

我最后留下 3.8,理由很简单:少量分镜的可执行性对我更重要。要是一天要批量跑几百条草稿,我会做出相反的选择。

分镜写得像样,只能算纸面得分。把它交给视频模型,能不能拍出来,才是下一道题。

八、把提示词交给 H3,成片才是答案

我把视频赛区里的 MiniMax H3 装到了另一台 Windows 电脑。它的本地 768p 工作流会同时生成画面和音轨,正好适合检查开放视频模型已经走到哪一步。

先看结果:RTX 5070 Ti 16GB 成功生成了 1344×768、约五秒、带声音的视频。完整复测从 Mac 提交任务到下载成片用了 338.26 秒,约 5 分 38 秒;最高显存占用 13,885MiB,约 13.6GiB。

从左到右依次截取生成视频中的五个时间点。它能完成“任务发出—信号移动—台式机响应—结果出现”的连续表达,但连接线和设备位置并非完全稳定。

下面再看这次结果是怎么测出来的。

这台测试机使用 RTX 5070 Ti 16GB 显存和 48GB 系统内存,运行 ComfyUI 0.31.0 与本地压缩版 H3。ComfyUI 可以理解成视频模型的装配台:每个方块负责一步工作,例如加载模型、读取提示词、反复计算画面、把计算结果还原成视频,或者保存文件。把这些方块连起来,最后得到 MP4。

我没有把“网页能打开”当作成功,而是分三次往上加压力:

表里的“帧”可以理解成一张张连续画面,24fps 就是每秒播放 24 帧。MiB / GiB 是电脑记录容量时常见的单位,可以近似看成 MB / GB。

实测

输出

这次确认了什么

低分辨率压力测试

608×352、124 帧、5.167 秒、20 steps(20 轮生成计算)

约 61 秒完成;最高记录到 15,452MiB(约 15.1GiB)显存、显卡利用率 99%,没有因为显存不够而中断

第一次 768p 成片

1344×768、124 帧、24fps、5.167 秒

文件里有常见的 H.264 画面和 AAC 双声道音轨,但当时漏记了耗时和最高显存占用

768p 复测

1344×768、124 帧、24fps、5.167 秒、20 steps(20 轮生成计算)

ComfyUI 自报 336.59 秒;Mac 从提交到下载共 338.26 秒;最高显存占用 13,885MiB(约 13.6GiB),显卡利用率到过 100%

低分辨率测试与 768p 复测的显存数字来自不同时间,记录方式也不同,不能据此得出“分辨率越低反而越吃显存”。这些数字只能说明各自那次任务发生了什么。

复测时,我没有只靠眼睛盯着任务管理器。我从 Mac 提交任务,同时每 1.5 秒记录一次 Windows 显卡状态。任务编号、决定生成结果随机变化的种子、显卡使用记录和成片信息都保存了下来。以后回看时,可以知道这次任务用了什么设置、跑了多久、显卡占了多少。

这支视频的要求并不复杂:Mac 发出任务,一束金色信号沿着连接线跑向 Windows 台式机,显卡开始工作,最后显示器出现成片。H3 基本拍对了这个顺序,结尾画面也比较稳定。

问题也很明显。提示词只写了一根连接线,画面里却分裂成了多根发光线;镜头移动时,桌面设备的相对位置也会变化。另一支 864×480 测试更明显:当我在最后 1.6 秒同时要求落地、屈膝、滑行、抓梯和回头,约 3.4 秒后角色姿势、外观和镜头方向开始跳变。

我后来把这次失败总结成一句提醒:

五秒视频不要塞进五个连续动作。H3 能把提示词变成一段视频,但不会替你自动删掉过量的导演要求。

音频也要单独检查。复测文件里确实有 32kHz AAC 双声道,音量检测也能测到声音。这只能证明 H3 生成了音频,并把它写进 MP4;声音好不好听、能不能商用,还需要真人试听。

这次结果只代表这台机器和这套五秒任务。换成其他 16GB 显卡,结果可能不同;长视频、多人物和复杂动作,也需要重新测试。

本地跑通的是 H3-Base 768p。完整 2K 还没有在本地跑通。H3 使用自己的社区许可,并未采用 Apache 2.0 或 MIT。公开发布这支成片时,我会注明:

本视频由本地部署的 MiniMax H3 生成。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询