MiniMax H3 从零到出片:部署、提示词与社区资源一站整理
2026/9/19 1:19:35 网站建设 项目流程

MiniMax H3 从零到出片:部署、提示词与社区资源一站整理

【免费下载链接】MiniMax-H3MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解,并能生成分辨率高达 2K、时长可达 15 秒的带原生立体声音频的视频。得益于面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力,能够出色地执行复杂的多模态指令。项目地址: https://ai.gitcode.com/MiniMax-AI/MiniMax-H3

MiniMax H3 是全模态视频生成系统:统一理解文本、图像、视频与音频组成的上下文,生成最高 2K 分辨率、15 秒、带原生立体声音频的视频。读完这篇,你能拿到模型下载命令、768p 部署路径、两份提示词指南、2K 升级流程和全部求助渠道。

1. 最短部署路径:把 MiniMax H3 跑起来

先克隆代码仓库,文档、许可和请求脚本都在里面;模型权重按所用框架单独下载:

git clone https://gitcode.com/MiniMax-AI/MiniMax-H3

三种方式下载 MiniMax H3 模型权重

  • SGLang / vLLM:下载原始检查点,覆盖 FL2VA(文本、首尾帧生视频)与 Ref2VA(多模态参考生视频)两个任务家族:
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3

只跑文本生视频时,把--include换成"FL2VA/*"即可。每个任务家族都是自包含仓库,processor、tokenizer、text_encoder、transformer、视觉与音频 VAE 齐全,不用跨目录拼组件。

  • diffusers:代码里自动拉取所需组件,适合脚本化单机验证:
from diffusers import ModularPipeline pipe = ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3")
  • 框架选择:SGLang、vLLM 适合长期起服务对外提供 API;diffusers 适合单机快速试跑;想可视化操作选 ComfyUI(见第 3 节)。

SGLang 起 768p 服务并复现官方示例

sglang serve --model-path MiniMaxAI/MiniMax-H3 \ --num-gpus 4 --ulysses-degree 4 \ --performance-mode speed --model-variant fl2va

跑 Ref2VA 时把--model-variant改成ref2va并换一个端口,其余参数(host、port)沿用 README 示例。

服务起来后,仓库里三个请求脚本可直接复现 768p 出片,每条命令对应官方演示结果:

  • scripts/readme/reproducible-768p-t2va-request.sh:纯文本生视频,建议第一条就跑它
  • scripts/readme/reproducible-768p-fl2va-request.sh:首帧、尾帧或首尾双图生视频
  • scripts/readme/reproducible-768p-ref2va-request.sh:带参考图、视频、音频的生视频

2. 写出第一条能用的提示词:两份官方指南的分工

H3 的提示词和常见文生视频不同:除了画面与运镜,还要写环境声、音乐和对白,因为音频是和视频一起生成出来的,不是后期配的。两份指南按输入模式分工:

  • docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md:基础模式指南,解决 t2va / fl2va 下镜头、风格、声音各段怎么写
  • docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md:参考模式指南,解决 ref2va 里如何用 <Picture 1>、<Video 1> 这类占位符指代输入素材,并表达"复用"与"参考"两种意图

指南里还给出分镜式结构([Shot 1] 这种写法),第一次写提示词照着抄结构最稳。写的时候对照输出规格:4–15 秒、24fps、短边默认 768p、32kHz 立体声,对白稳定支持 11 种语言。

3. 768p 到 2K:跑通之后还能玩什么

本地 H3-Base 出 768p;要 2K,把官方两个 API 接进流程:H3-Context-IR 先把自由的多模态上下文整理成结构化中间表示,H3-Regenerate-2K 再拿 768p 结果加原始上下文重新生成高清版。以 t2va 为例,四段脚本各解决一环:

  • scripts/readme/full-2k-t2va-h3-context-ir.sh:上下文理解与提示词增强
  • scripts/readme/full-2k-t2va-h3-base.sh:调用本地 768p 服务生成
  • scripts/readme/full-2k-t2va-h3-regenerate-2k.sh:2K 重生成
  • scripts/readme/full-2k-t2va-reference-2k-result-by-directly-calling-open-platform-api.sh:纯 API 直接出 2K 的官方对照结果

i2va / ref2va 各有一套同名脚本。2K 不是传统超分:重生成时复用原始上下文,小字和细节不用靠模型猜。

再往外的两件事:

  • ComfyUI:官方模板库提供 R2V 与 T2V 两套工作流模板,可视化点通全流程,适合不写代码先验证效果
  • 多 GPU 部署:--num-gpus--ulysses-degree保持一致即可增减卡数,README 示例为 4 卡序列并行

4. 卡住了找谁:社区、邮件与许可问答

  • MiniMax H3 Discord 社区:#general 聊日常用法与心得,#technical-support 提部署、报错类问题,#showcase 发作品
  • 邮件 model@minimax.io:许可申请、商务合作等不便在公开频道问的事
  • docs/QA-about-License.md:商业使用、再分发的高频问答,提问前先看它,能省一轮往返

5. 合规速览:MiniMax H3 社区许可的关键约束

MiniMax H3 Community License Agreement 允许免费使用、修改与分发,但注意几条硬约束:年营收超 2000 万美元的商业产品须事先取得 MiniMax 书面授权;商用产品界面需显示 "MiniMax H3" 名称;不得用模型或其输出来改进其他 AI 模型;欧盟、英国、美国、韩国不在默认许可范围内,需单独申请。

现在就克隆仓库、下载 FL2VA 权重,跑通第一条 t2va 请求,然后把成片发到 Discord 的 #showcase。

【免费下载链接】MiniMax-H3MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解,并能生成分辨率高达 2K、时长可达 15 秒的带原生立体声音频的视频。得益于面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力,能够出色地执行复杂的多模态指令。项目地址: https://ai.gitcode.com/MiniMax-AI/MiniMax-H3

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询