一张图一句话出带声音的视频:MiniMax H3 本地部署与出片记录

工具教程2026-08-231,034 阅读
约 2,835 字 · 大约 9 分钟

一、MiniMax H3 是什么

MiniMax H3(也叫 Hailuo 3.0)是 MiniMax(海螺 AI)在 2026 年 7 月底发布的开源视频生成模型。8 月初权重上了 HuggingFace,任何人都可以下载到本地跑。

它做的事情很直接:给一张图片 + 一句话描述,生成一段 4 到 15 秒的视频,而且视频自带声音——背景音乐、环境音效、人声,都在一次生成里同时产出,不需要后期配音。

几个关键数据:

项目

参数

模型规模

33.1B 参数,密集 Transformer

文本编码器

Qwen3-VL-32B

输出分辨率

最高 2K(默认 768p 短边)

帧率

24fps

视频时长

4~15 秒

音频

32kHz 立体声,与视频同步生成

开源协议

MiniMax H3 Community License

在 Video Arena(AI 视频排行榜)上,H3 拿过视频编辑第一、文生视频第二、图生视频第三,是第一个在排行榜上击败商业模型的开源方案。

相比 Kling、Sora、Runway 这些云端服务,H3 的核心优势是本地跑、不花钱、没有内容审查限制。代价是你得有一张够强的显卡。

二、硬件要求——先看你的电脑够不够

这个模型吃硬件,尤其是显存和内存。跑之前先确认:

硬件

最低配置

推荐配置

显卡

NVIDIA 24GB 显存(RTX 4090/3090)

NVIDIA 32GB 显存(RTX 5090)

内存

64GB

96~128GB

硬盘

80GB 可用空间

100GB+ 固态硬盘

系统

Windows 10/11 64 位

Windows 11 64 位

显卡驱动

NVIDIA 550+

最新版

为什么内存要求这么高?因为模型运行时会把暂时不用的部分从显存卸载到系统内存,等用到了再加载回来。这个机制让 24GB 显存也能跑 33B 的大模型,但前提是你得有足够的内存当缓冲区。

不支持 AMD 和 Intel 显卡。只有 NVIDIA CUDA 能用。

24GB 显存可以跑,但会比较慢,建议先用小分辨率(864x480)试。如果是 RTX 5090(32GB),用默认的 1344x768 分辨率完全没问题。

三、整合包下载与解压

本文使用的是社区制作的 ComfyUI 整合包,把运行环境、节点、工作流、一键脚本全部打包好了。拿到手不用装 Python、不用配环境、不用敲命令。

3.1 下载整合包

整合包大约 2GB,只包含程序和文档,不含模型(模型 61GB 需要单独下载,下一节说)。通过卖家提供的网盘链接下载即可。

3.2 解压

用 7-Zip 或 Bandizip 解压到某个盘的根部位置,比如 D:\MiniMaxH3\。

注意事项:

  • 路径可以有中文和空格,实测没问题

  • 别嵌套太深(别放在五六层文件夹里面)

  • 解压完应该能看到 生成视频.bat 和 ComfyUI_windows_portable 文件夹

3.3 更新显卡驱动

确认 NVIDIA 驱动版本在 550 以上。不需要单独安装 CUDA 或 Python,整合包里都带了。

四、下载 6 个模型——整个部署的重头戏

整合包本身才 2GB,真正的大头是模型文件。一共 6 个模型,5 个必需、1 个可选,合计约 61GB(含可选的约 82GB)。

4.1 模型清单

序号

模型用途

大小

必需

1

图生视频主模型

20.97 GB

是

2

越狱编码器(无内容审查)

26.36 GB

是

3

增强器尾部

7.61 GB

是

4

视频 VAE

5.21 GB

是

5

音频 VAE(必须 fp32 版)

0.61 GB

是

6

参考图生视频模型

20.97 GB

可选

4.2 国内下载方式

模型托管在 HuggingFace 上。国内直连 HuggingFace 基本打不开或者特别慢,用镜像站解决:

把下载链接里的 huggingface.co 换成 hf-mirror.com,路径完全不变,免梯子、速度快。

举个例子,主模型的官方地址是:

https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors

换成镜像就是:

https://hf-mirror.com/Comfy-Org/MiniMax-H3/resolve/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors

60GB 的东西一定要用支持断点续传的下载工具(IDM、迅雷、Free Download Manager),千万别用浏览器直接下——断了就得从头来。

4.3 模型放到哪里

所有模型文件放进 ComfyUI_windows_portable\ComfyUI\models\ 下的对应子目录:

models\
├── diffusion_models\
│   ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors      (主模型)
│   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors     (可选)
├── text_encoders\
│   ├── qwen3vl_32b_h3_ultra_uncensored_heretic_int8_convrot.safetensors (越狱编码器)
│   └── MiniMax-H3\
│       └── qwen3vl_32b_h3_generation_tail_50_63_int8_convrot.safetensors(增强器尾部)
└── vae\
    ├── minimax_h3_video_vae_fp16.safetensors    (视频 VAE)
    └── minimax_h3_audio_vae_fp32.safetensors    (音频 VAE)

两个容易踩的坑:

  • 增强器尾部(第 3 个)要放在 text_encoders\MiniMax-H3\ 子文件夹里,不是 text_encoders\ 根目录

  • 音频 VAE 必须用 fp32 版本,用了 fp16 的话生成的视频会没有声音

4.4 校验模型完整性

模型全部下完放好后,双击整合包根目录的 校验模型.bat。它会逐个检查文件是否存在、大小是否正确:

  • 全部显示 ✅ → 可以继续

  • 出现 ❌「缺失」→ 没下载 / 放错位置 / 文件名不对

  • 出现 ❌「大小不符」→ 文件没下完,用支持续传的工具重下

五、启动与生成第一个视频

5.1 启动 ComfyUI 引擎

进入 ComfyUI_windows_portable 文件夹,双击 run_nvidia_gpu.bat。

会弹出一个黑色命令行窗口,开始加载模型。首次启动比较慢,加载几十 GB 的东西需要时间。等到窗口里出现这行字就说明就绪了:

To see the GUI go to: http://127.0.0.1:8188

这个窗口要全程保持打开,关了引擎就停了。

5.2 放入首帧图片

把你想用作视频第一帧的图片放进 ComfyUI_windows_portable\ComfyUI\input\ 文件夹。整合包自带一张 example.png,第一次可以直接用它试。

支持的格式:PNG、JPG、JPEG、WebP。

5.3 双击生成

回到整合包根目录,双击 生成视频.bat。命令行会显示生成进度。

首次生成会比较慢(模型还要加载),之后会快很多。实测 RTX 5090 下,1344x768 分辨率、5 秒时长、开增强器,大约 9 分钟出一条。

生成完毕后,视频在这里取:

ComfyUI_windows_portable\ComfyUI\output\video\

下面这张截图是 ComfyUI 的应用模式界面,右侧面板可以设置提示词、时长、种子等参数:

ComfyUI 应用模式界面
ComfyUI 应用模式界面

六、参数调整——不用懂代码也能改

所有日常参数都集中在一个文件里:生成视频.py。用记事本打开,只改最上面的「配置区」,改完保存,再双击 生成视频.bat 就行。

6.1 提示词

提示词 = """一个女孩站在樱花树下,微风吹起她的头发,
她转头笑着看向镜头。背景有轻柔的钢琴音乐和风吹过树叶的沙沙声。"""

用大白话写就行。开了增强器(下面会说),AI 会自动帮你把大白话扩写成专业分镜描述。

6.2 画面尺寸

宽 = 1344
高 = 768

宽和高必须是 32 的倍数,否则直接报错。常用尺寸参考:

尺寸

适用场景

864 x 480

最快,适合试效果

1152 x 640

中等画质

1344 x 768

推荐,官方默认

1920 x 1088

最高画质(注意是 1088 不是 1080)

显存紧张就用小尺寸先出草稿,满意了再上大尺寸重跑。

6.3 视频时长

时长秒 = 5

范围 415 秒。越长越慢、越吃显存。试效果阶段建议先用 45 秒。

6.4 提示词增强器

用增强器 = True
  • True:你写大白话,AI 自动扩写成专业分镜(多花 1~2 分钟,效果好很多)

  • False:直接用你写的提示词,速度快,但需要你自己写得够详细

推荐保持 True。生成完后命令行会打印增强器扩写的结果,可以学习它的写法。

6.5 随机种子

种子 = None

None 表示每次随机。如果某次结果很满意,把命令行里打印的种子数字填回来,同种子 + 同提示词 + 同参数 = 完全相同的结果。

七、提示词怎么写效果更好

虽然大白话也能用,但补上以下几类信息,出片质量会明显提升:

1. 主体 + 动作 描述清楚谁在做什么。比如「一位穿红裙的女子沿海边慢跑」比「海边有个人」好得多。

2. 镜头运动 推近、拉远、环绕、跟随、俯拍、手持轻晃……告诉模型镜头怎么动。比如「镜头缓缓推近她的脸」。

3. 光线与氛围 黄昏暖光、清晨薄雾、霓虹夜景、柔和逆光……光线信息对画面质感影响很大。

4. 声音描述 H3 的一大特色就是同步生成音频。在提示词里写「背景有轻柔的钢琴声和海浪声」,模型就会生成对应的音频。

5. 画面细节 材质、颜色、天气、背景元素,写得越具体,结果越可控。

开了增强器的情况下,你只需要把这些要点用大白话列出来,AI 会自动组织成专业格式。

八、和云端服务的对比

对比项

MiniMax H3(本地)

可灵(Kling)

Sora

Runway Gen-3

运行方式

本地显卡

云端 API

云端 API

云端 API

费用

免费(电费除外)

按量付费

订阅制

按秒付费

内容限制

无审查(本地运行)

有内容审核

有内容审核

有内容审核

音频生成

视频+音频一次生成

需单独配音

需单独配音

需单独配音

硬件要求

24GB+ 显存

无(云端)

无(云端)

无(云端)

生成速度

较慢(取决于显卡)

快(服务器集群)

快

快

画面质量

接近商业水平

高

高

高

视频编辑

支持(自然语言指令)

有限

有限

有限

选择建议:

  • 对生成内容有特殊需求、不想受云端审核限制、有合适硬件 → MiniMax H3

  • 没有高配显卡、偶尔用用、对速度有要求 → 云端服务更省心

  • 需要大批量生产视频、对成本敏感 → H3 本地方案长期更划算

九、常见问题

Q:校验报「找不到模型」怎么办? 模型没下载、放错文件夹、或者文件名被改了。对照第四节的目录结构逐个核对。

Q:HuggingFace 打不开 / 下载特别慢? 把链接里的 huggingface.co 换成 hf-mirror.com,国内镜像免梯子。

Q:生成的视频没有声音? 大概率用错了音频 VAE。确认第 5 个模型是 minimax_h3_audio_vae_fp32(fp32 版),不是 fp16。

Q:报 CUDA out of memory(显存不够)? 降低分辨率到 864x480、缩短时长到 4 秒、关掉增强器、关掉其它占显存的程序。不要给启动脚本加 --gpu-only 或 --highvram 参数,会破坏低显存优化机制。

Q:报「宽高必须是 32 的倍数」? 把宽和高都改成 32 的整数倍。比如想要 1080p,高度应该设 1088 而不是 1080。

Q:双击生成视频提示「ComfyUI 没在运行」? 先启动引擎(双击 run_nvidia_gpu.bat),等出现 http://127.0.0.1:8188 那行字后再生成。

Q:杀毒软件把文件删了? 把整个整合包文件夹加入杀毒白名单,然后重新解压被删的文件。

Q:模型会不会下架? 越狱版编码器是社区制作的,HuggingFace 上有可能因政策变动下架。建议下载完自己备份一份。

十、总结

MiniMax H3 是目前最强的开源 AI 视频生成模型,核心卖点是「图 + 文 → 带声音的视频」,全部在本地显卡上完成,不花一分钱云端费用,也没有内容审查。

实际体验下来,整合包确实做到了开箱即用——解压、下模型、双击就能跑。唯一的门槛是硬件:24GB 显存 + 64GB 内存是刚需,达不到的话跑起来会非常痛苦。

如果你有一张 RTX 4090 或 5090,想在本地生成高质量 AI 视频,H3 目前没有对手。

延伸阅读1 篇

下载地址

免费资源