一张图一句话出带声音的视频:MiniMax H3 本地部署与出片记录
一、MiniMax H3 是什么
MiniMax H3(也叫 Hailuo 3.0)是 MiniMax(海螺 AI)在 2026 年 7 月底发布的开源视频生成模型。8 月初权重上了 HuggingFace,任何人都可以下载到本地跑。
它做的事情很直接:给一张图片 + 一句话描述,生成一段 4 到 15 秒的视频,而且视频自带声音——背景音乐、环境音效、人声,都在一次生成里同时产出,不需要后期配音。
几个关键数据:
项目 | 参数 |
|---|---|
模型规模 | 33.1B 参数,密集 Transformer |
文本编码器 | Qwen3-VL-32B |
输出分辨率 | 最高 2K(默认 768p 短边) |
帧率 | 24fps |
视频时长 | 4~15 秒 |
音频 | 32kHz 立体声,与视频同步生成 |
开源协议 | MiniMax H3 Community License |
在 Video Arena(AI 视频排行榜)上,H3 拿过视频编辑第一、文生视频第二、图生视频第三,是第一个在排行榜上击败商业模型的开源方案。
相比 Kling、Sora、Runway 这些云端服务,H3 的核心优势是本地跑、不花钱、没有内容审查限制。代价是你得有一张够强的显卡。
二、硬件要求——先看你的电脑够不够
这个模型吃硬件,尤其是显存和内存。跑之前先确认:
硬件 | 最低配置 | 推荐配置 |
|---|---|---|
显卡 | NVIDIA 24GB 显存(RTX 4090/3090) | NVIDIA 32GB 显存(RTX 5090) |
内存 | 64GB | 96~128GB |
硬盘 | 80GB 可用空间 | 100GB+ 固态硬盘 |
系统 | Windows 10/11 64 位 | Windows 11 64 位 |
显卡驱动 | NVIDIA 550+ | 最新版 |
为什么内存要求这么高?因为模型运行时会把暂时不用的部分从显存卸载到系统内存,等用到了再加载回来。这个机制让 24GB 显存也能跑 33B 的大模型,但前提是你得有足够的内存当缓冲区。
不支持 AMD 和 Intel 显卡。只有 NVIDIA CUDA 能用。
24GB 显存可以跑,但会比较慢,建议先用小分辨率(864x480)试。如果是 RTX 5090(32GB),用默认的 1344x768 分辨率完全没问题。
三、整合包下载与解压
本文使用的是社区制作的 ComfyUI 整合包,把运行环境、节点、工作流、一键脚本全部打包好了。拿到手不用装 Python、不用配环境、不用敲命令。
3.1 下载整合包
整合包大约 2GB,只包含程序和文档,不含模型(模型 61GB 需要单独下载,下一节说)。通过卖家提供的网盘链接下载即可。
3.2 解压
用 7-Zip 或 Bandizip 解压到某个盘的根部位置,比如 D:\MiniMaxH3\。
注意事项:
路径可以有中文和空格,实测没问题
别嵌套太深(别放在五六层文件夹里面)
解压完应该能看到
生成视频.bat和ComfyUI_windows_portable文件夹
3.3 更新显卡驱动
确认 NVIDIA 驱动版本在 550 以上。不需要单独安装 CUDA 或 Python,整合包里都带了。
四、下载 6 个模型——整个部署的重头戏
整合包本身才 2GB,真正的大头是模型文件。一共 6 个模型,5 个必需、1 个可选,合计约 61GB(含可选的约 82GB)。
4.1 模型清单
序号 | 模型用途 | 大小 | 必需 |
|---|---|---|---|
1 | 图生视频主模型 | 20.97 GB | 是 |
2 | 越狱编码器(无内容审查) | 26.36 GB | 是 |
3 | 增强器尾部 | 7.61 GB | 是 |
4 | 视频 VAE | 5.21 GB | 是 |
5 | 音频 VAE(必须 fp32 版) | 0.61 GB | 是 |
6 | 参考图生视频模型 | 20.97 GB | 可选 |
4.2 国内下载方式
模型托管在 HuggingFace 上。国内直连 HuggingFace 基本打不开或者特别慢,用镜像站解决:
把下载链接里的 huggingface.co 换成 hf-mirror.com,路径完全不变,免梯子、速度快。
举个例子,主模型的官方地址是:
https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors
换成镜像就是:
https://hf-mirror.com/Comfy-Org/MiniMax-H3/resolve/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors
60GB 的东西一定要用支持断点续传的下载工具(IDM、迅雷、Free Download Manager),千万别用浏览器直接下——断了就得从头来。
4.3 模型放到哪里
所有模型文件放进 ComfyUI_windows_portable\ComfyUI\models\ 下的对应子目录:
models\
├── diffusion_models\
│ ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors (主模型)
│ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors (可选)
├── text_encoders\
│ ├── qwen3vl_32b_h3_ultra_uncensored_heretic_int8_convrot.safetensors (越狱编码器)
│ └── MiniMax-H3\
│ └── qwen3vl_32b_h3_generation_tail_50_63_int8_convrot.safetensors(增强器尾部)
└── vae\
├── minimax_h3_video_vae_fp16.safetensors (视频 VAE)
└── minimax_h3_audio_vae_fp32.safetensors (音频 VAE)
两个容易踩的坑:
增强器尾部(第 3 个)要放在
text_encoders\MiniMax-H3\子文件夹里,不是text_encoders\根目录音频 VAE 必须用 fp32 版本,用了 fp16 的话生成的视频会没有声音
4.4 校验模型完整性
模型全部下完放好后,双击整合包根目录的 校验模型.bat。它会逐个检查文件是否存在、大小是否正确:
全部显示 ✅ → 可以继续
出现 ❌「缺失」→ 没下载 / 放错位置 / 文件名不对
出现 ❌「大小不符」→ 文件没下完,用支持续传的工具重下
五、启动与生成第一个视频
5.1 启动 ComfyUI 引擎
进入 ComfyUI_windows_portable 文件夹,双击 run_nvidia_gpu.bat。
会弹出一个黑色命令行窗口,开始加载模型。首次启动比较慢,加载几十 GB 的东西需要时间。等到窗口里出现这行字就说明就绪了:
To see the GUI go to: http://127.0.0.1:8188
这个窗口要全程保持打开,关了引擎就停了。
5.2 放入首帧图片
把你想用作视频第一帧的图片放进 ComfyUI_windows_portable\ComfyUI\input\ 文件夹。整合包自带一张 example.png,第一次可以直接用它试。
支持的格式:PNG、JPG、JPEG、WebP。
5.3 双击生成
回到整合包根目录,双击 生成视频.bat。命令行会显示生成进度。
首次生成会比较慢(模型还要加载),之后会快很多。实测 RTX 5090 下,1344x768 分辨率、5 秒时长、开增强器,大约 9 分钟出一条。
生成完毕后,视频在这里取:
ComfyUI_windows_portable\ComfyUI\output\video\
下面这张截图是 ComfyUI 的应用模式界面,右侧面板可以设置提示词、时长、种子等参数:

六、参数调整——不用懂代码也能改
所有日常参数都集中在一个文件里:生成视频.py。用记事本打开,只改最上面的「配置区」,改完保存,再双击 生成视频.bat 就行。
6.1 提示词
提示词 = """一个女孩站在樱花树下,微风吹起她的头发,
她转头笑着看向镜头。背景有轻柔的钢琴音乐和风吹过树叶的沙沙声。"""
用大白话写就行。开了增强器(下面会说),AI 会自动帮你把大白话扩写成专业分镜描述。
6.2 画面尺寸
宽 = 1344
高 = 768
宽和高必须是 32 的倍数,否则直接报错。常用尺寸参考:
尺寸 | 适用场景 |
|---|---|
864 x 480 | 最快,适合试效果 |
1152 x 640 | 中等画质 |
1344 x 768 | 推荐,官方默认 |
1920 x 1088 | 最高画质(注意是 1088 不是 1080) |
显存紧张就用小尺寸先出草稿,满意了再上大尺寸重跑。
6.3 视频时长
时长秒 = 5
范围 415 秒。越长越慢、越吃显存。试效果阶段建议先用 45 秒。
6.4 提示词增强器
用增强器 = True
True:你写大白话,AI 自动扩写成专业分镜(多花 1~2 分钟,效果好很多)
False:直接用你写的提示词,速度快,但需要你自己写得够详细
推荐保持 True。生成完后命令行会打印增强器扩写的结果,可以学习它的写法。
6.5 随机种子
种子 = None
None 表示每次随机。如果某次结果很满意,把命令行里打印的种子数字填回来,同种子 + 同提示词 + 同参数 = 完全相同的结果。
七、提示词怎么写效果更好
虽然大白话也能用,但补上以下几类信息,出片质量会明显提升:
1. 主体 + 动作 描述清楚谁在做什么。比如「一位穿红裙的女子沿海边慢跑」比「海边有个人」好得多。
2. 镜头运动 推近、拉远、环绕、跟随、俯拍、手持轻晃……告诉模型镜头怎么动。比如「镜头缓缓推近她的脸」。
3. 光线与氛围 黄昏暖光、清晨薄雾、霓虹夜景、柔和逆光……光线信息对画面质感影响很大。
4. 声音描述 H3 的一大特色就是同步生成音频。在提示词里写「背景有轻柔的钢琴声和海浪声」,模型就会生成对应的音频。
5. 画面细节 材质、颜色、天气、背景元素,写得越具体,结果越可控。
开了增强器的情况下,你只需要把这些要点用大白话列出来,AI 会自动组织成专业格式。
八、和云端服务的对比
对比项 | MiniMax H3(本地) | 可灵(Kling) | Sora | Runway Gen-3 |
|---|---|---|---|---|
运行方式 | 本地显卡 | 云端 API | 云端 API | 云端 API |
费用 | 免费(电费除外) | 按量付费 | 订阅制 | 按秒付费 |
内容限制 | 无审查(本地运行) | 有内容审核 | 有内容审核 | 有内容审核 |
音频生成 | 视频+音频一次生成 | 需单独配音 | 需单独配音 | 需单独配音 |
硬件要求 | 24GB+ 显存 | 无(云端) | 无(云端) | 无(云端) |
生成速度 | 较慢(取决于显卡) | 快(服务器集群) | 快 | 快 |
画面质量 | 接近商业水平 | 高 | 高 | 高 |
视频编辑 | 支持(自然语言指令) | 有限 | 有限 | 有限 |
选择建议:
对生成内容有特殊需求、不想受云端审核限制、有合适硬件 → MiniMax H3
没有高配显卡、偶尔用用、对速度有要求 → 云端服务更省心
需要大批量生产视频、对成本敏感 → H3 本地方案长期更划算
九、常见问题
Q:校验报「找不到模型」怎么办? 模型没下载、放错文件夹、或者文件名被改了。对照第四节的目录结构逐个核对。
Q:HuggingFace 打不开 / 下载特别慢? 把链接里的 huggingface.co 换成 hf-mirror.com,国内镜像免梯子。
Q:生成的视频没有声音? 大概率用错了音频 VAE。确认第 5 个模型是 minimax_h3_audio_vae_fp32(fp32 版),不是 fp16。
Q:报 CUDA out of memory(显存不够)? 降低分辨率到 864x480、缩短时长到 4 秒、关掉增强器、关掉其它占显存的程序。不要给启动脚本加 --gpu-only 或 --highvram 参数,会破坏低显存优化机制。
Q:报「宽高必须是 32 的倍数」? 把宽和高都改成 32 的整数倍。比如想要 1080p,高度应该设 1088 而不是 1080。
Q:双击生成视频提示「ComfyUI 没在运行」? 先启动引擎(双击 run_nvidia_gpu.bat),等出现 http://127.0.0.1:8188 那行字后再生成。
Q:杀毒软件把文件删了? 把整个整合包文件夹加入杀毒白名单,然后重新解压被删的文件。
Q:模型会不会下架? 越狱版编码器是社区制作的,HuggingFace 上有可能因政策变动下架。建议下载完自己备份一份。
十、总结
MiniMax H3 是目前最强的开源 AI 视频生成模型,核心卖点是「图 + 文 → 带声音的视频」,全部在本地显卡上完成,不花一分钱云端费用,也没有内容审查。
实际体验下来,整合包确实做到了开箱即用——解压、下模型、双击就能跑。唯一的门槛是硬件:24GB 显存 + 64GB 内存是刚需,达不到的话跑起来会非常痛苦。
如果你有一张 RTX 4090 或 5090,想在本地生成高质量 AI 视频,H3 目前没有对手。
延伸阅读1 篇
下载地址
免费资源- MiniMax H3.ziphttps://pan.baidu.com/s/1ZqIh3Uy8OoU45Uo7pBZjZg?pwd=snyh提取码
snyh解压密码无


