MiniMax H3 本地部署:两张 RTX 4090 能跑,但真适合拿来接单吗?

·约 8 分钟阅读

H3 权重放出来后,社区里问得最多的不是 33B、Audio VAE 或稀疏注意力,而是更直接的一句:4090 到底能不能跑? 现在已经有了可核对的答案:一台 16GB 的 4090 笔记本跑出了 5 秒、960×540 的视频,用时 182 秒;官方也给出了双卡低显存路线和四张 B300 的速度样例。所以这篇先不讲一堆结构名词。先看下面三段官方样片,再决定 H3 值不值得你花一个晚上测试,还是值得认真租一组 GPU。

先看成片,再谈显卡

H3 真正的新鲜感,不是参数,而是画面和声音一起生成

下面三段来自 MiniMax 官方模型仓库的可复现 768p 样片。它们不是 ComputeUnion 自测,也不是精选宣传片;先点开看运动、人物与声音,再决定这套模型值不值得占用你的 GPU 预算。

T2VA

文字直接生成画面与声音

官方可复现 768p 样片;适合先看镜头运动、声音与画面是否同时成立。

FL2VA

用首帧或首尾帧控制镜头

比纯文生视频更适合角色、产品和转场需要明确起点或终点的任务。

Ref2VA

把图片、视频和声音一起作为参考

这是 H3 最值得测试的部分:身份、动作、镜头和声音能否在同一条生成里保持关系。

公开运行记录能跑已经不是问题,差别在速度、画质和工程代价

三条记录的分辨率、步数、量化、注意力优化和机器内存并不相同,不能当成显卡排行榜;它们只说明部署跨度有多大。

看完效果,再算租卡账

两张 4090 可以验证想法,生产预算要看每条合格视频

下面才把官方部署路线与 ComputeUnion 当前租赁行情放到一起。价格是市场观测,不是 MiniMax 或 GPU 厂商报价;低价也不代表一定有足够内存、存储和库存。

不想从零装环境,可以直接从 H3 一键镜像创建实例

优云智算的 H3 社区镜像可用于创建实例,按作者说明初始化后通过工作台使用;镜像页建议 48GB 显存,具体卡型还要核对库存和当前版本兼容性。2026-09-13 创建页显示镜像费 ¥0.60/小时,GPU 实例与存储另计,不能把镜像费当成整台机器的租金。

推广说明:通过该链接注册或创建实例,ComputeUnion 可能获得推广奖励,不增加你的镜像标价。

2× RTX 4090:低显存验证路线

官方 vLLM 配方为 1024×576,并依赖分层卸载与约 384 GiB 级主机内存;能运行不等于适合低延迟生产。

总显存48GB (2×24GB)
当前整组小时成本¥1.55/小时

4× H200:模型常驻路线

部署配方可让模型常驻显存,减少消费卡路线的层搬运;真实吞吐仍要用自己的时长和参考素材测试。

总显存564GB (4×141GB)
当前整组小时成本¥13.63/小时

4× B300:官方已公布速度样例

vLLM 文档记录约 87 秒生成 8.7 秒、1248×768、带同步音频的视频;这是指定配置快照,不是通用承诺。

总显存1152GB (4×288GB)
当前整组小时成本¥214.60/小时

别把“开放权重”看成“整条 2K 链路全部开放”

H3-Base 权重可以下载,但 H3-Context-IR 仍是托管模块,H3-Regenerate-2K 尚未作为开放检查点发布;许可证也不是 Apache 或 MIT。

人民币成本按当前单卡最低美元跟踪价乘以文档所列 GPU 数量,并使用站内固定汇率 1 USD = 7.25 CNY 换算;不含 CPU、约 384 GiB 主机内存、存储、网络、税费、整机起租和运维。

我最想测的不是分辨率,而是它能不能把人、动作和声音拴在一起

H3 可以同时读取文字、图片、视频和音频参考,再生成带原生 32 kHz 立体声音频的视频。基础版本覆盖 4 到 15 秒、24 FPS;FL2VA 负责文生视频和首尾帧控制,Ref2VA 可以把多张图、视频和音频参考放进同一个任务。

所以第一轮别急着追 2K。拿同一张角色图、同一段动作参考和同一条声音,连续跑一小批镜头。人物、运动和声音能一起稳住,这个模型才可能帮你省后期;如果三样东西总有一样掉链子,换更贵的 GPU 也不会自动把工作流救回来。

开源是真开源,但不是整套产品都搬回家

H3-Base 权重可以下载,MiniMax 也给出了 SGLang、vLLM、Diffusers 和 ComfyUI 路线。不过完整 2K 产品链路还有两扇门在云端:H3-Context-IR 仍是托管的预处理与编排模块,H3-Regenerate-2K 也还走官方 API,并不是开放检查点。

MiniMax H3 Community License 也不是 Apache-2.0 或 MIT。它带有地区、商业规模和署名条件。在自己机器上跑通演示,和把它写进客户合同,是两回事。真准备商用,先读许可证。

33B、46B、64B 先别吵,部署时看的是机器怎么扛

模型卡写的是 33B Transformer,另有大约 13B 的 AdaLN 分支可以缓存;vLLM 配方又用另一套口径描述完整系统。几个数字回答的不是同一个问题。真正出现在账单里的,是检查点、运行时缓冲、VAE、音频链路、主机内存、卸载传输和失败重试。

两张 4090 适合试错,不适合拿来证明你能接生产单

官方文档确实给了 2× RTX 4090 24GB、1024×576 的低显存路线,但它依赖分层卸载,还需要大约 384 GiB 级主机内存。用它验证安装、参考素材、提示词和出片率很合适;拿它和模型常驻的 H200B300 比延迟,就不公平了。

一旦模型层在主机内存和显卡之间来回搬,PCIe 和内存带宽都会进入每一条视频的等待时间。能装下,只说明门打开了,不代表生产线已经开起来。

真要花第一笔钱,我会先做一组很无聊的固定测试

准备 20 到 50 条固定提示词,角色参考、时长和输出设置都别乱换。只记四件事:可交付成片数、单条时间、失败重试、搭环境花了多久。第一批镜头真的能用,再把完全相同的任务搬到常驻路线测试。

最后比较的应该是每条合格视频的租赁成本,不是哪张卡的小时价看起来最便宜。卡数 × 小时价 × 生成时间只是开头,废片和工程时间也得写进同一本账。上面的 ComputeUnion 卡片会读取当前 GPU 市场观测价,点进对应 GPU 页面还能继续看渠道和价格变化。

什么时候继续用 API 反而更省

如果想先看现成社区工作台怎么选,我们另外实拍整理了H3 云端镜像与租机费用指南,把实例、磁盘、镜像三项费用分开说明。这是创建页核价记录,不是视频生成性能实测。

9 月补充:fal 已推出单独后训练的 H3 Max 托管服务。新写的H3 Max API 与 GPU 租赁成本分析,把分辨率收费表和本站当日 B300 报价放在一起算;原版开放权重与 H3 Max 并不是同一个模型。

只做一轮活动、工作室还在试风格,或者必须使用托管 2K 模块时,API 通常更轻。你不用处理下载、编译、超大主机内存和推理编排。只有任务长期稳定、GPU 利用率能持续拉高、素材隐私有硬要求,或者团队确实要改模型和推理栈,自部署才开始有经济意义。

把 H3 放进短剧流程,它更像镜头工,不是导演

先锁剧本和分镜,再准备稳定的角色参考。需要首尾动作衔接时用 FL2VA;人物、运动和声音都要约束时再用 Ref2VA。每个镜头单独验收,只重做失败的那一段。AI 短剧制作流程页制作成本页可以继续把镜头选择接到模型与 GPU 价格上。

如果这笔租赁费是我自己掏

我会先租最小的文档路线,把固定测试跑完,而不是一上来追最贵的机器。H3 通过出片率这一关,再拿同一批任务比较 H200 和 B300,让“合格成片成本”决定要不要升级。任务零散或者离不开托管 2K 模块,我就不养推理栈,继续用 API。

数据来源与核对方法

能力与开放边界来自 MiniMax H3 官方模型卡MiniMax H3 Community License。部署路线核对了 SGLang 配方vLLM 配方ComfyUI 教程。GPU 价格和曲线来自 ComputeUnion 当前市场观测,不是固定报价;口径见方法说明完整 GPU 租赁比价

相关链接

← 返回博客