MiniMax H3 怎么部署?2 张 RTX 4090 与 4 张 H200/B300 成本对比
·11 min read
这两天有朋友把 MiniMax H3 丢给我,问得特别直接:“权重都开放了,演示看着也挺猛,我租两张 4090 能不能直接开干?”我顺着官方模型卡、许可证和部署文档一路看下来,发现这事挺有意思:两张 4090 的确能把门推开,但它和四张 H200、B300 跑的,根本不是同一种体验。
同样叫“能跑 H3”,成本和体验可以差很远
下面把官方验证过的部署路线与 ComputeUnion 当前租赁行情放在一起。价格是市场观测,不是 MiniMax 或 GPU 厂商报价。
不想从零装环境,可以直接从 H3 一键镜像创建实例
优云智算当前页面提供 Seedance 2 与 MiniMax H3 合集镜像,可直接创建实例,初始化后通过 WebUI 使用;页面建议 48GB 显存,并列出 48G RTX40 系、RTX50 系和 H20 支持。镜像本身显示免费,不代表 GPU 实例免费,创建前仍要核对所选卡型与实际小时价。
推广说明:通过该链接注册或创建实例,ComputeUnion 可能获得推广奖励,不增加你的镜像标价。
2× RTX 4090:低显存验证路线
官方 vLLM 配方为 1024×576,并依赖分层卸载与约 384 GiB 级主机内存;能运行不等于适合低延迟生产。
4× H200:模型常驻路线
部署配方可让模型常驻显存,减少消费卡路线的层搬运;真实吞吐仍要用自己的时长和参考素材测试。
4× B300:官方已公布速度样例
vLLM 文档记录约 87 秒生成 8.7 秒、1248×768、带同步音频的视频;这是指定配置快照,不是通用承诺。
别把“开放权重”看成“整条 2K 链路全部开放”
H3-Base 权重可以下载,但 H3-Context-IR 仍是托管模块,H3-Regenerate-2K 尚未作为开放检查点发布;许可证也不是 Apache 或 MIT。
人民币成本按当前单卡最低美元跟踪价乘以文档所列 GPU 数量,并使用站内固定汇率 1 USD = 7.25 CNY 换算;不含 CPU、约 384 GiB 主机内存、存储、网络、税费、整机起租和运维。
H3 真正值得聊的,不只是“能生成视频”
MiniMax H3 不是一个只会做无声画面的文生视频模型。官方给它的定位是全模态视频生成:可以读文本、图片、视频和音频参考,再生成带原生 32 kHz 立体声音频的视频。基础版本支持 4 到 15 秒、24 FPS;FL2VA 负责文生视频、首尾帧控制,Ref2VA 则能把多张参考图、参考视频和参考音频放进同一个任务里。
这对真正做内容的人,比“榜单第几名”更重要。你可以让角色图负责身份,让一段动作视频负责运动,再让音频负责说话或氛围,不必指望一条提示词把所有东西一次猜对。官方还列了 11 种语言的对话支持。短剧、广告、产品演示、分镜转镜头,这几类任务都值得拿自己的素材去测。
不过,“开源”这两个字得踩一脚刹车
H3-Base 的权重确实可以下载,官方也给了 SGLang、vLLM、Diffusers 和 ComfyUI 路线。但现在完整的 2K 工作流并不是所有部分都已经放出来。H3-Context-IR 仍是托管的预处理与编排服务,H3-Regenerate-2K 目前也还是走官方 API,而不是开放检查点。
许可证同样不是 Apache-2.0 或 MIT,而是 MiniMax H3 Community License。它对适用地区、商业规模和署名都有条件,适用地区定义还排除了欧盟、英国、韩国和美国。如果你准备把 H3 塞进客户产品,别看到“开放权重”四个字就默认全球可以随便商用,先读许可证,必要时做法律核对。
为什么有人说 33B,有人又说 64B?
你查资料时很可能会碰到两个数字。Hugging Face 模型卡写的是 33B Transformer,另外还有大约 13B 的 AdaLN 分支,这部分可以缓存,推理时不必一直带着;vLLM 的部署配方又从整套系统口径写成 64B dense model。两个口径不能简单相加,也没必要为了一个标题数字争输赢。
真要部署,应该问的是:你选的任务版本有多大,运行时缓冲、VAE、音频链路占多少,需不需要把层卸载到内存。参数量是新闻标题,能不能稳定跑完一条片子才是账单。
两张 4090 能跑,但主机内存也被拉进了战场
vLLM 官方低显存配方里,确实有一条 2× RTX 4090 24GB、1024×576 的路线。它依靠张量并行和分层卸载,把暂时不用的权重放到主机内存;文档给出的主机内存需求大约是 384 GiB 这一档。拿它做验证、适配、偶发任务是有价值的,但这不代表两张 4090 工作站能跑出数据中心卡常驻显存时的延迟。
官方也列了 2× RTX 5090、1344×768 的方案。两条路线的本质都一样:它们解决的是“装得下”,代价是 PCIe 传输和内存带宽也会进入生成时间。便宜卡不等于便宜成片,得把等待和失败重试一起算进去。
不想从零装环境,也可以直接从一键镜像开始
优云智算目前已经提供一套“Seedance 2 + MiniMax H3”合集镜像,可以直接创建 GPU 实例,初始化完成后从 WebUI 进入。镜像页建议选择 48GB 显存,并列出了 48G RTX40 系、RTX50 系和 H20 支持。这里要分清楚:镜像标价为 0,不代表租用 GPU 免费,最终成本仍取决于创建实例时选择的卡型和小时价。
推广说明:通过该链接注册或创建实例,ComputeUnion 可能获得推广奖励,不会提高页面显示的镜像标价。镜像由第三方作者维护,创建生产任务前请自行核对版本、显卡、存储和实例费用。
四张 H200 或 B300,是另一套玩法
按照部署配方,4× H200 141GB 可以走模型常驻路线,不必像消费卡那样频繁搬运层。vLLM 还公布了一条更直观的结果:4× B300 在文档设定下,生成一段 8.7 秒、1248×768、带同步音频的视频,大约用了 87 秒。
这个数字能证明快速路线存在,但不能拿来当所有任务的承诺。提示词长度、参考文件数量、视频时长、分辨率、首次编译和运行时版本,都会改速度。正确做法是拿它当起点,再用自己的镜头队列实测。
第一笔 GPU 租赁费,我会怎么花
如果只是想知道 H3 能不能理解你的角色和声音设计,我会先走自己能维护的最小验证路线:租两张 4090,配足主机内存,固定做 20 到 50 条测试。不要只记“成功生成”,要记可用成片数、单条时间、失败重试和搭环境花了多久。
当这些片子真的过了质量关,队列也开始稳定,再拿同一组提示词去测四张 H200 或 B300。比较时不要只看一张卡每小时多少钱,而要算每条合格视频的租赁成本:卡数 × 小时价 × 生成时间,再加失败任务和工程时间。上面的 ComputeUnion 图表会读取当前 GPU 租赁观测价,不会让文章里的旧数字一直冒充实时行情。
哪些人更适合先用官方 API?
小团队只做一轮活动、工作室还在试风格,或者你必须使用完整 2K 链路,先用官方托管服务通常更省事。下载、超大内存、编译和编排都不用自己扛,而且还能调用尚未开放权重的模块。
自部署真正有吸引力的场景,是任务长期稳定、GPU 利用率能持续拉高、素材隐私有硬要求,或者团队确实要改基础模型和推理栈。否则,为了“我也部署过”租一台大机器,很容易变成昂贵的闲置展示品。
放进短剧流程,H3 应该站在哪一段?
我不会让 H3 一次生成整部短剧。更稳的做法是先锁剧本和分镜,准备稳定的角色参考;需要首尾动作衔接时用 FL2VA,需要把人物、运动和声音一起约束时再用 Ref2VA。每个镜头单独验收,只重做失败的那一段。
如果你正在算一整套流程,可以从 ComputeUnion AI 短剧制作决策页往下看,再用短剧制作成本页把模型调用和 GPU 租赁放在一张账单里。H3 是其中的镜头生成器,不是替你省掉编剧、分镜和验收的人。
聊到这里,我对 H3 的判断
H3 真正有吸引力的地方,是多参考控制、视频与原生音频、开放权重在一次发布里碰到了一起。但最聪明的动作仍然不是先买机器,而是先做测试:两张 4090 用来摸清模型,稳定队列再比较 H200/B300 常驻路线;需要 2K 托管模块或不想养推理栈,就继续用官方 API。
数据来源与核对方法
能力与开放边界来自 MiniMax H3 官方模型卡和 MiniMax H3 Community License。部署路线核对了 SGLang 配方、vLLM 配方和 ComfyUI 教程。GPU 价格和曲线来自 ComputeUnion 当前市场观测,不是固定报价;口径见方法说明和完整 GPU 租赁比价。
常见问题
MiniMax H3 是完整开源模型吗?
H3-Base 权重可以按 MiniMax H3 Community License 下载,但 H3-Context-IR 仍是托管服务,H3-Regenerate-2K 也尚未作为开放检查点发布;自定义许可证还有地区、商业和署名条件。
两张 RTX 4090 能运行 MiniMax H3 吗?
vLLM 官方配方包含 2× RTX 4090 24GB、1024×576 的低显存分层卸载路线,同时需要约 384 GiB 级别的主机内存,不能把它等同于数据中心卡常驻模型的速度。
MiniMax H3 已公布的快速部署表现是什么?
vLLM 配方记录了 4× NVIDIA B300 在文档设定下约 87 秒生成 8.7 秒、1248×768、带同步音频的视频;真实结果会随任务和运行环境变化。
H3 应该用官方 API 还是租 GPU?
早期验证、偶发任务或需要托管 2K 工作流时先用 API;只有利用率、隐私或定制需求足以覆盖 GPU 与运维成本时,再比较自部署。