在线模型过不了审、被拒还要重排队。把 MiniMax H3 搬到自己的显卡上到底要花多少钱、多少时间,出来的东西够不够用。
本地跑 H3 可行,也是当前开放权重里最适合短剧的模型。它去掉的是 API 那三道审核,而不是省钱。
H3 于 2026 年 7 月 29 日发布,8 月开源权重。33B 稠密 Transformer,单流全模态,视频和立体声音频在一次扩散里同时出来。开源了两个 BF16 checkpoint:FL2VA 负责文生、图生和首尾帧;Ref2VA 负责参考生成,最多 9 张图、3 段视频、3 段音频,这是短剧角色一致性的主路径。
官方托管、未开源的两块:Context-IR(多模态指令精炼)和 Regenerate-2K(768p 升 2K 重生成)。Artificial Analysis 竞技场里托管版 H3 文生视频排第二、视频编辑排第一,但评的是托管流水线,不能直接等同本地 768p 的表现。
下面是能查到出处的实测,都是热缓存。冷启动要先把 32B 的 Qwen3-VL 编码器装进显存,第一条会慢很多。
| 硬件 | 任务 | 耗时 | 来源 |
|---|---|---|---|
| RTX 3060 12G | 5s · 0.4MP · Turbo | ≈ 6 min | Reddit 汇总 |
| RTX 3060 12G | 5s · 1344×768 · Ref2VA | ≈ 10 min | Reddit 汇总 |
| 单 4090 24G · Sage Attention | 5s · 1344×768 · Turbo 8 步 | ≈ 7 min | Pedro Alonso |
| 单 4090 24G · Sage Attention | 5s · 1344×768 · 基础 20 步 | 16.5 min | Pedro Alonso |
| 双 4090 · 编码器独占第二卡 | 5.2s · 960×544 · Turbo 4 步 | 41 – 49 s | 雪踏乌云 8/13 实测 |
| 双 4090 · 编码器独占第二卡 | 5.2s · 960×544 · Turbo 8 步 | 59 – 78 s | 雪踏乌云 8/13 实测 |
| 单 5090 32G · NVFP4 · 编码器同卡常驻 | 10.1s · 864×480 · 10 步 | 175 s | ai-muninn |
| 单 5090 32G · Sage 2.2 | 15s · 768p 出片再升 1080p · 14 步 | 314 s 含放大 | ai-muninn |
| 单 5090 32G · Sol Engine | 5s · 1344×768 · 50 步 | 1045 → 231 s | NVIDIA 官方 |
| 单 5090 32G · Sage + EasyCache | 10s · 1920×1088 · 20 步 | 17.5 min | 社区对比 |
| 双 5090 · BF16 全精度 · 384GB 内存 | 5s · 1344×768 · 50 步 | 9.3 min | kingy 汇总 |
| 4×H200 · vLLM-Omni | 5s · 1344×768 | 74 s | MiniMax 官方 |
| 8×B300 · FP8 | 5s · 1344×768 · 50 步 | 18 s | kingy 汇总 |
MiniMaxH3TurboLoRA 和 MiniMaxH3TurboSampler 专用节点。用通用 LoraLoader 会出竖向梳状条纹,还会假报 6.3 倍加速。假设一集 1 分钟、12 个 5 秒镜头、每个可用镜头抽 3 次。3 倍是业内普遍数字,也有 164 条选 41 条约 25% 的案例,按 3 倍算偏乐观。
| 方案 | 每分钟成片 GPU 时间 | 每分钟边际成本 | 一部 100 分钟 |
|---|---|---|---|
| 单 4090 · 768p Turbo | ≈ 4 h | 电费 ≈ ¥1.5 | ≈ 17 天不停机 |
| 双 4090 · 540p Turbo | ≈ 45 min | 电费 ≈ ¥0.7 | ≈ 3 天 |
| 双 4090 · 768p Turbo(估算) | ≈ 1.5 h | 电费 ≈ ¥1.5 | ≈ 6 天 |
| 单 5090 · 540p · 10 步 | ≈ 50 min | 电费 ≈ ¥0.5 | ≈ 3.5 天 |
| 单 5090 · 768p · Sol 或 Turbo(估算) | ≈ 1 h | 电费 ≈ ¥0.6 | ≈ 4 天 |
| 租云 4090 · $0.34–0.69/h | ≈ 4 h | ¥10 – 20 | ¥1,000 – 2,000 |
| H3 官方 API · 768p | — | ¥18 | ¥1,800 |
| H3 官方 API · 2K | — | ¥36 | ¥3,600 |
| Seedance 2.0 含抽卡(业内口径) | — | ≈ ¥60 | ≈ ¥6,000 |
| AI 短剧全流程外包(业内口径) | — | ≈ ¥1,000 | ≈ ¥100,000 |
所以钱不是主要理由。一张二手 4090 的价格相当于 API 上 700 多分钟成片。真正值钱的是三件事:提示词和参考图不再被拒、不用等审核队列、锁死 ComfyUI 版本和权重哈希后同输入同输出。
| 卡 | 价格 | 备注 |
|---|---|---|
| RTX 4090 24G 二手 | ¥11k – 13k | 2024 年停产,存量在涨,假卡翻新卡多 |
| RTX 4090 48G 魔改 | ≈ ¥22.5k | 单卡大显存,但解决不了编码器和 DiT 抢卡 |
| RTX 5090 32G | ≈ ¥35k | MSRP ¥16.5k,DRAM 缺货挤压消费卡,预计持续到 2027 |
两者是同一档吞吐:5 秒 540p 一条,双 4090 是 59 到 78 秒,单 5090 按 10 秒 175 秒折算约 85 秒。差别在价钱、复杂度和以后怎么走。
| 单 RTX 5090 32G | 双 RTX 4090 24G | |
|---|---|---|
| 卡价 | ≈ ¥35k 全新 | ≈ ¥24k – 26k 二手 |
| 5 秒 540p 一条 | ≈ 85 s | 59 – 78 s |
| 显存布局 | NVFP4 DiT 11.7 GB 加编码器 14.6 GB 同卡常驻,标准 ComfyUI 模板直接跑 | 编码器独占第二卡,要装自定义节点 H3CLIPLoaderGPU1 |
| 满载功耗 | ≈ 700 W 整机 | ≈ 900 W 整机 |
| 加速生态 | NVIDIA Sol Engine 官方 4.5 倍、NVFP4、RTX VSR 放大,全部只认 Blackwell | INT8 路线,靠 Sage Attention 加 Turbo LoRA,到顶约 3.5 倍 |
| 能装的编码器 | 可换 25.3 GB 的 INT8 编码器,复杂参考场景连贯性更好 | 只能用 NVFP4 编码器 |
| 风险 | 溢价两倍在高位接盘;12VHPWR 供电要用原装线 | 翻新卡假卡多,停产无保,两张卡要主板和电源配合 |
| 再扩 | 加第二张 5090 约 ¥70k,两条流水线并行,吞吐翻倍 | 已到顶 |
建议:能接受 ¥35k 就买单 5090,预算卡在 ¥25k 或手里已有 4090 就双 4090。
多花的约 ¥10k 买的不是 NVFP4 那 5% 的速度,是 32 GB 让两个模型同卡常驻省掉双卡改造,是全新保修,是 NVIDIA 官方 Sol Engine 这类只给 Blackwell 的加速。双 4090 的优势只有一条:便宜,且是目前唯一有人完整跑通并公开配置的国内方案。单张 4090 试水也行,但一天只能出 6 到 7 分钟成片。48G 魔改 4090 两边不靠,不推荐。
托管 API 有三道过滑:提示词和参考图、视频的自动审核;疑似违法、色情、侵权内容生成前拦截;输出侧的敏感内容报错。本地 ComfyUI 节点里没有内置分类器,这三道全部不存在。
模型本身在训练阶段学到的回避行为还在,边界没有公开文档,也不稳定。所以「本地什么都能出」不成立,但正常剧情向的暴力、惊悚、情感戏不再会被拒。
社区一致的判断:H3 演技、参考控制、对白音频最强,但最慢。LTX-2.5 快 3 到 7 倍,全球许可,收入门槛 1000 万美元,音频偏金属感。Wan 2.2 是 Apache 2.0,写实人像最好,没有原生音频。
双 4090 方案的已验证环境:Windows 宿主 + Linux Docker,CUDA 12.8 镜像,ComfyUI 0.32,PyTorch 与 torchaudio 必须同为 2.11.0+cu130,版本标签不一致音频解码就跑不通。权重挂载进容器,不进镜像层。
docker run -d --name comfyui-h3 --gpus all --restart unless-stopped \
-p 16888:8188 \
-v /data/minimax-h3/models:/models \
-v /data/minimax-h3/scripts:/scripts \
--entrypoint /scripts/entrypoint.sh comfyui-h3:reproducible
# 起来后先验收,别直接提交长视频
curl http://HOST:16888/system_stats # 两张 GPU 都可见
curl http://HOST:16888/object_info/H3CLIPLoaderGPU1 # 第二卡编码器节点已注册
可复现清单:镜像 digest、ComfyUI 与每个自定义节点的 commit、pip freeze、每个 safetensors 的 SHA-256、工作流 JSON、提示词、Seed、采样档位、请求帧数与 ffprobe 实际帧数。T8 的 240 帧配置实测解码出 243 帧,两个数都要记。