调研备忘2026-09-03MiniMax H3 开源权重

H3 本地短剧账本

在线模型过不了审、被拒还要重排队。把 MiniMax H3 搬到自己的显卡上到底要花多少钱、多少时间,出来的东西够不够用。

结论

本地跑 H3 可行,也是当前开放权重里最适合短剧的模型。它去掉的是 API 那三道审核,而不是省钱。

模型是什么

H3 于 2026 年 7 月 29 日发布,8 月开源权重。33B 稠密 Transformer,单流全模态,视频和立体声音频在一次扩散里同时出来。开源了两个 BF16 checkpoint:FL2VA 负责文生、图生和首尾帧;Ref2VA 负责参考生成,最多 9 张图、3 段视频、3 段音频,这是短剧角色一致性的主路径。

官方托管、未开源的两块:Context-IR(多模态指令精炼)和 Regenerate-2K(768p 升 2K 重生成)。Artificial Analysis 竞技场里托管版 H3 文生视频排第二、视频编辑排第一,但评的是托管流水线,不能直接等同本地 768p 的表现。

分辨率
短边 768,16:9 即 1344×768
时长
4 到 15 秒,24 fps
帧数网格
17k+5:124 / 141 / 175 帧
音频
32 kHz 立体声,剪辑前要重采样到 48k
宽高约束
须为 32 的倍数,540p 用 960×544 再裁
磁盘
ComfyUI 量化组合约 42.5 GB,全精度单任务族 134 GB

本地跑多快

下面是能查到出处的实测,都是热缓存。冷启动要先把 32B 的 Qwen3-VL 编码器装进显存,第一条会慢很多。

硬件任务耗时来源
RTX 3060 12G5s · 0.4MP · Turbo≈ 6 minReddit 汇总
RTX 3060 12G5s · 1344×768 · Ref2VA≈ 10 minReddit 汇总
单 4090 24G · Sage Attention5s · 1344×768 · Turbo 8 步≈ 7 minPedro Alonso
单 4090 24G · Sage Attention5s · 1344×768 · 基础 20 步16.5 minPedro Alonso
双 4090 · 编码器独占第二卡5.2s · 960×544 · Turbo 4 步41 – 49 s雪踏乌云 8/13 实测
双 4090 · 编码器独占第二卡5.2s · 960×544 · Turbo 8 步59 – 78 s雪踏乌云 8/13 实测
单 5090 32G · NVFP4 · 编码器同卡常驻10.1s · 864×480 · 10 步175 sai-muninn
单 5090 32G · Sage 2.215s · 768p 出片再升 1080p · 14 步314 s 含放大ai-muninn
单 5090 32G · Sol Engine5s · 1344×768 · 50 步1045 → 231 sNVIDIA 官方
单 5090 32G · Sage + EasyCache10s · 1920×1088 · 20 步17.5 min社区对比
双 5090 · BF16 全精度 · 384GB 内存5s · 1344×768 · 50 步9.3 minkingy 汇总
4×H200 · vLLM-Omni5s · 1344×76874 sMiniMax 官方
8×B300 · FP85s · 1344×768 · 50 步18 skingy 汇总
同一张卡上 LTX-2.5 蒸馏版 8 步约 2.5 分钟,H3 约 17.5 分钟。H3 慢 3 到 7 倍,但演技和参考控制更强。

显存与内存

加速的坑

成本账

假设一集 1 分钟、12 个 5 秒镜头、每个可用镜头抽 3 次。3 倍是业内普遍数字,也有 164 条选 41 条约 25% 的案例,按 3 倍算偏乐观。

方案每分钟成片 GPU 时间每分钟边际成本一部 100 分钟
单 4090 · 768p Turbo≈ 4 h电费 ≈ ¥1.5≈ 17 天不停机
双 4090 · 540p Turbo≈ 45 min电费 ≈ ¥0.7≈ 3 天
双 4090 · 768p Turbo(估算)≈ 1.5 h电费 ≈ ¥1.5≈ 6 天
单 5090 · 540p · 10 步≈ 50 min电费 ≈ ¥0.5≈ 3.5 天
单 5090 · 768p · Sol 或 Turbo(估算)≈ 1 h电费 ≈ ¥0.6≈ 4 天
租云 4090 · $0.34–0.69/h≈ 4 h¥10 – 20¥1,000 – 2,000
H3 官方 API · 768p¥18¥1,800
H3 官方 API · 2K¥36¥3,600
Seedance 2.0 含抽卡(业内口径)≈ ¥60≈ ¥6,000
AI 短剧全流程外包(业内口径)≈ ¥1,000≈ ¥100,000
电费按整机 450 W(单 4090)/ 900 W(双 4090)/ 700 W(单 5090)、¥0.8/kWh 估算。全流程外包价含剧本、配音、剪辑、人力,不是同口径。

一部 100 分钟短剧的算力支出

只算生成环节,线性刻度。本地方案是电费,不含硬件折旧。

双 4090 本地电费
¥150
租云 4090Vast.ai 至 RunPod 区间中值
¥1,500
H3 API 768p
¥1,800
H3 API 2K
¥3,600
Seedance 2.0 含抽卡
¥6,000

所以钱不是主要理由。一张二手 4090 的价格相当于 API 上 700 多分钟成片。真正值钱的是三件事:提示词和参考图不再被拒、不用等审核队列、锁死 ComfyUI 版本和权重哈希后同输入同输出。

硬件现价(国内,9 月)

价格备注
RTX 4090 24G 二手¥11k – 13k2024 年停产,存量在涨,假卡翻新卡多
RTX 4090 48G 魔改≈ ¥22.5k单卡大显存,但解决不了编码器和 DiT 抢卡
RTX 5090 32G≈ ¥35kMSRP ¥16.5k,DRAM 缺货挤压消费卡,预计持续到 2027

单 5090 还是双 4090

两者是同一档吞吐:5 秒 540p 一条,双 4090 是 59 到 78 秒,单 5090 按 10 秒 175 秒折算约 85 秒。差别在价钱、复杂度和以后怎么走。

单 RTX 5090 32G双 RTX 4090 24G
卡价≈ ¥35k 全新≈ ¥24k – 26k 二手
5 秒 540p 一条≈ 85 s59 – 78 s
显存布局NVFP4 DiT 11.7 GB 加编码器 14.6 GB 同卡常驻,标准 ComfyUI 模板直接跑编码器独占第二卡,要装自定义节点 H3CLIPLoaderGPU1
满载功耗≈ 700 W 整机≈ 900 W 整机
加速生态NVIDIA Sol Engine 官方 4.5 倍、NVFP4、RTX VSR 放大,全部只认 BlackwellINT8 路线,靠 Sage Attention 加 Turbo LoRA,到顶约 3.5 倍
能装的编码器可换 25.3 GB 的 INT8 编码器,复杂参考场景连贯性更好只能用 NVFP4 编码器
风险溢价两倍在高位接盘;12VHPWR 供电要用原装线翻新卡假卡多,停产无保,两张卡要主板和电源配合
再扩加第二张 5090 约 ¥70k,两条流水线并行,吞吐翻倍已到顶

建议:能接受 ¥35k 就买单 5090,预算卡在 ¥25k 或手里已有 4090 就双 4090。

多花的约 ¥10k 买的不是 NVFP4 那 5% 的速度,是 32 GB 让两个模型同卡常驻省掉双卡改造,是全新保修,是 NVIDIA 官方 Sol Engine 这类只给 Blackwell 的加速。双 4090 的优势只有一条:便宜,且是目前唯一有人完整跑通并公开配置的国内方案。单张 4090 试水也行,但一天只能出 6 到 7 分钟成片。48G 魔改 4090 两边不靠,不推荐。

审核到底去掉了什么

托管 API 有三道过滑:提示词和参考图、视频的自动审核;疑似违法、色情、侵权内容生成前拦截;输出侧的敏感内容报错。本地 ComfyUI 节点里没有内置分类器,这三道全部不存在。

模型本身在训练阶段学到的回避行为还在,边界没有公开文档,也不稳定。所以「本地什么都能出」不成立,但正常剧情向的暴力、惊悚、情感戏不再会被拒。

许可证对你有利的部分

  • 排除地区是美、欧、英、韩,中国不受限
  • 年收入超 2000 万美元才需单独授权
  • 输出归你,MiniMax 不主张权利
  • 「Powered by MiniMax H3」标注属鼓励性质

仍然要做的事

  • 成片必须打 AI 生成标识。许可证 AUP 和 2025 年 9 月起生效的《人工智能生成合成内容标识办法》都要求
  • 分发时附许可声明
  • 抖音、红果等平台的分发审核照旧,本地只解决生成侧
  • 不得用输出训练非 H3 系的模型

质量短板与对策

组合方案

社区一致的判断:H3 演技、参考控制、对白音频最强,但最慢。LTX-2.5 快 3 到 7 倍,全球许可,收入门槛 1000 万美元,音频偏金属感。Wan 2.2 是 Apache 2.0,写实人像最好,没有原生音频。

  1. H3 Ref2VA 出关键表演镜头和需要角色一致性的镜头
  2. LTX-2.5 做快速抽卡、过渡和空镜
  3. 成片用社区的 LTX 2.3 + Wan 2.2 5B 本地放大流程,不走官方 2K 端点,避免把审核带回来
  4. 剧本用本地 LLM,分镜首帧用 Flux 加角色 LoRA,全链路不出机器

部署备忘

双 4090 方案的已验证环境:Windows 宿主 + Linux Docker,CUDA 12.8 镜像,ComfyUI 0.32,PyTorch 与 torchaudio 必须同为 2.11.0+cu130,版本标签不一致音频解码就跑不通。权重挂载进容器,不进镜像层。

docker run -d --name comfyui-h3 --gpus all --restart unless-stopped \
  -p 16888:8188 \
  -v /data/minimax-h3/models:/models \
  -v /data/minimax-h3/scripts:/scripts \
  --entrypoint /scripts/entrypoint.sh comfyui-h3:reproducible

# 起来后先验收,别直接提交长视频
curl http://HOST:16888/system_stats        # 两张 GPU 都可见
curl http://HOST:16888/object_info/H3CLIPLoaderGPU1   # 第二卡编码器节点已注册

可复现清单:镜像 digest、ComfyUI 与每个自定义节点的 commit、pip freeze、每个 safetensors 的 SHA-256、工作流 JSON、提示词、Seed、采样档位、请求帧数与 ffprobe 实际帧数。T8 的 240 帧配置实测解码出 243 帧,两个数都要记。

来源

  1. MiniMax H3 官方开源页
  2. HF 模型卡 MiniMaxAI/MiniMax-H3
  3. H3 Community License
  4. ComfyUI 官方 H3 教程
  5. awesome-minimax-h3 显存与运行时汇总
  6. 单 4090 实测 · Pedro Alonso
  7. 双 4090 部署实操 · 雪踏乌云
  8. kingy · H3 基准与硬件评测
  9. kingy · 本地部署与审核边界
  10. Reddit 用户反馈汇总
  11. MindStudio 显存分级指南
  12. ai-muninn · 单 5090 NVFP4 实测
  13. ai-muninn · 5090 625s 降到 314s
  14. NVIDIA Sol Engine · H3 在 5090 上 4.52 倍
  15. smeltcore · 5090 32GB 与 NVFP4 的真实收益
  16. LTX 2.5 vs H3 对比
  17. 开源视频模型 2026 综述
  18. 少数派 · H3 解读
  19. 优设 · 一集 20 元算法
  20. 新浪 · AI 短剧一分钟 60 块
  21. 新浪 · AI 短剧 15 秒 20 元流程
  22. 第一财经 · 成本千元一分钟
  23. MinionArts · 抽卡比例
  24. RunPod vs Vast.ai 价格
  25. 5090 国内涨价分析
  26. 4090 二手与 48G 魔改价格
  27. MiniMax 定价