2026年8月3日,MiniMax 把 H3 的权重放上了 HuggingFace——一个 33B 参数的通用全模态生成模型,单张 RTX 5090 就能本地跑 2K 视频,还带原生立体声。
三天前(7月31日)发布时它只是"拟开放权重",8月3日就真开源了。消息一出,MiniMax-W 当天股价一度涨超 8.67%。
一、H3 是什么
MiniMax H3 是业界首个开源的通用全模态生成模型:一个模型同时理解并生成文本、图像、视频、声音四种模态。
- 生成时长:5–15 秒,固定 24FPS
- 最高分辨率:2K(1440P),向下兼容 768P
- 音频:原生双声道同步生成,不用另外配音
- 输入上限:9 图 + 3 视频 + 3 音频,合计 12 份参考素材
- Prompt 上限:7000 字符
- 画幅:9:16 / 16:9 / 1:1 / 4:3 / 21:9 全覆盖
给它多张图、多段视频、多段音频作为参考,它能一次性生成一段连贯的带声音视频——包括视频动作迁移(V2V)、首尾关键帧过渡这些商用能力。
二、榜单表现:编辑第一,综合第一梯队
根据 Artificial Analysis 榜单(7月31日发布当日数据):
| 能力项 | 排名 |
|---|---|
| 视频编辑 | 全球第一 |
| 文生视频 | 第二 |
| 图生视频 | 第三 |
Video Arena 上,MiniMax-H3 是开源模型第一:文生视频和图生视频都是第一,比第二名的开源模型 hunyuan-video-1.5 高出 280 分。从 Hailuo-2.3 的 #27(1199 分)直接跳到开源榜第一。
三、核心技术:三个关键词
新 Tokenizer。 H 系列一直在卷 tokenizer 技术。H3 彻底重构了上一代 tokenizer,重建质量和可学习性全面提升,高压缩比带来 4 倍有效序列长度增益,大幅降低训练和推理成本——这也是原生 2K 分辨率的关键技术。
H3-Omni Transformer。 统一多模态理解管线,文本、图像、短视频、音频混合输入统一编码,支持参考素材联动生成。
自生成分辨率。 不依赖传统后置超分,用模型自生成方式提升分辨率,更好保留画面结构和文字细节——专门针对 AI 视频常见的"文字崩坏"问题。影视片头的中英文标题、品牌 logo、UI 动效里的文字,H3 都能保持清晰。
还引入了文本模型领域成熟的技术:复杂指令拆解、上下文扩展、Muon 优化器——把 LLM 的推理能力迁移到视频生成。
四、价格:不到主流的三分之一
| 档位 | 定价 |
|---|---|
| 2K | 0.8 元/秒(约 $0.13/秒) |
| 768P | 低至 0.1 元/秒 |
对比:H3 2K 约 $7.80/分钟,Kling 3.0 1080p 约 $20.16/分钟,Seedance 2.0 1080p 约 $22.45/分钟——便宜 2.5–3 倍,还自带原生双声道和指令式编辑,而对比方案要拼多个工具。
五、开源的真相:许可证有地理限制
权重在 HuggingFace 和魔搭社区开放下载,但许可证不是纯粹的开放:
- MiniMax Community License:年收入低于 $2000 万的组织可免费商用(需署名)
- 美国、欧盟、英国、韩国被排除在本地部署之外——这几个地区的用户不能下载权重本地跑
这是国产模型出海时代的典型策略:开源给中国和大部分市场,用许可证卡住欧美。对比同期 Google Gemma 4 的 Apache 2.0,MiniMax 的选择明显更"务实"。
六、生态跟进:ComfyUI 已支持
8月4日,ComfyUI v0.30.0 发布,正式加入 MiniMax-H3 支持(还有 LTX2.3、内存调度等)。社区已经有人用 H3 做 UI 动画、生物图鉴,HuggingFace 的 Victor M 都公开点赞本地生成质量。
本地部署门槛:单张 RTX 5090 就能跑 4–15 秒 2K 视频(33B 参数),3060 级别可以跑低分辨率档位。
七、代价清醒
- 只有 15 秒:连续长镜头生成能力有限,做不了长叙事
- 复杂人物肢体:依旧是所有文生视频模型的共同难题
- MiniMax 没发布官方基准:榜单数据来自第三方 Artificial Analysis,官方只字未提 benchmark——"跑自己的视频再决定"
- 许可证限制:欧美韩不能用权重;年收入超 $2000 万的公司商用要谈商业授权
- 7月31日发布、8月3日才开源:API 先行,权重后放——API 价格战(0.8元/秒)先打起来,开源是第二波
八、意味着什么
H3 的意义不在于"又一个视频模型",而在于开源视频生成第一次摸到了闭源旗舰的天花板:
- **文生视频从"专用模型"走向"通用多模态"**——一个模型干完文本+图像+视频+声音的活
- 开源权重 + 3060 可跑——本地视频生成不再是幻觉,个人开发者真的能跑
- 2.5-3 倍价格差 + 原生音频——商用场景从"拼工具链"变成"一个 API 搞定"
MiniMax 官方博客的原话:**"长期以来,闭源模型一直占据视频生成领域的主导地位。而 H3 把权重放出来,它走过的这条路就成了所有人都可以验证、可以复用、也可以推翻的东西。"**
天下苦闭源模型久矣。MiniMax 想做多模态领域的 DeepSeek——这一次,它可能真的摸到了。
相关链接:
- HuggingFace 权重:https://huggingface.co/MiniMaxAI
- MiniMax 官网:https://www.minimax.io/
- API 文档:https://platform.minimax.io/docs/release-notes/models
- ComfyUI v0.30.0:https://github.com/comfyanonymous/ComfyUI/releases
暂无评论。