33B 权重上线 4 天就开源:MiniMax H3 把 2K 视频生成打到了 0.8 元/秒

2026年8月3日,MiniMax 把 H3 的权重放上了 HuggingFace——一个 33B 参数的通用全模态生成模型,单张 RTX 5090 就能本地跑 2K 视频,还带原生立体声。

三天前(7月31日)发布时它只是"拟开放权重",8月3日就真开源了。消息一出,MiniMax-W 当天股价一度涨超 8.67%。

一、H3 是什么

MiniMax H3 是业界首个开源的通用全模态生成模型:一个模型同时理解并生成文本、图像、视频、声音四种模态。

  • 生成时长:5–15 秒,固定 24FPS
  • 最高分辨率:2K(1440P),向下兼容 768P
  • 音频:原生双声道同步生成,不用另外配音
  • 输入上限:9 图 + 3 视频 + 3 音频,合计 12 份参考素材
  • Prompt 上限:7000 字符
  • 画幅:9:16 / 16:9 / 1:1 / 4:3 / 21:9 全覆盖

给它多张图、多段视频、多段音频作为参考,它能一次性生成一段连贯的带声音视频——包括视频动作迁移(V2V)、首尾关键帧过渡这些商用能力。

二、榜单表现:编辑第一,综合第一梯队

根据 Artificial Analysis 榜单(7月31日发布当日数据):

能力项 排名
视频编辑 全球第一
文生视频 第二
图生视频 第三

Video Arena 上,MiniMax-H3 是开源模型第一:文生视频和图生视频都是第一,比第二名的开源模型 hunyuan-video-1.5 高出 280 分。从 Hailuo-2.3 的 #27(1199 分)直接跳到开源榜第一。

三、核心技术:三个关键词

新 Tokenizer。 H 系列一直在卷 tokenizer 技术。H3 彻底重构了上一代 tokenizer,重建质量和可学习性全面提升,高压缩比带来 4 倍有效序列长度增益,大幅降低训练和推理成本——这也是原生 2K 分辨率的关键技术。

H3-Omni Transformer。 统一多模态理解管线,文本、图像、短视频、音频混合输入统一编码,支持参考素材联动生成。

自生成分辨率。 不依赖传统后置超分,用模型自生成方式提升分辨率,更好保留画面结构和文字细节——专门针对 AI 视频常见的"文字崩坏"问题。影视片头的中英文标题、品牌 logo、UI 动效里的文字,H3 都能保持清晰。

还引入了文本模型领域成熟的技术:复杂指令拆解、上下文扩展、Muon 优化器——把 LLM 的推理能力迁移到视频生成。

四、价格:不到主流的三分之一

档位 定价
2K 0.8 元/秒(约 $0.13/秒)
768P 低至 0.1 元/秒

对比:H3 2K 约 $7.80/分钟,Kling 3.0 1080p 约 $20.16/分钟,Seedance 2.0 1080p 约 $22.45/分钟——便宜 2.5–3 倍,还自带原生双声道和指令式编辑,而对比方案要拼多个工具。

五、开源的真相:许可证有地理限制

权重在 HuggingFace 和魔搭社区开放下载,但许可证不是纯粹的开放

  • MiniMax Community License:年收入低于 $2000 万的组织可免费商用(需署名)
  • 美国、欧盟、英国、韩国被排除在本地部署之外——这几个地区的用户不能下载权重本地跑

这是国产模型出海时代的典型策略:开源给中国和大部分市场,用许可证卡住欧美。对比同期 Google Gemma 4 的 Apache 2.0,MiniMax 的选择明显更"务实"。

六、生态跟进:ComfyUI 已支持

8月4日,ComfyUI v0.30.0 发布,正式加入 MiniMax-H3 支持(还有 LTX2.3、内存调度等)。社区已经有人用 H3 做 UI 动画、生物图鉴,HuggingFace 的 Victor M 都公开点赞本地生成质量。

本地部署门槛:单张 RTX 5090 就能跑 4–15 秒 2K 视频(33B 参数),3060 级别可以跑低分辨率档位。

七、代价清醒

  • 只有 15 秒:连续长镜头生成能力有限,做不了长叙事
  • 复杂人物肢体:依旧是所有文生视频模型的共同难题
  • MiniMax 没发布官方基准:榜单数据来自第三方 Artificial Analysis,官方只字未提 benchmark——"跑自己的视频再决定"
  • 许可证限制:欧美韩不能用权重;年收入超 $2000 万的公司商用要谈商业授权
  • 7月31日发布、8月3日才开源:API 先行,权重后放——API 价格战(0.8元/秒)先打起来,开源是第二波

八、意味着什么

H3 的意义不在于"又一个视频模型",而在于开源视频生成第一次摸到了闭源旗舰的天花板

  1. **文生视频从"专用模型"走向"通用多模态"**——一个模型干完文本+图像+视频+声音的活
  2. 开源权重 + 3060 可跑——本地视频生成不再是幻觉,个人开发者真的能跑
  3. 2.5-3 倍价格差 + 原生音频——商用场景从"拼工具链"变成"一个 API 搞定"

MiniMax 官方博客的原话:**"长期以来,闭源模型一直占据视频生成领域的主导地位。而 H3 把权重放出来,它走过的这条路就成了所有人都可以验证、可以复用、也可以推翻的东西。"**

天下苦闭源模型久矣。MiniMax 想做多模态领域的 DeepSeek——这一次,它可能真的摸到了。


相关链接:

评论

暂无评论。

登录后可发表评论。