MiniMax H3 开源:33B 全模态视频模型自带立体声,价格只有主流的三分之一
8 月 3 日,HuggingFace 官方账号转发了一条让视频生成圈炸锅的消息:“MiniMax H3 刚刚上线 Hugging Face——文生视频、图生视频、参考生视频,全都自带音频。33B 参数,消费级显卡就能跑。” 这不是夸大:MiniMax 于 8 月 2 日正式把 H3 的权重开源到 Hugging Face(模型卡显示创建于 7 月 28 日,上线几天已收获超过 1400 个 Star),官方 ComfyUI 模板、diffusers 管线、SGLang/vLLM 部署指南同步就位,社区更是火速产出了 NVFP4、INT4、GGUF 等一整套量化版本。
视频生成领域上一次出现这种级别的开源事件,还是 DeepSeek 类模型在文本侧引发的震荡。而 MiniMax H3 的特殊之处在于:它不是一个"文生视频"模型,而是一个全模态(omni-modal)生成系统——输入可以是文字、图片、视频、音频的任意组合,输出是带原生立体声的视频,最高 2K 分辨率、15 秒时长。这意味着"视频生成"和"声音生成"第一次在同一个 33B 模型里被统一建模。
放到行业坐标里看,这一步的意义更清楚。过去两年视频生成的开源主力是"单任务模型":文生视频、图生视频各玩各的,声音更是老大难——要么输出无声视频、后期用 TTS 和音效库拼接,要么像部分商业模型那样单独训一个音频模型再接上去,口型、环境音与画面的同步始终是缝合痕迹的重灾区。H3 的选择是彻底不同的路线:让同一个 Transformer 同时预测视频和音频的潜在表示(latent),从根上消灭"声画不同步"。这也是它敢把"原生立体声"写进卖点的底气。

背景:Hailuo 系列的"任务大统一"路线
MiniMax 的视频模型此前叫 Hailuo(海螺)。官方博客复盘了演进路线:Hailuo 01 从零搭建系统,Hailuo 02 聚焦架构效率、数据质量和规模,而 H3 的目标是打破任务边界。此前的生成模型被切得七零八落:图像侧有 T2I、编辑、主体参考、运动参考、风格参考等一堆"专家模型";音频侧人声、音效、音乐各玩各的;视频侧更是碎片化成文生视频、图生视频、首尾帧、主体参考、运动参考、语音参考、视频编辑……每个任务一个模型,能力互相隔离。
H3 的答案是一句话:用自然语言做"任务之间的桥梁"。参考与编辑关系不再限定在固定任务集里,而是通过语言自由表达。比如官方示例的提示词是:“参考视频 1 里的希区柯克式运镜,让图 2 里的角色唱歌,人声要和音频 3 匹配。“H3 自己完成跨模态的理解和生成。训练侧同样贯彻统一:文生图、文生视频、原生多镜头建模、文生音频、广义参考与编辑全部混在一起预训练,官方称"正确的数据混合比例是关键”。
核心技术拆解:一个 Transformer 吃下所有模态
H3-Omni Transformer:33B 稠密单流
H3 的核心是一个 33B 参数的稠密单流 Transformer,不做 MoE。值得注意的是其中约 13B 参数位于 AdaLN(自适应层归一化)相关分支——由于 AdaLN 的调制输出可以预计算缓存,纯推理部署时这部分参数可以不加载,实际生效约 20B。位置编码采用三维多模态 RoPE(MM-RoPE),在时间 (t)、高 (h)、宽 (w) 三个维度上表达位置关系。官方还披露:训练阶段原生引入了稀疏注意力以降低长序列成本,但稀疏注意力实现未包含在本次开源版本中,将后续发布。
H3-VAE:压缩率是性价比的命根子
视频生成的成本大头在序列长度。H3 的视觉 VAE(H3-VisualVAE)是时间因果视频自编码器:空间压缩 16 倍、时间压缩 4 倍、24 个潜在通道(f16t4d24),潜在表示再按 1×2×2 的 patch 切分,进入 Transformer 时等效空间下采样 32 倍。音频 VAE 则把 32kHz 音频压缩成 40Hz 的潜在 token 序列,左右声道各自独立编解码再重组,实现立体声。官方称新 tokenizer 带来了"全方面的重建质量和可学习性提升”,4 倍的有效序列长度增益"是原生 2K 支持的关键技术"。编码器复用 Qwen3-VL-32B 的完整预训练权重(Apache 2.0 许可),取第 50 层隐藏状态喂给 Omni-Transformer。
三模块系统:开源的是"中间那一截"
完整 H3 系统由三个模块组成:H3-Context-IR(把复杂的多模态输入理解、提炼成结构化中间表示——官方称大部分素材需要约 10 万 token 的推理,蒸馏成平均约 4K token)、H3-Base(基于中间表示生成 768p 视频+音频,本次开源的权重)、H3-Regenerate-2K(把 768p 结果连同原始上下文一起"回炉"再生成 2K 高清版,用模型自身能力替代传统超分)。后两者是"以 2K 输出为默认"的官方 API 定价能压到主流三分之一的关键——但 Context-IR 和 2K 再生成模块都没有开源,官方提供 API 复现,并鼓励开发者按 Prompting Guidance 自建预处理系统。
具体到开源内容,H3-Base 以 FL2VA、Ref2VA 两个任务化 checkpoint 发布,每个都是自包含的 HF 风格仓库:model_index、processor、tokenizer、text_encoder、transformer、visual_vae、audio_vae 七个组件齐全,一行 hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3 即可拉全。权重是 CFG 蒸馏过的(CFG-distilled),推理时不需要 classifier-free guidance 的双倍计算。输出规格上,支持 21:9、16:9、4:3、1:1、3:4、9:16 等常见画幅,默认短边 768px、24 FPS、32kHz 立体声,覆盖中英法德日韩阿俄西意葡 11 种语言。训练侧还有个值得注意的细节:由于多模态上下文使序列长度方差扩大了三倍,理解与生成两类负载的计算特征差异显著,官方采用"理解/生成负载分离训练"的架构,端到端训练吞吐提升了近 30%——这解释了为什么 33B 的规模能把成本压到这么低。
上手:从 diffusers 三行代码到四卡 SGLang
对开发者最友好的是 diffusers 接入,官方示例只需三行:
|
|
本地完整部署推荐 SGLang:模型分 FL2VA(首尾帧模式:支持 0/1/2 张输入图,对应文生视频/首帧生视频/首尾帧生视频)和 Ref2VA(全参考模式:最多 9 张图、3 段各 2–15 秒的视频、3 段音频,混合输入总数上限 12 个文件)两个 checkpoint,官方命令是 4 卡 --ulysses-degree 4 并行。想省事的直接用 ComfyUI 官方模板(T2V/R2V 两套),或者等社区量化版——开源当天 NVFP4、FP8、INT4、GGUF 版本就已铺开,官方宣称"为消费级 GPU 设计"的底气主要来自这里。输出规格上,默认 768p 短边、24 FPS、32kHz 立体声、支持包括中英法德日韩阿俄西意葡在内的 11 种语言对话。
社区反应:一天之内"全家桶"到位
开源社区的响应速度本身就是最好的背书。权重上线当天,Hugging Face 上就出现了 NVFP4、FP8、INT4、GGUF 等全套量化版本(NVFP4 是英伟达新 Blackwell 架构主推的 4-bit 浮点格式,INT4/GGUF 则照顾老显卡和 CPU 推理),Comfy-Org 官方仓库同步放出 T2V、R2V 两套工作流模板,diffusers 管线合并进主分支,连 SGLang 官方 cookbook 和 vLLM recipes 都配好了部署指南。模型卡的 discussions 区也很快热闹起来,社区在讨论的焦点已经从"能不能跑"变成了"量化后画质损失多少、Ref2VA 的多模态参考到底能多细"。这种"官方+社区全家桶"的发布节奏,明显是在复刻 DeepSeek 开源时的打法——先给够工具链,再让社区自己长出生态。

深度分析:价格战、开源策略与争议
先说价格,这是 H3 最锋利的武器。MiniMax 官方博客称:2K 分辨率下每秒价格不到主流模型的三分之一,768p 下不到主流 720p 价格的一半。潘达利亚(Pandaily)的报道进一步点明对标对象:约为 Seedance 2.0 的三分之一。视频生成是烧钱生意,这个价格直接改写成本结构——对广告、电商、影视预演这类按量付费的场景,吸引力是决定性的。
再说开源策略,争议点很明显。H3 社区许可协议(8 月 2 日生效)有几个特殊条款:适用地域排除欧盟、英国、韩国和美国——这些地区的用户需要单独联系 MiniMax 申请授权;商业年收入超过 2000 万美元需另行书面授权;不得用 H3 的输出训练其他 AI 模型;商用产品界面须显著标注"MiniMax H3"。支持者认为这是中国厂商在合规压力下的务实之举,跟当年 DeepSeek 引发的"开源是否真开源"讨论一脉相承;批评者则指出,排除美国意味着全球最大的开源开发者市场被挡在门外,“开放权重"的成色要打折扣。此外,“Context-IR 和 2K 再生成不开源"让部分社区用户觉得"开源了个寂寞”——本地只能跑 768p,而官方宣传的 2K 能力必须走 API。
这里要厘清一个概念:H3 属于"开放权重”(open weights),不等于"开源"(open source)——权重可下载、可商用(限地域和营收门槛内)、可微调,但源码级别的训练配方、数据、以及 Context-IR/2K 模块并未公开。这种"半开放"策略在视频生成领域其实是主流:连一贯高调开源的厂商,通常也只放 Base 权重。它的商业逻辑很清楚——用 Base 权重圈住开发者生态和硬件适配,把最值钱的"理解+高清"能力留在 API 里变现。对个人开发者和小团队来说,768p 免费自托管已经足够做产品原型;对追求 2K 质量的商业客户,API 的价格优势(不到主流三分之一)依然是难以拒绝的诱惑。
技术层面的正反观点同样值得记录。看好的一方认为:单模型统一建模音视频、语言作桥的任务泛化路线,是视频生成"从生成片段到参与内容生产"的关键一步,稀疏注意力、CFG 蒸馏、AdaLN 缓存这些工程细节也足够扎实。审慎的一方提醒:33B 稠密模型 + Qwen3-VL-32B 编码器的完整 BF16 权重体积不小,消费级显卡必须依赖量化;官方 benchmark 尚未随权重发布(技术报告"即将推出"),H3 的真实质量上限还需要独立测评来验证——毕竟权重开放了,跑分说话的时代才真正开始。
对开发者的落地建议
如果你是做内容工具、短视频、电商素材或广告创意平台的开发者,MiniMax H3 值得立刻动手试:先跑 diffusers 三行代码验证效果,再用 ComfyUI 模板做工作流原型;生产环境用 SGLang 四卡部署或直接调官方 API(2K 模式)。动手前务必读三遍许可证:确认你的部署地域、营收规模和使用场景(尤其"禁止用于训练其他模型"条款)都在合规范围内。如果你是做开源生态的,H3 的 VAE 和 Omni-Transformer 设计是很好的学习样本——它展示了"语言作为可泛化的计算系统"这一理念如何落到模型架构上。
结尾
从 Hailuo 01 到 H3,MiniMax 用三代模型回答了一个问题:视频生成该走"任务细分"还是"任务统一"?H3 用 33B 参数和三分之一的价格押注后者,并把权重交到了社区手里。无论最终评测结果如何,“一个模型吃下所有模态、原生输出带声音的视频、价格打到主流三分之一"这个组合本身,已经足够让闭源视频模型巨头们重新算一笔账——开源的力量,正在从文本复制到视频。