2026-08-09 整理 · 全部规格来自官方页面,二手传闻一律不收
过去做一条 AI 短片,你大概要开四个站:一个生成画面、一个配音、一个对口型、一个改画面。 每换一次工具,风格就飘一次,音画还得自己再对。
H3 的做法是:在预训练阶段就把这些任务一起建模,不再拆成一个个独立的专家模型。 官方原话是「打破任务之间的边界」——用自然语言表达要做什么,而不是先选一个任务模式。
它是一个全模态生成模型:能同时读文字、图片、视频、音频, 直接吐出带原生立体声的音视频。
| 任务 | 你给它什么 | 典型用法 |
|---|---|---|
| T2VA 文生音视频 |
一段文字 | 从零起一个镜头,连声音一起出 |
| FL2VA 首 / 尾帧生成 |
第一帧,或最后一帧 | 已有一张定好的画面,让它补出这段动态 |
| Ref2VA 多模态参考 |
图 / 视频 / 音频当例子 | 要它像某个风格、某个动作、某个声音 |
| 项目 | 官方数值 |
|---|---|
| 发布 / 开源 | 2026 年 8 月 3 日 |
| 模型规模 | 33B 稠密模型(H3-Omni-Transformer),其中约 13B 在 AdaLN 相关分支 |
| 权重 | BF16,HuggingFace MiniMaxAI/MiniMax-H3、ModelScope |
| 时长 | 4–15 秒 |
| 帧率 | 24 FPS |
| 分辨率 | 默认 768p,最高 2K(走 H3-Regenerate-2K 模块) |
| 声音 | 32kHz 原生立体声,与画面联合生成 |
| 对白语言 | 稳定支持 11 种:中、英、日、韩、法、德、意、西、葡、俄、阿 |
| 画面比例 | 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16 |
| 部署示例 | 官方文档给的是 SGLang + 4 张 GPU |
| 协议 | MiniMax H3 Community License Agreement |
※ 关于价格:官方 blog 只写了相对说法——「2K 每秒价格不到主流模型的三分之一, 768p 不到主流模型 720p 的一半」。网上流传的具体每秒单价,在官方定价文档里查不到 (该页明确写着视频资源包暂不支持 MiniMax H3),所以这里不写死数字,以你下单时页面为准。
Ref2VA 这一支是最实用的部分。它一次能接:
一类参考只解决一个问题:人物用 2-3 张不同角度的图, 风格用 1-2 张成片截图,动作用 1 段短视频。混在一起给九张同类图,它反而抓不到重点。
把九张风格迥异的图一起丢进去,然后写「参考这些」。 参考之间打架的时候,出来的东西通常哪个都不像。
这是最多人忽略的一条。「开源」不等于「随便商用」。
默认出的是 768p。2K 要再走一个重绘模块,成本和时间都不一样。
单条 4–15 秒。它是拿来做镜头的,不是拿来做整片的。 长片得靠你自己分镜、生成、再剪。
33B 稠密模型,官方给的部署示例是 SGLang 四张卡。 一张消费级显卡先别折腾,走 API 更快见效。
它的声音是跟画面一起生成的。 意思是——声音的描述要写进同一段 prompt 里,而不是等出片了再想配什么。
开源公告:minimax.io/news/minimax-h3-open-source
技术说明:minimax.io/blog/minimax-h3
模型权重:huggingface.co/MiniMaxAI/MiniMax-H3
部署文档:github.com/MiniMax-AI/MiniMax-H3
这份清单只是选型。如果你想要的是一整套能跑起来的工作流—— 选题、生成、排版、发布、私信自动化,一步步照着做—— 我把自己在用的那套整理成了《AI 进阶实战包》。
去看看实战包 →