2026年7月31日,MiniMax正式发布H3(Hashimoto H3)。这是全球首个在预训练阶段统一文本、图像、视频、音频全模态理解的生成模型,输出原生双声道音视频,最高支持15秒2K分辨率。H3的设计目标明确:从专用迈向通用,用一个模型替代过去多个独立专家模型的工作。
一句话结论
MiniMax H3是当前最具性价比的全模态生成模型,2K分辨率下API价格不到主流封闭模型的1/3,核心技术是Contextual Omni Representation加统一任务建模,适合广告、电商、游戏等商业场景创作者。
为什么是打破边界而不是又一个视频生成器
过去三年,视频生成领域的主流范式是任务分工:文生视频、图生视频、首尾帧、主体参考、动作参考各用独立模型,声音生成中的人声、音效、音乐也分别建模。图像、视频、音频之间有清晰边界。这种模式训练效率高,但限制了使用自由度,用户无法用自然语言描述一个跨越模态的复杂任务。
H3的预训练从第一天起就取消了这些边界。数据和任务层面,文生图文生视频共用一个生成器,音频不区分人声、音效、音乐而统一联合建模。参考和编辑同样打破模态限制:图片可以参考图片、图片可以参考视频、音频可以参考音频,关系全部由自然语言描述。这就是广义参考和编辑,完全由真实自然数据构成,具备良好的数据扩展性,不局限于预设任务类型。
核心技术:三项架构支撑统一建模
H3的技术核心是Contextual Omni Representation(上下文的全模态表示)。配合H3-VAE(变分自编码器)、H3-Omni Transformer和In-context Regeneration(上下文内再生)三项子技术,实现了跨模态的统一理解与生成。
在预训练层面,团队最重要的一项工作是增强Caption能力。多模态上下文引入后,Caption的定义被泛化:不止需要描述目标视频,还要描述上下文和目标之间的关系。例如输入可以是「参考视频1的希区柯克镜头运动,让图2中的人物唱歌,歌声参考音频3」——这种跨模态的复合指令,H3可以原生理解并执行。
性能与价格:2K分辨率下每秒不到主流1/3
根据MiniMax公布的基准测试,H3在指令遵循、文字与品牌信息呈现、V2V Motion Transfer等商用核心指标上表现优异,默认提供2K分辨率。价格方面,2K分辨率下每秒API价格不到主流模型的1/3,768P分辨率下是主流模型720P价格的1/2,按调用量计费。
应用场景:从电影片头到游戏UI
H3的目标场景覆盖广告、品牌、电商、产品设计、UI/UX、游戏等商业领域。官方展示了电影片头、游戏UI、动态海报、广告电商四个典型案例,均由自然语言Prompt驱动生成,无需人工分步操作。
视频模型的应用形态正在发生变化:创作者可以直接描述任务目标,而不仅是输入一段画面提示词。随着多模态理解和指令遵循能力持续提升,视频模型将逐步从生成一段视频走向真正参与内容生产的全流程。
开源计划:计划开放模型权重
长期以来,闭源模型主导视频生成领域,迭代速度和生态开放性落后于大语言模型。H3设计初期就考虑了多款国产芯片的兼容性,MiniMax计划在未来几天内在符合相关法规的前提下开放模型权重,推动开源社区发展和国产芯片适配。
数据表:H3核心参数一览
| 指标 | 参数 |
|---|---|
| 输入模态 | 文本、图像、视频、音频,四种模态上下文统一理解 |
| 输出形式 | 原生双声道音视频,最高15秒2K分辨率 |
| 分辨率 | 默认2K,支持768P |
| 价格(2K) | 每秒不到主流模型的1/3 |
| 价格(768P) | 为主流模型720P的1/2 |
| 核心技术 | Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration |
| 开源计划 | 计划开放权重,优先支持国产芯片适配 |
| 典型场景 | 广告、电商、游戏UI、电影片头、动态海报 |
FAQ:关于H3你最想知道的
Q:H3和传统的专用视频生成模型有什么本质区别?
A:传统模型针对每个子任务单独训练,文生视频、图生视频、音频生成各自独立。H3在预训练阶段就建立了统一的任务框架,用自然语言作为跨模态泛化的桥梁,同一个模型既能处理视频生成,也能处理跨模态的参考编辑,不需要针对每个任务单独微调。
Q:H3的定价是否有峰谷之分?
A:有。MiniMax采用峰谷定价,闲时价格为高峰时段的一半,鼓励用户根据实际使用场景调整任务提交时间,以获得更低成本。
Q:H3和Qwen3.8-Omni-Flash在定位上有何不同?
A:Qwen3.8-Omni-Flash主打耳聪目明、办事得力,偏向通用多模态助手能力;H3聚焦商业内容生成,默认输出2K分辨率音视频,针对视频创作场景深度优化,两者定位互补。
相关阅读
- DeepSeek V4.1 Flash发布:552B MoE、KV缓存缩437倍、V4 Pro退役
- Qwen3.8-Omni-Flash:耳聪目明,办事得力
- Claude管理智能体新增动态工作流:1000路并发
- Cloudflare Clef-omni:首个音视频开放权重决策模型
延伸阅读
- Kimi K3开放权重:2.8万亿参数MoE开源,MoonEP/FlashKDA/AgentEnv三项Infra同步公开8 小时前
- 芒果灵创 AIGC 平台解析:《后西游记》首度上星带动股价两连板,三维动画成本降到几千元一分钟3 周前
- Utopai Studios估值破10亿美元:00后创始人,Google X背景3 天前
- Qwen3.8-Omni-Flash发布:原生全模态Agent,29项基准涨25%,音视频API降幅超93%8 小时前
