MiniMax H3 正式发布:首款开源全模态生成模型,2K 15秒音画一键搞定

MiniMax 终于放出了今天 AI 圈最受关注的一颗「炸弹」。7月31日,稀宇科技正式发布新一代多模态生成模型 MiniMax H3——这也是 MiniMax 推出的首款开源多模态生成模型,官方宣布将在未来几天内开放模型权重下载,企业可结合自身业务进行本地化部署和优化。

H3 是 MiniMax 从「特化任务模型」迈向「通用多模态智能」的关键一步。与此前 Hailuo 视频系列不同,H3 不再以图片、视频、声音的单一生成或编辑任务为边界,而是能够统一理解由文本、图像、视频与声音共同构成的多模态上下文,自主理解创作者意图,完成更加自然、连贯的内容生成与表达。这种「全模态输入→全模态输出」的设计思路,让 H3 真正成为了一款面向真实创作工作流的通用型多模态引擎。

在核心参数上,MiniMax H3 支持最高 2K 分辨率直出,单次生成最长可达 15 秒的音画内容。值得注意的是,H3 的 2K 视频输出并未采用传统的超分辨率(super-resolution)模块串联方式,而是让 H3 基础模型对自己的低分辨率结果进行 in-context 重新生成——既最大程度复用了基模已有的生成能力,又规避了传统超分方案「靠猜」还原细节的先天缺陷。目前视频生成定价为 2K 分辨率 0.8 元/秒,官方表示通过高压缩 Tokenizer 减少了视频生成所需的 Token 数量,并针对异构训练、负载均衡和 GPU 利用效率等方面进行了优化,在提升效果的同时控制了成本。

在内容质量方面,MiniMax H3 具备商用级多场景内容生成能力,在指令遵循文字与品牌信息呈现V2V Motion Transfer(视频到视频动作迁移)等关键指标上表现出色,可实现精准、可控的多模态内容编辑与生成,广泛适用于广告创意、品牌营销、电商内容、产品设计、UI/UX 以及游戏资产制作等商业场景。根据 Artificial Analysis 视频模型榜单,MiniMax H3 在视频编辑能力单项中排名全球第一

技术层面,H3 借鉴了在文本模型训练中验证有效的方法,包括复杂问题拆解(Complex Problem Decomposition)、ReasoningScaling ContextMuon 优化器,并将这些技术应用于多模态理解、数据构建和模型训练过程。H3 还增加了专属 Caption 能力,定制了全模态理解管线,大部分素材需要消耗约 100K Token 的推理量,最终压缩为平均约 4K Token 的有效表示。

开源是本次发布最受关注的焦点之一。MiniMax 联合创始人兼技术团队表示,H3 是公司首次开源多模态生成模型,此举旨在推动开发者及国产 AI 芯片厂商共同参与模型适配和生态建设,同时帮助有安全合规需求的企业实现本地化部署。随着权重即将开放下载,H3 有望成为国内开源多模态视频生成领域的新标杆。