MiniMax发布全模态视频模型H3:15秒2K原生音视频生成,API价格每秒0.13美元

2026年7月31日,MiniMax正式发布新一代通用全模态视频生成模型 MiniMax H3

image.png

H3可以在同一个上下文中理解文本、图片、视频和音频,并输出最长15秒、2K分辨率、带原生双声道声音的视频。模型还支持已有视频编辑、首尾帧控制、多参考素材生成,以及将参考视频中的动作、镜头和节奏迁移到新角色或场景中。

MiniMax表示,H3面向广告、品牌、电商、产品设计、UI/UX和游戏等商业内容场景。在公司开展的早期测试中,模型重点展示了指令遵循、文字与品牌信息呈现、视频到视频动作迁移等能力。

MiniMax H3目前已经上线官方API,2K视频按每秒0.13美元计费。生成一段完整的15秒2K视频,API成本约为1.95美元。MiniMax称,该价格不到同类主流模型每秒价格的三分之一。

MiniMax H3是什么?

MiniMax H3是一款以视频生成为主要输出形式的通用全模态模型。

它可以统一读取:

自然语言提示词
参考图片
参考视频
参考音频
首帧与尾帧
角色、动作、镜头和风格要求

然后生成包含画面和原生双声道音频的视频结果。官方API文档将其定义为“开放、通用的多模态视频模型”,支持视频生成、参考创作和视频编辑。

这里的“全模态”主要指 输入上下文和理解方式的统一,并不意味着H3可以任意输出Word文档、纯音频、独立图片或长篇文字。

更准确的理解是:

用户可以同时使用文字、图片、视频和音频表达创作意图,H3负责把这些跨模态信息组合成一段新的音视频内容。

最高生成15秒2K视频

根据MiniMax官方API文档,H3当前支持生成:

项目 MiniMax H3规格
输出分辨率 2K
输出时长 4至15秒
时长设置 仅支持整数秒
输出音频 原生双声道音频
输出比例 支持常见比例或自适应
提示词长度 最长7000字符
生成方式 异步任务

用户可以根据内容类型生成:

4秒产品展示
5秒社交媒体镜头
10秒广告片段
15秒完整创意短片

H3目前还提供768P模式,价格为每秒0.09美元,但官方文档显示该模式仍处于封闭测试阶段,需要联系销售后使用。

15秒2K视频需要多少钱?

MiniMax H3采用按输出时长计费的方式。

2K视频价格

视频时长 参考成本
4秒 0.52美元
5秒 0.65美元
10秒 1.30美元
15秒 1.95美元
每分钟 7.80美元

官方2K价格为每秒0.13美元。

768P视频价格

视频时长 参考成本
4秒 0.36美元
5秒 0.45美元
10秒 0.90美元
15秒 1.35美元
每分钟 5.40美元

768P价格为每秒0.09美元,目前尚未完全开放。

MiniMax称,H3在2K模式下每秒价格不到主流同类模型的三分之一,768P模式价格不到主流720P模型的一半。不过,官方没有在发布材料中列出完整的竞品名称、统一分辨率和计算方法,因此这一比较应视为MiniMax的产品定价口径。

参考素材如何收费?

H3允许用户在一个任务中加入多种参考素材。

官方当前计费规则为:

参考音频:免费
前5张参考图片:免费
超过5张后:每张0.04美元
参考视频:根据视频时长和输出分辨率计费

参考视频在2K任务中按每秒0.13美元计算,在768P任务中按每秒0.09美元计算。

例如,用户提交一段10秒参考视频,并生成一段15秒2K新视频,参考视频和输出视频都会产生相应费用。

因此,多参考视频任务的总成本可能明显高于单纯文生视频。

原生双声道音频意味着什么?

过去不少AI视频工作流采用两个独立步骤:

1.视频模型先生成无声画面
2.再使用语音、音乐或音效模型补充声音

这种方式容易出现:

人物口型与对白不匹配
脚步和动作节奏不同步
碰撞声音出现时间不准确
环境声和镜头空间不一致
音乐节奏无法跟随画面变化

H3在视频生成过程中同步输出原生双声道声音,使模型可以共同处理:

人物对白
环境声音
动作音效
音乐
镜头节奏
左右声道空间关系

MiniMax官方明确表示,H3生成的视频支持原生立体声输出,而不是只生成单声道语音或后期拼接音轨。

不过,原生音频并不代表所有口型、台词、音乐和物理音效都会完全准确。商业发布前仍应逐段检查发音、版权、音画同步和声音来源。

支持哪些生成模式?

H3 API目前提供三类主要生成模式。

文生视频

只输入文字描述,从零生成视频。

例如:

一台银色智能咖啡机放在极简厨房中,镜头缓慢推进,咖啡液流入玻璃杯,伴随细腻机械声和轻柔背景音乐。

用户还可以在提示词中增加平移、缩放和固定镜头等摄影机控制要求。

首尾帧视频

用户可以提供:

仅首帧
仅尾帧
首帧和尾帧
首尾帧加文字描述

模型会在指定画面之间生成自然运动和转场。

这类能力适合:

产品状态变化
人物成长
场景转场
Logo动画
海报动态化
广告镜头衔接

多模态参考生成

用户可以同时提交参考图片、视频和音频,并使用自然语言说明各项素材之间的关系。

例如:

参考视频1的希区柯克式镜头运动,让图片2中的人物演唱音频3中的歌曲,保留图片4的服装风格。

H3会尝试分别提取:

视频中的动作或镜头
图片中的角色或商品
音频中的声音与节奏
提示词中的最终创作目标

再将它们组合成新视频。

单次最多支持多少参考素材?

H3的参考输入限制如下:

素材类型 数量限制
参考图片 最多9张
参考视频 最多3段
参考音频 最多3段
混合素材总数 最多12个文件
单段视频时长 2至15秒
视频总时长 不超过15秒
单段音频时长 2至15秒
音频总时长 不超过15秒

参考音频不能单独提交,必须同时提供图片或视频。

支持的主要格式包括:

图片:JPG、JPEG、PNG、WEBP、HEIC、HEIF
视频:H.264、H.265
视频音频:AAC、MP3
独立音频:WAV、MP3

单个视频文件最大50MB,单张图片最大30MB,单个音频文件最大15MB。

V2V动作迁移是什么?

V2V即Video-to-Video,视频到视频。

用户可以上传一段已有视频,让H3读取其中的:

人物动作
舞蹈节奏
摄影机运动
镜头结构
剪辑节奏
表情变化
场景动态

再将这些信息迁移到另一个角色、商品或视觉风格中。

例如:

把真人舞蹈动作迁移到动画角色
将产品广告镜头迁移到另一款商品
保留摄影机移动,更换人物和场景
将现实视频转换成游戏或插画风格
根据参考视频生成相同节奏的品牌短片

MiniMax将V2V动作迁移列为H3早期测试中的重点优势之一,但当前公开材料主要由厂商案例组成,仍需更多用户和第三方测试验证其在复杂遮挡、多人运动和长动作中的稳定性。

品牌文字和商品信息呈现

AI视频模型在商业应用中经常面临一个问题:画面看起来不错,但品牌名称、包装文字和产品结构发生变化。

MiniMax在H3发布资料中特别强调了:

文字呈现
品牌信息呈现
指令遵循
商品及主体一致性

这些能力对电商和广告非常重要,因为生成画面需要尽可能保留:

Logo
包装文字
产品颜色
商品结构
品牌字体
标识位置

MiniMax将这些表现称为“适合商业内容创作”的早期能力,但并未公布大规模商品Logo或文字准确率测试。正式广告仍需逐帧核对,不能直接假设所有品牌文字都能准确生成。

Contextual Omni Representation是什么?

Contextual Omni Representation可以翻译为“上下文全模态表征”。

传统视频模型通常只需要理解一段文字或一张图片。

H3需要同时理解:

目标视频要生成什么
每个参考素材分别承担什么作用
图片、视频和音频之间有什么关系
哪些元素需要保留
哪些动作需要迁移
哪些内容需要修改

MiniMax使用自然语言作为不同模态之间的通用连接与解释方式。

也就是说,用户不需要为“角色参考”“动作参考”“音频参考”和“镜头参考”分别进入不同工具,而是可以通过自然语言描述它们之间的关系。

MiniMax披露,为建立这种全模态表征,团队构建了专门的模型和全模态理解管线。许多原始素材需要约10万Token的推理处理,再被整理成平均约4000 Token的细致描述,用于训练模型理解复杂的音视频关系。

H3-VAE如何降低2K生成成本?

H3重新设计了此前使用的视频Tokenizer,并将新结构命名为H3-VAE。

H3-VAE负责把原始视频和音频压缩成模型能够处理的表示,再将生成结果还原成音视频内容。

MiniMax表示,新Tokenizer在以下方面得到提升:

重建质量
模型学习难度
压缩率
训练效率
推理效率

较高的压缩率带来了约4倍的有效序列长度收益,从而降低训练和推理成本,并为原生2K分辨率提供基础。

这里的“4倍序列长度收益”并不等于视频生成速度直接提高4倍,而是指在相近计算范围内,模型可以更高效地表示和处理音视频序列。

H3-Omni Transformer如何统一不同任务?

以往的视频模型往往为不同任务建立不同模块:

文生视频模型
图生视频模型
主体参考模型
动作迁移模型
风格参考模型
视频编辑模型
配音模型
音效模型

H3尝试在一个通用架构中处理这些任务。

MiniMax表示,在设计H3时,团队甚至放弃了Hailuo 02中部分已经验证有效的架构,因为这些结构会增加任务泛化的复杂度。

H3的目标被概括为两个方向:

通用
高效

由于理解任务和生成任务的计算方式并不完全相同,H3采用理解与生成异构训练架构,分别优化不同工作负载,同时在样本之间进行负载平衡。MiniMax称,这一设计将端到端训练吞吐提高了接近30%。

In-Context Regeneration如何生成2K细节?

不少视频模型采用单独的超分辨率模块,把低分辨率画面放大到2K或4K。

传统超分模块通常只能根据低分辨率画面“猜测”缺失细节。

H3采用的In-Context Regeneration方式,则让基础模型重新读取:

原始提示词
参考图片
参考视频
参考音频
低分辨率生成结果

然后在完整上下文中重新生成高分辨率内容。

这种方式的目标,是让模型在恢复小文字、商品细节和细小结构时,不只依赖低分辨率像素,而是重新利用原始创作上下文。

不过,In-Context Regeneration并不能保证所有小字和Logo完全准确,实际结果仍取决于素材清晰度、镜头距离和文字复杂度。

第三方盲测表现如何?

截至2026年7月31日,Artificial Analysis的Video Arena已经出现H3的早期真人盲测结果。

视频编辑榜

H3在带音频的视频编辑榜中暂列第一:

模型 Elo分数 样本数
MiniMax H3 1130 约5044
Gemini Omni Flash 1121 约10185
HappyHorse 1.0 1096 约17762

文生视频榜

在带音频的文生视频榜中,H3以约1242分暂列第二,接近第一名Gemini Omni Flash的1246分,并领先Seedance 2.0 720P。

图生视频榜

在带音频的图生视频榜中,H3以约1185分暂列第三,排在Seedance 2.0和Gemini Omni Flash之后;在不计算音频的图生视频榜中,H3暂列第二。

这些榜单会随着新增投票不断变化,因此只能代表2026年7月31日前后的早期结果。

此外,H3权重尚未正式发布,所以Artificial Analysis当前仍将LTX等模型列为已实际开放权重的视频模型。

H3真的已经开源了吗?

截至2026年7月31日,答案是:还没有正式完成权重发布。

MiniMax官网已经将H3称为“下一代开放权重通用多模态视频模型”,但公司对外宣布的实际计划是,在未来几天内、符合相关法律法规的前提下开放模型权重。

目前可以确认的是:

项目 当前状态
H3 API 已上线
2K生成 已上线
768P生成 封闭测试
原生双声道音频 已支持
模型权重 计划数日内开放
完整技术报告 尚未发布
开放许可证 尚未公布
本地部署要求 尚未公布
参数规模 尚未公布

因此,更准确的报道表述应为:

MiniMax已经发布H3并开放API,同时宣布将在未来几天开放模型权重。

不宜在权重下载地址和许可证正式出现前,直接写成“完整开源已经完成”。

为什么视频模型开放权重值得关注?

当前高质量视频生成领域仍以闭源API和在线产品为主。

如果H3按计划开放权重,开发者和企业可能获得以下能力:

自建视频推理服务
私有化部署
行业数据微调
角色和品牌定制
国产芯片适配
推理框架优化
学术研究
社区量化和压缩

MiniMax表示,H3从设计初期便考虑不同AI硬件的兼容性,并希望通过开放权重加快更多硬件平台的适配。

不过,是否真正适合个人本地部署,还需要等待参数规模、显存需求、许可证和推理代码公布。

H3适合哪些商业场景?

广告与品牌营销

可以利用品牌图、产品视频、音乐和文字Brief生成短广告,适合快速测试多个创意方向。

电商商品视频

可将商品图、模特图和参考动作组合成商品展示、上身效果和营销视频。

商品结构、颜色、Logo和文字仍需逐帧核对。

游戏内容

可以生成角色动作、概念动画、技能效果、场景预演和宣传片段。

产品设计

使用草图、产品图片和参考视频制作动态概念展示,帮助团队验证产品叙事和使用场景。

UI/UX展示

可以将静态界面转化为动态产品演示、交互宣传片或应用功能介绍。

短视频与影视预演

支持多参考素材和原生音频,可以用于脚本验证、镜头探索和分镜动态化。

MiniMax将广告、品牌、电商、产品设计、UI/UX和游戏列为H3的主要商业方向。

H3当前还有哪些限制?

单次最长只有15秒

长广告、短剧和完整宣传片仍需要分镜生成和后期剪辑。

权重尚未发布

本地部署、显存要求和许可证仍不明确。

768P仍处于封闭测试

普通API用户目前主要使用2K模式。

多参考输入会增加成本

参考视频同样按照时长计费,大量参考素材可能显著提高单次任务成本。

品牌文字仍需核对

官方强调文字和品牌表现,但没有公布全面文字准确率测试。

多人和复杂动作仍可能出错

遮挡、肢体接触、连续身份和复杂物理关系,仍然是当前视频模型的普遍难点。

榜单成绩会持续变化

Artificial Analysis数据来自动态真人盲测,新模型和新增投票都可能改变排名。

如何通过API使用MiniMax H3?

H3的视频生成采用异步任务流程:

1.提交视频生成任务
2.获取task_id
3.定期查询任务状态
4.任务成功后获取视频URL
5.下载并保存结果

API模型名称为:

MiniMax-H3

文本、图片、视频和音频通过统一的content数组提交,并使用不同的类型和角色字段区分素材用途。

一个基础文生视频请求需要设置:

模型名称
文字提示词
视频时长
分辨率
画面比例

正式接入时,应将API Key保存在服务端环境变量中,不要直接写入网页或公开代码仓库。

总结

MiniMax H3于2026年7月31日正式发布并上线API。

模型支持统一理解文本、图片、视频和音频上下文,能够生成4至15秒、2K分辨率、带原生双声道音频的视频,并提供文生视频、首尾帧控制、多素材参考和视频编辑等模式。

H3的2K API价格为每秒0.13美元,一段15秒视频约1.95美元。MiniMax称,这一价格不到主流同类产品的三分之一。

在技术层面,H3包含:

Contextual Omni Representation
H3-VAE
H3-Omni Transformer
In-Context Regeneration

这些设计分别用于跨模态关系理解、音视频压缩、通用任务建模和2K细节再生成。

Artificial Analysis的早期真人盲测显示,H3暂列带音频视频编辑榜第一、带音频文生视频榜第二,并进入图生视频榜前三。

不过,H3目前尚未真正完成权重开放。MiniMax计划在未来几天内、符合法律法规的前提下发布模型权重,具体参数规模、许可证和本地部署要求仍待公布。

H3真正值得关注的部分,不只是15秒2K或更低价格,而是视频生成模型正在从“输入一句提示词,得到一段画面”,转向:

让用户通过文字、图片、视频和声音共同表达创作意图,再由一个模型完成理解、组合、编辑和音视频输出。

相关链接

MiniMax H3 API接口总览

© 版权声明

相关文章

暂无评论

none
暂无评论...