📖 文章导读:
3 秒生成 5 秒 720p 视频,渲染速度首次跑赢播放。fal 基于 MiniMax 开源 H3后 训练的 H3 Max,吞吐量达官方接口 35 倍,登顶 Artificial Analysis 图生视频榜。本文通过多维对比实测,看看它究竟有多快、质量能否跟上,以及这个“视频模型 Flash 时刻”到底意味着什么。
8 月 27 日,AI 模型推理平台 fal 宣布:我们拿 MiniMax 开源的 H3 视频模型做了大规模后训练,产物叫 H3 Max。

官方文档清楚地写着:H3 Max 生成一段 720p 的5 秒视频,耗时3秒。
我的第一反应是:这不是typo笔误吧,渲染生成比播放还快?
接着看了看评论区:一边是官方对于该模型测试成绩的数据,一边是用户们的诧异与惊叹。
读完官方文档,发现这模型不止于快——H3 Max 的吞吐量约是 MiniMax H3 官方接口的 35 倍,比所有同等画质水平的竞品平均快 15 倍。在人类偏好评估中,H3 Max 的质量也极其能打,Design Arena 的图生视频榜单 Elo 1341,Artificial Analysis 的图生视频榜第一。

测 H3 Max 之前,必须先交代它的出身,因为这个版本线解释了它的实力从哪来。
第一代:MiniMax H3(母模型)
7 月 31 日,MiniMax发布了 H3,定位是全模态(omni-modal)视频生成模型。8 月 3 日,他们把基础权重开源到了 Hugging Face。
这个母模型本身就很有料,三个关键点:
- 33B 参数的单流稠密 Transformer,文字、图片、视频、音频 token 全部塞进同一条序列处理,不再为「编辑」「参考生成」各养一个专家模型
- 原生音频:画面和 32kHz 立体声在同一次前向推理里一起生成——不是先出哑剧再配音的管线。
- 全能参考:一次生成调用最多喂 9 张图、3 段视频、3 段音频,同时锁定风格、角色、动作和人声
第二代:H3 Max(fal 后训练版)
用 fal 自己的话说,这是一次左右互搏:research 团队负责把模型练得更强,inference 团队负责把推理引擎榨干——而且两边是同时开工、互相喂数据的。H3 Max 的架构设计直接围绕 fal 自家优化了四年的推理引擎展开,训练和部署全部跑在 NVIDIA GB200 NVL72 集群上。
MiniMax H3 团队也公开站台:
「H3 Max 将 SOTA 级的视频画质与生成速度的阶跃式提升结合在一起……我们从第一天起就和 fal 紧密合作。」
一句话总结:
H3 Max = MiniMax H3(开源底子) + fal 后训练(对齐与美学) + fal 推理引擎(速度)
榜单排名


MiniMax H3 Max在 Artificial Analysis 的文生视频、图生视频榜单上分别排在第三,第一位。
(注:该榜单未上线Seedance 2.5)
用户评价

本次评测,302.AI将对MiniMax H3 Max进行多维度实测,对手选择同样才上线的Wan 3.0,以此了解模型真实能力,验证其实用边界。
1. MiniMax H3模型基础信息
(1)实测模型在 302.AI 的价格:
| 模型名称 | 参数 | 302.AI内的价格 |
|---|---|---|
| MiniMax-H3-Max | 480P | $0.06 / 秒 |
| 768P | $0.096 / 秒 | |
| wan3.0-video | 480P | $0.05 / 秒 |
| 720P | $0.1 / 秒 | |
| 1080P | $0.2 / 秒 |
(2)测评目标:
生成质量与美学:评估各模型在图像生成的视觉效果,包括提示词遵循、细节表现、以及是否存在伪影或失真等。
指令理解与执行准确性:测试模型对文本或图像指令的理解能力,检查生成结果是否准确反映用户意图。
(3)测评工具:
均使用 302.AI 的 API 超市→在线调试功能
(4)测评方法:
各案例均使用统一的英文提示词和图片进行生成,均取第一次生成结果,评测结果仅供参考。
2. MiniMax H3 Max 实战案例
案例1 -文生视频-人物动作
提示词:
画质规格: 5 秒实拍片段,16:9,电影级写实光影,自然室内漫射光。
场景环境: 武馆内景。背景含虚化的木人桩、沙袋与镜子,暖色顶灯,空气中带有微尘。
主体设定: 约 30 岁白人男性,身材精悍,身穿致敬李小龙《死亡游戏》的经典黄底黑条纹运动服。
核心动作: 高速舞动双截棍(连续八字挥击、过肩回旋、手腕速转与精准的肩臂反弹借力),步法轻盈扎实。最后 1 秒利落将双截棍夹于腋下,定格为李小龙经典格斗姿势(屈膝微前倾,眼神凌厉直视镜头)直至片段结束。
动态规范: 双截棍动作需符合真实物理连贯性,严禁肢体多余或形变畸变;仅棍身产生动态模糊,人物保持锐利清晰;服装纹理稳定;一镜到底无剪辑。
机位运镜: 胸部高度固定机位,正面中全景,5 秒内平缓微推。
声音设计: 无背景音乐,纯拟真现场音效(双截棍破空呼啸声、肢体碰击声、木地板摩擦步伐声与沉稳呼吸声)。
输出效果:
| 模型 | H3 Max | Wan3.0 Video |
| 评分 | 3/5 | 3.5/5 |
| 简评 | 两条都是废片。H3 Max扣分点:提示词明确要求主角为约30岁白人男性,未遵循;未施展双节棍标志性动作,只是在身前横向挥舞;人物眼神死板。Wan扣分点:一根双节棍直接变成了两根。其他物理动作,音效再好,也是条废片。 | |
案例2 -文生视频-商品广告
提示词:
画质基调: 10 秒高端科技广告,16:9,高对比清透光影,快节奏剪辑卡点,电影级调色。
0–3秒(产品亮相): 纯黑影棚与边缘轮廓光。硬核运动相机(矩形机身、大圆镜头、防滑纹理、前置彩屏)居中悬浮。镜头 360° 平滑环绕,光束扫过镜片与金属边缘,呈现精细材质细节。
3–9秒(极限场景 POV 蒙太奇,含 4K60 简易 UI 边框):
3–4.5秒(跳伞): 跳出机舱、俯冲旋转、伞包弹开。
4.5–6秒(潜水): 扎入深海、气泡爆散、阳光透射珊瑚鱼群。
6–7.5秒(机车): 峡谷极速贴地压弯、护栏近距离飞掠。
7.5–9秒(跑酷): 黄昏楼顶冲刺、跨楼凌空飞跃。
9–10秒(品牌定格): 切黑,相机剪影打光亮起。显示粗体工业无衬线品名 “VELOCITY X” 与口号 “EVERY HEARTBEAT. ON RECORD.”,镜头耀光闪烁收尾。
运镜与规范: 360° 环绕居中平滑;第一人称 POV 具写实晃动与超广角微鱼眼透视;镜头精准卡点音乐节奏;机身外观、屏幕与标识严格锁定无形变。
声音设计: 120 BPM 强节奏电子乐伴随重低音 Drop,呼啸转场;叠加场景音效(风噪、水下闷音、引擎轰鸣、脚步声);尾段伴随重音打击与高光泛音收尾。
输出效果:
| 模型 | H3 Max | Wan3.0 Video |
| 评分 | 2.5/5 | 2/5 |
| 简评 | 不可用的废片。H3 Max扣分点:产品直接上了DJI Action的造型,Logo都不带改的,背面没有液晶屏不符合该类产品设计;跑酷场景等于跳楼。Wan扣分点:跳伞场景人物与飞机位置关系错误;潜水场景人物手持未作防水处理的相机直接入海;跑酷等于跳楼。 | |
案例3 -图生视频-电影氛围
提示词:
画质基调: 5 秒史诗战争电影级画面,极致高对比度黑白影调,粗粝胶片颗粒,强逆光与鲜明边缘轮廓光,极具戏剧张力的明暗对照。
机位运镜: 低角度沉稳向前推镜——由全景平稳推至主将半身中景,带微弱的手持厚重感;焦点死死锁定中央主将,随着推近背景自然虚化。
主体动作: 宏伟古城门中央,一位身形魁梧的斯巴达式统帅伫立如雕像,在逆光中呈肃穆剪影。缓慢地抽出腰间的佩剑,威严且具压迫感地抬起佩剑直指镜头,剑刃边缘反射出一道凌厉的轮廓光;动作沉稳决绝,不怒自威。
背景动态: 统帅身后,大批手持长矛与圆盾的士兵从昏暗的城门狂啸冲杀而出,在两侧形成动态模糊;烟尘与雾气在逆光中剧烈翻滚,冲锋的混乱狂暴与统帅如磐石般的静止形成强烈反差。
一致性规范: 统帅剪影、头盔顶冠、盔甲与披风细节严格锁定;披风与扬尘随冲锋风压自然飘动;面部完全隐藏于阴影不露脸;武器与盔甲坚固无畸变。
声音设计: 震撼的史诗战鼓(沉重、缓慢递增的行军节拍),叠加数百名士兵穿过城门回荡的战吼与冲锋踏地声、风沙呼啸;终结重音卡点在长剑完全抬起的一瞬重重落下。
参考图

输出效果:
| 模型 | H3 Max | Wan3.0 Video |
| 评分 | 4.5/5 | 4/5 |
| 简评 | H3 Max胜。H3 Max:无明显错误,提示词遵循程度高,人物动作合理,一致性无崩坏,音效准确;如果剑尖指向镜头会更好。Wan:明显问题在于拔剑的动作。按画面中展现的,可谓是磁悬浮佩剑,拔剑毫无物理交互。 | |
案例4 -图生视频-动画
提示词:
6秒黑暗奇幻动画片段,高对比黑白影调+人物专属猩红灵压点缀,浓重水墨式阴影,戏剧化逆光,电影级动画质感。
0–2秒(蓄力): 低角度仰拍——黑崎一护悬浮空中,黑色死霸装披风翻卷,橙色刺猬头被苍白满月逆光勾边,猩红灵压火焰缠绕颈部、手臂与双腿。他将巨刃斩月猛然举过头顶——镜头急推至刀刃与面部——黑色月牙环骤然爆发,一道巨大的黑红月牙形灵压波(月牙天冲)冲天而起,掠过镜头。
2–3秒(匹配转场): 飞出的月牙变形为吞没月亮的黑色圆盘——月牙本身化为月食。一次无缝转场。
3–6秒(月食): 大远景——通天层叠巨塔居于画面正中,上方天色渐暗。阴影以加速的节奏从边缘吞噬月亮,白色日冕光环随月亮消失变得越细越亮,丁达尔光束穿透翻滚的云层后逐渐熄灭。镜头:缓慢升降机后拉远离巨塔,最终定格于死黑天空中孤独的黑日。
一致性: 一护造型与参考图完全一致——橙色刺猬头、破烂黑色高领披风、白色胸前徽章、绷带缠绕的刀柄、猩红灵压只出现在人物身上;刀身形状稳定不变形;巨塔与月食构图与第二张参考图一致;天空场景保持纯黑白。
音频: 黑暗史诗管弦——前2秒压缩完成低鸣与圣咏渐强,月牙天冲发射瞬间一记猛烈的 braam 重击,月食段转入空洞的次低频轰鸣与缓慢的仪式感太鼓,日冕熄灭时风声归于死寂,最后一记低音管风琴收尾。
参考图:

输出效果:
| 模型 | H3 Max | Wan3.0 Video |
| 评分 | 4/5 | 4.5/5 |
| 简评 | Wan 3.0 Video 胜。两款模型比较明显差异在于世界知识,虽然参考图的一护形象是近期最新的,但H3还原了原作一护的形象(标志性橙色头发);Wan虽然形象发生偏移,但此外人物的呐喊,镜头调度,月亮产生的特效都更具冲击力。 | |
案例5 -图生视频-英文口播
提示词:
画质基调: 6 秒竖屏 9:16 TikTok 风格开箱视频,明亮柔和自然窗光,真实博主日常质感,微弱手持呼吸感。
场景与主体: 年轻女性,留深色长发,淡妆,佩戴银戒,着修身黑色长袖与蓝色牛仔裤;背景为虚化的黑白时尚画框与鞋架。手中展示一双鼠尾草绿、灰褐与白色拼色的复古德训风运动鞋(翻毛皮拼接光面皮、粗圆白鞋带、金属银扣、生胶米白鞋底)。
分段流程(一镜到底与自然手持运镜):
- 0–2秒(全貌展示): 中景,在胸前双手托起整双鞋,微倾朝向镜头,面带兴奋微笑,展示完整鞋型与配色。
- 2–4秒(细节特写): 单手将单只鞋推近镜头,缓慢旋转展示侧身弧度与翻毛皮鞋头,指尖轻点翻毛皮质感与金属鞋带孔细节。
- 4–6秒(鞋底与互动收尾): 翻转展示鞋跟与生胶鞋底,随后将双鞋托在脸颊旁,露出惊喜喜悦的神情,以温暖灿烂的笑容直视镜头定格。
台词与对口型(甜美、轻快、具感染力且口型严密同步):
- 英文原声: “Okay, these are SO much prettier in person — the sage green suede? Unreal. And feel how soft this leather is… I’m obsessed.”
- (译意:“天呐,实物比图片好看太多了——这个鼠尾草绿翻毛皮绝了!而且摸摸这皮质有多软……彻底被拿捏了。”)
声音设计: 甜美柔和的年轻女声,语带笑意与自然呼吸感,轻快不刺耳;纯自然室内环境底噪,无背景音乐。
一致性与质量规范: 人物面容、发型与服装全程锁定一致;手部结构精准无畸变;鞋款设计、配色、皮质纹理在各角度严格保持一致且无变形;鞋子始终处于清晰对焦点,背景自然虚化;竖屏构图确保鞋身不被边缘裁切。

输出效果:
| 模型 | H3 Max | Wan3.0 Video |
| 评分 | 4.5/5 | 5/5 |
| 简评 | Wan 3.0 Video 胜。两条视频的音画放社媒上都足以以假乱真。Wan的胜点:1.人物神态细节,尤其是眨眼更为自然细腻。你可以对比数一下两条视频的主播分别眨眼多少次,且有一次眼神是朝向鞋子,而非一直盯向镜头;2.断句和语气,尤其是“Unreal. ”这句,结合了一个摆手的动作,还原成中文语境就是“这鞋绝了”,非常自然。 | |
案例6 -图生视频-中文口播
提示词:
5秒竖屏自拍风格Vlog视频,真人实拍质感,生活化随性风格,普通室内照明,轻微前置摄像头画质,自然手持微晃。
人物与场景: 一位中年中国男性,黑灰色头发凌乱蓬松,留着花白山羊胡,身穿深蓝色翻领衬衫外套、内搭白色T恤,坐在一把黑色椅子上。背景是杂乱的私人房间——身后黑色置物架上摆放着头盔和狐狸面具,右侧挂着一件红色足球球衣。真实、不修饰的Vlog氛围。
动作与表演(两个节拍):
- 0–2.5秒: 他低头看向画面外拿着的手机,用平淡、面无表情的语气念出评论,眉头微皱,口型与台词精确对应。
- 2.5–5秒: 他抬头直视镜头,露出一丝玩味的笑,用随意、理所当然、略带调侃的语气回答——配合自然的头部动作,最后一个字轻轻耸肩。
台词(中文,必须精确对口型): (低头念)”有网友问:谷歌这几个月就憋出几个flash模型,是不是不行了?” (抬头答)”这是好事儿啊,flash不够你用啦?”
声音: 自然的中年男声,略微沙哑、懒洋洋的,东北味儿口语节奏;只有环境底噪——不要任何背景音乐。
一致性与质量: 面部、发型、胡须、服装与参考图完全一致;说话过程中五官稳定,不变形、不失真、不换脸;嘴部动作和眨眼自然真实;背景保持静止不变;单镜头连续拍摄,不切换。
参考图

输出效果:
| 模型 | H3 Max | Wan3.0 Video |
| 评分 | 5/5 | 3/5 |
| 简评 | H3 Max胜。首先要注意提示词并未要求生成字幕,两款模型都自主添加了字幕,但效果可谓天上地下。此外显著差异是两者的人声,H3的人声不得不说有点峰味。最后,Wan在这短暂5秒,明显应该一镜到底的场景中出现了镜头剪辑(读提问/回答有画面断层)。 | |
3. MiniMax H3 Max视频模型实测结论

基于本轮实测,H3 Max确实给我留下了深刻印象,尤其是图生视频模式,怪不得冲到了AA榜单第一:
- 提示词遵循:台词逐字说完,不乱改、不漏词、不加戏
- 镜头调度:构图锁定人物,机位准确、不乱切
- 物理动作:动作音频同步,没有肢体穿模
- 口播:中英文口型都对得上,没有后期配音感
- 文字渲染:文字准确清晰不乱码
和Seedance 2.5这种真旗舰比,单项都不算顶尖,但全部过了可用线。
视频模型的 Flash 时刻来了
最近这几个月,中外各模型厂商你方唱罢我登场,纷纷推出Flash版本:快、便宜、质量能满足绝大多数场景需求,大家都明白这个道理——
80% 的场景不需要 100% 的智能,只需要 90% 的质量 × 10 倍的速度 × 1/10 的价格。
现在,同样的剧情正在视频领域复现。
H3 Max 就是视频模型的 Flash 时刻开幕。它的定位从一开始就不是最强的视频模型,而是够好、够快、够便宜的选项。
当渲染时间跌破实时阈值,量变就引发了质变:你不再「提交任务 → 等结果」,而是「说一句 → 立刻看到 → 马上改一句」。剪辑师第一次可以拖着时间线走,视频跟着实时渲染出来。
快,不是噱头。快本身就是产品形态。
基于这次实测,直接说推荐场景:
- 自媒体口播号——知识博主、新品介绍、探店视频。一张形象图 + 一段文案,10多秒出 10 秒成片,一人就是一个播报台
- 边剪边产的后期——B-roll、标题卡、动态转场,缺什么镜头当场生成,不用等队列
- 营销团队的素材铺量——一条文案出 20 个版本丢进 A/B 测试,速度和单价就是武器
不推荐的场景(至少现在不是):
- 影视级工业需求——768p 是这个模型的天花板,要 2K 以上的画质还是得选闭源旗舰模型
- 超过 15 秒的叙事长片——单次生成的上限摆在那里
- 逐帧精确控制的分镜需求——需要「每一帧都在掌控中」的场景,传统工作流仍然是答案
写在最后
MiniMax H3 Max 不是又一个挤牙膏式的视频模型。
它证明了一件事:画质与速度的跷跷板,是可以同时踩下去的。 开源底模 + 后训练 + 推理引擎协同设计,这条路线跑通了。
当等待消失,创作就会进化。
H3 Max 不是终点,它是视频模型 Flash 时代的发令枪。
常见问题 FAQ
Q1:MiniMax H3 Max 是什么?和 MiniMax H3 有什么区别?
MiniMax H3 Max 是 fal 基于 MiniMax 开源的 H3 视频模型做大规模后训练得到的版本,可以理解为 MiniMax H3 + fal 后训练 + fal 推理引擎的组合。和母模型 H3 的核心区别:1)速度——生成一段 720p 的 5 秒视频仅需 3 秒,吞吐量约是官方接口的 35 倍,比同等画质竞品平均快 15 倍;2)质量——在人类偏好评估中极其能打,Design Arena 图生视频 Elo 1341。它和 H3 同源,但更快、更适合高频生产。
Q2:什么是视频模型的 Flash 时刻?H3 Max 为什么快?
视频模型的 Flash 时刻指的是:当渲染时间跌破实时阈值,你不再提交任务等结果,而是说一句立刻看到、马上改一句,剪辑师可以拖着时间线走让视频实时渲染出来。H3 Max 之所以快,是因为它的架构设计直接围绕 fal 自研四年优化的推理引擎展开,训练和部署全部跑在 NVIDIA GB200 NVL72 集群上,research 和 inference 团队同步开工、互相喂数据,把推理引擎榨到极致。
Q3:MiniMax H3 Max 的生成速度有多快?
根据官方文档,H3 Max 生成一段 720p 的 5 秒视频耗时仅 3 秒,渲染生成比播放还快。它的吞吐量约是 MiniMax H3 官方接口的 35 倍,比所有同等画质水平的竞品平均快 15 倍。这种速度意味着你可以实时生成、边看边改,非常适合需要频繁迭代的创作场景,比如自媒体口播、B-roll、动态转场和营销素材铺量。
Q4:MiniMax H3 Max 的生成质量如何?
在 302.AI 实测中,H3 Max 尤其在图生视频模式表现出色,是 AA 榜单第一的水平:1)提示词遵循——台词逐字说完,不乱改、不漏词、不加戏;2)镜头调度——构图锁定人物,机位准确不乱切;3)物理动作——动作音频同步,没有肢体穿模;4)口播——中英文口型都对得上,没有后期配音感;5)文字渲染——文字准确清晰不乱码。
Q5:MiniMax H3 Max 的价格是多少?
在 302.AI 平台,MiniMax-H3-Max 的价格为:480P $0.06/秒、768P $0.096/秒。相比 Wan 3.0 Video(480P $0.05/秒、720P $0.1/秒、1080P $0.2/秒),H3 Max 主打快速出片。302.AI 提供按需付费无订阅的服务模式,用户可以根据自身业务需求灵活选择使用,成本可控。
Q6:MiniMax H3 Max 在榜单上的表现如何?
H3 Max 在 Artificial Analysis 的文生视频、图生视频榜单上分别排在第三和第一位,Design Arena 的图生视频榜单 Elo 1341。(注:该榜单未上线 Seedance 2.5。)这说明它在视频生成质量上已经达到顶尖水平,尤其是图生视频能力登顶。不过需要留意榜单样本和对比对象,实际效果仍需结合真实任务验证。
Q7:MiniMax H3 Max 适合哪些场景?
推荐场景:1)自媒体口播号——知识博主、新品介绍、探店视频,一张形象图加一段文案,10 多秒出 10 秒成片;2)边剪边产的后期——B-roll、标题卡、动态转场,缺什么镜头当场生成;3)营销团队素材铺量——一条文案出 20 个版本丢进 A/B 测试。不推荐:影视级工业需求(768p 是天花板)、超过 15 秒的叙事长片、逐帧精确控制的分镜需求。
Q8:如何在 302.AI 上调用 MiniMax H3 Max API?
在 302.AI 调用 MiniMax H3 Max 的步骤是:1)注册并充值 302.AI 账号;2)进入 API 超市→视频生成→Minimax,找到 MiniMax H3 Max;3)点击立即体验,在线调用 API;4)也可以接入兼容 OpenAI 格式的接口到 Python、Node.js 等应用。302.AI 提供按需付费无订阅模式,支持文字、图片、视频多种场景,无需月费,成本可控。
4. 如何在 302.AI 上使用
302.AI 提供按需付费无订阅的服务模式,用户可以根据自身业务需求灵活选择使用。
使用模型 API
步骤指引:API超市→视频生成→Minimax


点击【立即体验】在线调用 API

想即刻体验 MiniMax H3 Max 模型?
👉立即注册免费试用302.AI,开启你的AI之旅!👈
为什么选择302.AI?
● 灵活付费:无需月费,按需付费,成本可控
● 丰富功能:从文字、图片到视频,应有尽有,满足多种场景需求
● 开源生态:支持开发者深度定制,打造专属AI应用
● 易用性:界面友好,操作简单,快速上手
