标配 2K
不是高级套餐——每次生成都会输出 2K。
请在桌面端浏览器打开本页开始创作。
Minimax H3 是 MiniMax 的视频模型,它在 Virse 中的定位描述起来异常简单:它生成 2K 视频,不生成声音,也没有其他需要决定的内容。
大多数视频模型都会提供一个选项网格——分辨率、宽高比、质量档位——而每个选择都是开始创作前的一点小负担。这个模型只有一种配置。每次生成都会输出 2K,并带有原生音频,包括口型同步的对白,因此片段到手时就带有声音,而不必等待配乐处理。
当分辨率是硬性要求而音频不是时,请使用 Minimax H3。它适合制作细节丰富的产品动态、由参考图像驱动的角色系列,以及将进入时间线、声音另行处理的素材。

Minimax H3 是由 MiniMax 开发的 AI 视频生成模型,其后端名称为 Hailuo 03。Virse 将其作为两个条目提供,二者输入不同但输出相同。
该模型围绕三大主要优势构建:
Minimax H3 接收第一帧、最后一帧,或二者兼有,再加上一段文字简述。Minimax H3 Reference 则接收参考图像,将其中的主体、风格和视觉语言带入生成的序列中。两者均以 2K 输出并带有原生音频。
不是高级套餐——每次生成都会输出 2K。
每个片段都会附带一条生成的音频轨,并且没有关闭选项。
帧驱动和参考驱动,分别列出。
没有分辨率选择器,也没有质量等级。音频始终开启,而非可选。
参考入口接受所提供的图像作为驱动。
标准入口可固定镜头的任一端点,或同时固定两端。
2K 就是该模型的输出规格。无需权衡不同档位,也无需考虑升级路径,从而消除了生成前最常见的犹豫来源。
口型同步和环境音与画面在同一轮处理中生成。在这里,这是默认行为,而不是一个需要你记得启用的设置。
当一个角色必须出现在六个片段中并保持可识别时,向模型展示示例胜过用文字描述。Reference 入口正是为此而存在。
多张图片可以各自承担不同任务——一张用于人物,一张用于场景,一张用于造型——而不是被平均成单一影响。
标准入口同时接受首帧和尾帧,这会把生成变成两个已知构图之间的一条路径,而不是开放式生成。
在帧驱动和参考驱动之间做选择,取决于你手头有什么素材,而不是你能负担得起什么。
由参考驱动的连续性工作取决于参考集保持稳定。只要在片段之间更换一张图像,角色就会发生偏移,而这种变化通常要到序列组装完成后才会被人注意到。 Virse 将整组参考保存在同一个位置。参考图像与基于它们生成的每个片段一起放在画布上,因此相同输入会被重复使用,而不是重新收集;漂移也会在仍有时间修正时变得可见。
将角色、产品和风格图片一起保留在画布上,并让每个片段都指向同一组图片。

在同一画布上用图像模型生成静帧,然后无需导出即可交给 Minimax H3。

在 Minimax H3 与 30+ 个其他图像和视频模型之间切换,无需离开画布或重写简述。

按顺序铺开展示这次运行,这样主体在第二个镜头到第五个镜头之间发生的偏移会一目了然。

多个以同一个人为主角的片段,由一组共享参考共同保持一致。
旋转、揭示和细节镜头,分辨率足以经受裁剪。
由服装和造型参考驱动动作,无需每次重新描述。
风格化片段,其中明确的视觉语言必须从一个镜头延续到下一个镜头。
由帧驱动的片段,其构图已事先确定。
适用于时间线的素材,其中生成的对白和环境音是起点,而不是之后再添加的内容。
已知构图时采用帧驱动;主体必须保持可识别时采用参考图驱动。
加载两个端点帧,或加载参考图集并为每张图片说明任务。
说明场景中什么在移动、相机如何运动,以及节奏快慢。
保持相同输入,只更改简述,让整个系列保持一致。
一个实用的 Minimax H3 提示词通常包含四个要素:
与其这样写
一位模特穿行于画廊中,电影感,使用所附参考。
不如这样写
使用图像 1 中的人物、图像 2 中的大衣,以及图像 3 中的画廊室内场景。她从画面左边缘以从容的步伐走向中央,并停下,面向画面右侧镜头外的一幅画。镜头以恒定距离跟随她,全程保持她在画面中的大小不变。最后她静止于画面中央,呈侧面姿态。
使用图像 1 中的女性和图像 2 中的工坊室内场景。 她坐在工作台前,双手在画面外操作某样东西。她停下来,抬头望向左侧的窗户,然后又回到手上的工作。 相机保持静止的中景镜头,机位略高于工作台高度,无运动、无剪切。 完全保留她在图像 1 中所示的脸部、头发和服装。最后以她再次低下头结束。
从图像 1 的构图开始:一个皮革邮差包直立在浅色石质台沿上,搭扣朝向镜头。 镜头缓慢向左环绕约四十五度,保持邮差包居中且大小不变。 光线在镜头移动时保持固定,因此高光会掠过皮革和金属配件。 最后停在四分之三视角,可见侧面风琴褶和缝线。
从图像 1 开始:一个空舞台,只有一个麦克风架,观众席灯光亮起。 在片段前半段,观众席灯光逐渐暗下,同时一束头顶聚光灯逐渐照亮麦克风。其他一切都不动。 镜头全程保持锁定的广角镜头。 以图像 2 结束:舞台陷入黑暗,只有麦克风被照亮。
| 对比维度 | Minimax H3 | Minimax H3 Reference |
|---|---|---|
| 输入 | 首帧、尾帧,或两者都提供 | 提供的参考图像 |
| 输出 | 无声 2K | 无声 2K |
| 最适合 | 具有明确构图的镜头 | 必须保持可识别的主体 |
| 端点控制 | 两端都可固定 | 由参考图而非帧驱动 |
| 典型用途 | 产品运动、转场 | 角色系列、风格化活动 |
| 切换成本 | 两者使用相同的简述结构 | 两者使用相同的简述结构 |
上传三张图片却不说明哪一张是主体,是这类简述最常出错的方式。
在片段之间更换一张图片就足以破坏连续性。改提示词,而不是改图片。
输出自带声音。提示词中的对白、音效和环境音线索会影响生成结果。
从一个定义好的状态切换到另一个状态的镜头,正是标准入口最擅长的。