標準で2K
プレミアムティアではありません — すべての生成が2Kで出力されます。
MiniMaxのHailuo 03モデルは、最初と最後のフレーム、または一連の参照画像のいずれかをもとに、無音の2K動画を生成します。
作成を始めるには、デスクトップのブラウザでこのページを開いてください。
Minimax H3 は MiniMax の動画モデルであり、Virse における位置づけは驚くほど簡単に説明できます。2K を生成し、音声は生成せず、ほかに決めることはありません。
ほとんどの動画モデルは、解像度、アスペクト比、品質ティアといった選択肢のグリッドを提示し、それぞれの選択が開始までの小さな負担になります。このモデルには設定が 1 つしかありません。すべての生成は、リップシンクされた対話を含むネイティブ音声付きの 2K で出力されるため、クリップはスコアリング処理を待つのではなく、音声付きで届きます。
解像度が要件であり、音声が不要な場合は Minimax H3 を使用してください。ディテールの多い製品モーション、参照画像をもとにしたキャラクター主導のシリーズ、そして音声が別途処理されるタイムライン向けの映像を制作できます。

Minimax H3は、MiniMaxが開発したAI動画生成モデルで、バックエンド名のHailuo 03として知られています。Virseでは、入力が異なり出力が同じ2つのエントリーとして提供されています。
このモデルは、3つの主要な強みを中心に構築されています。
Minimax H3は、最初のフレーム、最後のフレーム、またはその両方に加えて、文章による概要を入力として受け取ります。Minimax H3 Referenceは代わりに参照画像を受け取り、その被写体、スタイリング、ビジュアル言語を生成されるシーケンスに反映します。どちらもネイティブ音声付きで2Kを出力します。
プレミアムティアではありません — すべての生成が2Kで出力されます。
生成された音声トラックはすべてのクリップに付属し、オフにするオプションはありません。
フレーム駆動と参照駆動が別々に表示されます。
解像度セレクターも品質グレードもありません。音声はオプションではなく常にオンです。
Referenceエントリーは、ドライバーとして提供された画像を受け付けます。
標準エントリーでは、ショットのどちらか一方のエンドポイント、または両方を固定します。
2Kがこのモデルの標準です。比較検討するティアも、検討すべきアップグレードパスもないため、生成前に最もよくある迷いをなくせます。
リップシンクと環境音は、映像と同じパスで生成されます。ここではそれがデフォルトであり、有効化を覚えておくべき設定ではありません。
キャラクターを6つのクリップにわたって登場させ、認識可能なまま保つ必要がある場合、説明するよりもモデルに例を見せる方が効果的です。Referenceエントリはまさにそのために存在します。
複数の画像は、単一の影響として平均化されるのではなく、それぞれが異なる役割を担えます — 1枚は人物用、1枚は設定用、1枚はスタイリング用というように。
標準エントリは最初のフレームと最後のフレームの両方を受け付けるため、生成は自由度の高いものではなく、2つの既知の構図の間をたどるパスになります。
フレーム駆動型と参照駆動型のどちらを選ぶかは、何に費用をかけられるかではなく、手元に何があるかの問題です。
参照駆動の連続性作業では、参照セットが安定していることが重要です。クリップ間で画像を1枚変更するとキャラクターが変化し、たいていはシーケンスを組み上げるまで誰も気づかない形でずれが生じます。 Virseはそのセットを1か所に保持します。参照画像は、それらから生成されたすべてのクリップの横にあるキャンバス上に配置されるため、同じ入力を再収集するのではなく再利用でき、修正する時間がまだあるうちにドリフトが見えるようになります。
キャラクター、製品、スタイルの画像をキャンバス上でまとめておき、すべてのクリップを同じ画像に向けます。

同じキャンバス上で画像モデルを使って静止画を作成し、エクスポートせずにMinimax H3へ渡します。

キャンバスを離れたりブリーフを書き直したりせずに、Minimax H3と30以上の他の画像・動画モデルの間を行き来できます。

実行結果を順番に並べ、2つ目のショットから5つ目のショットの間で被写体がずれている場合にすぐ分かるようにします。

同じ人物が登場し、共有の参照セットによって一貫性が保たれた複数のクリップ。
クロップに耐える解像度での回転、リビール、ディテールパス。
毎回説明し直さなくても、動きを導く衣服とスタイリングの参照。
定義されたビジュアル言語をショット間で引き継ぐ必要がある、様式化されたクリップ。
構図がすでに決まっているフレーム駆動型クリップ。
生成された台詞と環境音が、後から追加するものではなく出発点となるタイムライン用の素材。
構図が分かっている場合はフレーム駆動、被写体を認識可能なまま保つ必要がある場合は参照駆動。
2つのエンドポイントフレーム、または各画像の役割を明記した参照セットを読み込みます。
シーン内で何が動くのか、カメラがどう振る舞うのか、そしてどのペースで進むのかを指定します。
同じ入力を維持し、ブリーフだけを変更することで、シリーズ全体に一貫性を持たせます。
有用な Minimax H3 プロンプトには通常、4つの要素が含まれます。
こう書く代わりに
添付された参照を使用した、ギャラリー内を歩くモデル、シネマティック。
こう書く
画像1の人物、画像2のコート、画像3のギャラリー内装を使用する。彼女はフレーム左端から中央へ向かってゆったりとしたペースで歩き、右側の画面外にある絵画の方を向いて止まる。カメラは一定の距離で彼女に合わせて移動し、全体を通してフレーム内で同じサイズに保つ。フレーム中央で、横顔のまま静止した彼女で終了。
Image 1 の女性と Image 2 のワークショップ内装を使用します。 彼女は作業台に座り、手元ではフレーム外の何かに取り組んでいます。彼女は手を止め、左側の窓の方を見上げてから、再び手元に戻ります。 カメラは作業台の高さより少し上から、静止したミディアムショットを保ち、動きやカットはありません。 彼女の顔、髪、服装を Image 1 に示されているとおり正確に維持します。最後は、彼女が再び頭を下げた状態で終わります。
画像1の構図から開始:淡い色の石の縁台の上に革製サッチェルバッグが直立し、バックルがカメラの方を向いている。 カメラはサッチェルバッグを中央に保ち、一定のサイズのまま、約45度かけてゆっくり左へ回り込む。 カメラが動いても光は固定されたままなので、ハイライトが革と金具の上を移動する。 サイドのマチとステッチが見える斜め3/4ビューで終了。
画像1から開始:誰もいないステージにマイクスタンドが1本あり、客席照明は点灯している。 クリップの前半で客席照明がフェードダウンし、その間にマイク上の単一のトップスポットライトが明るくなる。それ以外は何も動かない。 カメラは全体を通して固定のワイドショットを維持する。 画像2で終了:照らされたマイク以外は暗闇のステージ。
| 比較項目 | Minimax H3 | Minimax H3 Reference |
|---|---|---|
| 入力 | 最初のフレーム、最後のフレーム、またはその両方 | 提供された参照画像 |
| 出力 | 音声なしの2K | 音声なしの2K |
| 最適な用途 | 構図が定義されたショット | 認識可能な状態を保つ必要がある被写体 |
| エンドポイント制御 | 両端を固定可能 | フレームではなく参照によって駆動 |
| 一般的な用途 | 製品の動き、トランジション | キャラクターシリーズ、スタイル化されたキャンペーン |
| 切り替えコスト | 両方で同じブリーフ構成 | 両方で同じブリーフ構成 |
どれが被写体かを示さずに3枚の写真をアップロードすることが、この種のブリーフが失敗する最も一般的な原因です。
クリップ間で1枚の画像を変更するだけで、連続性は崩れます。代わりにブリーフを変更してください。
出力には音声が含まれます。プロンプト内の台詞、効果音、環境音の手がかりが、生成される内容を形作ります。
定義された状態から別の状態へ移行するショットこそ、標準エントリーが最も得意とするものです。