Veo 3.1 AI動画ジェネレーター

Google DeepMindのVeo 3.1は、同期された48kHzオーディオ付きの短いクリップを生成し、末尾のフレームを引き継ぐことで、より長いシーケンスへと拡張します。

作成を始めるには、デスクトップのブラウザでこのページを開いてください。

長さは依頼して伸ばすのではなく、連結して構築する

Veo 3.1 は Google DeepMind の動画モデルであり、動画の長さに対して、この分野の大半とは異なるアプローチを取っています。

単一の生成結果を引き伸ばすのではなく、4秒、6秒、または8秒のクリップを生成してからそれらを延長します。つまり、あるクリップの終わりのフレームが次のクリップの冒頭となり、各つなぎ目をまたいで連続性を保ちながら、シーケンスがショットごとに成長していきます。この構造により、長い一発勝負の生成ではなく、各セグメントの間に判断ポイントが生まれます。これは動画作品を構築するうえで、意味のある違いをもたらす方法です。

完成物が単一のショットより長くなる場合は、Veo 3.1 を使用してください。物語性のあるシーケンス、キャンペーン動画、ウォークスルー、そして前半の出来栄えによって後半が左右されるあらゆる作品を組み立てられます。

Build Length by Chaining, Not by Asking for It

Veo 3.1とは?

Veo 3.1 は、Google DeepMind が開発した AI 動画生成モデルで、Virse では Veo 3.1 Fast と呼ばれる低コスト版とともに提供されています。どちらも、最初のフレーム、最後のフレーム、またはその両方を、文章による概要と併せて受け付けます。

このモデルは、3つの大きな強みを中心に構築されています。

  • シーン拡張。短い生成結果をつなぎ合わせて、より長いシーケンスにする
  • 会話、効果音、環境音をカバーする同期された48kHzステレオ音声
  • 720pおよび1080pに加え、3840×2160のネイティブ4K出力

生成は4秒、6秒、または8秒で、16:9および縦長の9:16に対応します。2つの項目の違いは、受け付ける内容ではなくコストとレンダリング品質にあるため、一方用に書かれた概要はもう一方でも変更せずに実行できます。

What Is Veo 3.1?

Veo 3.1の仕様概要

4秒、6秒、または8秒

クリップごとに生成する長さを選択可能。

シーン拡張

1つのクリップの末尾フレームが次のクリップの冒頭になります。

ネイティブ4K

真の3840×2160出力に対応し、その下に1080pと720pがあります。

48kHzステレオオーディオ

映像とともに、台詞、効果音、環境音を生成します。

16:9と9:16

同じテキストブリーフから横型と縦型を生成。

2つの速度ティア

Veo 3.1とVeo 3.1 Fastは、同一の入力に対応します。

Veo 3.1 AI動画ジェネレーターの主な機能

セグメント単位で組み立てる長さ

シーン拡張により、尺は一度きりの確定ではなく、一連の判断として扱えます。セグメント3がうまくいかなければ、全体ではなくセグメント3だけを再生成します。

つなぎ目をまたいで引き継がれる連続性

拡張は前のクリップの終わりのフレームから始まるため、被写体、照明、設定は説明文から再生成されるのではなく、カットをまたいで維持されます。

放送品質のオーディオ

48kHzステレオでは、音声は放送に出す前に差し替える必要があるものではなく、実際の編集に耐えられる仕様です。

選択可能なクリップ長

4秒、6秒、8秒は実際に意味のある選択肢であり、ペーシングはブリーフ内のどの要素よりも尺によって決まるため重要です。

ネイティブ4K出力

投影、クロップ、またはフルサイズでの納品を行う作品向けに、3840×2160を直接レンダリング。

同じブリーフに対応する高速ティア

Veo 3.1 Fastは同一の入力を受け付けるため、探索用のパスと納品用のパスは、異なるエントリに対する同じプロンプトになります。

VirseでVeo 3.1を使って構築

連鎖したシーケンスは、その連鎖が見えていてこそ管理できます。セグメント4はセグメント3を基に構築され、セグメント3が置き換えられた場合、その後のすべてを再確認する必要があります。 Virseでは、実行全体が1つのキャンバス上に順番に配置されます。各拡張は元になったクリップの後ろに置かれるため、シーケンスの構造はファイル名のルールに埋もれるのではなく、見える状態に保たれます。

シーケンスを順番に確認

各セグメントは、それが延長する元のセグメントの隣に配置されるため、つなぎ目の破綻が一目で分かります。

残りを失わずにセグメントを再生成

作品全体を最初からやり直すのではなく、チェーン内の1つのリンクを置き換え、そこから先を再構築します。

30以上のクリエイティブモデルにアクセス

キャンバスを離れたりブリーフを書き直したりすることなく、Veo 3.1と30以上の他の画像・動画モデルを切り替えられます。

最初に冒頭フレームを生成

同じワークスペース内の画像モデルでエスタブリッシングフレームを生成し、そこからチェーンを開始します。

Veo 3.1で何を作成できますか?

ナラティブシーケンス

ショットごとに組み立てられ、つなぎ目をまたいで連続性を保つマルチセグメント作品。

キャンペーン映像

単一の生成では到達できない長さに合わせて構築されたブランド動画。

製品ウォークスルー

セグメント間で製品を一貫して見せ続ける、長尺のデモンストレーション。

導入ショットと雰囲気ショット

映像と同じくらい環境音が重要なロケーション映像。

縦型ソーシャル向けカット

横向き版と同じブリーフから生成する、フィード向けの9:16出力。

絵コンテからのプリビズ

ストーリーボードを動くリファレンスに変換し、完全なシーケンスへと拡張。

VirseでVeo 3.1を使用する方法

  1. ティアと長さを選択

    探索には高速、納品には標準が基本です。求めるペースに応じて、4秒、6秒、または8秒を選びます。

  2. 開始フレームを設定する

    シーケンスの開始となる構図をアップロードし、ショットを特定の地点に着地させる必要がある場合は終了時の構図もアップロードします。

  3. 動きと音を書く

    動き、カメラの挙動、ミックスを明記し、セグメントがどのように終わるかを具体的に指定します。

  4. 次のセグメントへ延長する

    終了フレームを使って次のショットを生成し、続行する前に各つなぎ目を確認します。

Veo 3.1プロンプトの書き方

有用なVeo 3.1プロンプトには、通常5つの要素が含まれます。

  • 被写体と設定
  • 動くもの
  • カメラ
  • 音声
  • エンディング

こう書く代わりに

波が岩に打ち寄せるドラマチックなショット、映画的で、壮大な音楽付き。

こう書く

曇天の光の下、灰色の波が黒い火山岩に砕けるワイドショット。うねりは一つひとつ、ゆったりしたペースで盛り上がって崩れ、しぶきが風に乗って右へ運ばれる。カメラは三脚に固定され、水面よりやや高い位置。音声は水と風のみ、音楽なし。波が引き、岩が濡れて輝いているところで終了。

Veo 3.1プロンプト例

シーケンスの開始セグメント

Image 1の構図から開始:夕暮れの田舎のガソリンスタンド。1つのキャノピーライトが点灯し、車も人もいない。 虫がキャノピーライトの光の筋を横切って動く。それ以外はすべて静止している。 カメラは一定速度でゆっくり右へトラックし、キャノピーを常にフレーム内に保つ。 セミの声、ライトの電気的なブーンという音、姿は見えない遠くの車が1台通過する音。音楽なし。キャノピーが左端にあり、右側を開けた道路が埋める状態で終了。

サウンドデザイン付きの商品お披露目

暗いウォールナットの天板の上に閉じた状態で置かれたオーバーイヤーヘッドホンを映して開始。上方かつ背後の単一光源で照らされている。 最初の2秒間でイヤーカップがゆっくり均等に開き、その間にカメラは短い距離だけ寄って停止する。 低いルームトーンに加え、カップが開いた位置に到達した瞬間に柔らかな機械音のクリックが1回。音楽なし。 ヘッドホンが完全に開き、フレーム下半分を占めた状態で終了。

短い会話のひとこま

キャンバス地のジャケットを着た男性が、金物店の通路に立ち、ペンキ缶を手にしてラベルを読んでいる。 彼はカメラの外にいる誰かの方を見上げて、「これがマット仕上げのやつですよね?」と言う。 カメラは通路の端からのミディアムショットで固定、動きなし。 蛍光灯のうなり、遠くの棚まわりの物音、彼の声は会話程度の音量、音楽なし。彼が再び缶に目を落とすところで終了。

Veo 3.1 vs. Veo 3.1 Fast

比較項目Veo 3.1 FastVeo 3.1
用途探索とタイミング調整納品
入力標準版と同一Fastと同一
クリップの長さ4秒、6秒、または8秒4秒、6秒、または8秒
シーン延長はいはい
音声任意、48kHzステレオ任意、48kHzステレオ
出力範囲720pから4K720pから4K

Veo 3.1でより良い結果を得るためのヒント

終わり方を慎重に書く

終了時の状態が次のセグメントの開始になります。曖昧な終わり方は、その後に作るすべてに波及します。

拡張する前に各つなぎ目を確認する

次のセグメントを生成する前に、セグメント間のトランジションを確認してください。エラーはチェーンの下流で積み重なります。

ムードではなくミックスに名前を付ける

「音楽なし、ルームトーンと足音のみ」は指示できます。「壮大なスコア」はモデルが推測しなければならない感覚です。

1セグメントにつき1つのアクション

4〜8秒で表現できるのは、1つの出来事が起きることです。イベントを詰め込むことを避けるためにセグメント化があります。

Veo 3.1 FAQ

Veo 3.1とは何ですか?
Veo 3.1はGoogle DeepMindの動画生成モデルで、同期音声付きの4秒、6秒、または8秒のクリップを生成し、より長いシーケンスへ拡張できます。
Veo 3.1のクリップの長さはどれくらいにできますか?
各生成は4秒、6秒、または8秒です。シーン拡張では、1つのクリップの終了フレームを次のクリップの開始部分として使用し、連結していきます。
Veo 3.1は無料ですか?料金はいくらですか?
Veo 3.1はVirseの有料プランで利用できます。生成は月間クレジット枠から秒単位で課金され、上位プランではフェアユースの範囲内で従量制なしになります。現在のプラン料金はVirseの料金ページに掲載されています。
Veo 3.1は音声を生成できますか?
はい — 48kHzステレオで、セリフ、効果音、環境音に対応し、完成済みのクリップに後から重ねるのではなく、アクションに合わせてタイミング調整されます。
Veo 3.1は4K動画を生成できますか?
はい、ネイティブで3840×2160に対応し、1080pと720pも利用できます。
Veo 3.1とVeo 3.1 Fastの違いは何ですか?
コストとレンダリング品質です。どちらも同じ入力、同じクリップ長、同じプロンプトに対応しているため、指示文は変更せずに相互に移行できます。
Veo 3.1はどのアスペクト比に対応していますか?
同じ記述済みの指示文から、16:9の横長と9:16の縦長を生成できます。
VirseでVeo 3.1を使うにはどうすればよいですか?
Veo 3.1またはVeo 3.1 Fastを選択し、最初のフレーム、最後のフレーム、またはその両方をアップロードし、動きと音を含む指示文を書いて生成します。

一度に1つのセグメント

シーケンスを部分ごとに組み立て、各つなぎ目を確認し、単一の長い生成では失われてしまう判断ポイントを保てます。