Kling 3.0 AI動画ジェネレーター

KuaishouのKling 3.0は話します — 5つの言語でリップシンクされた対話、キャラクターごとに異なる声、そしてシーケンス全体を構成するストーリーボードモードを備えています。

作成を始めるには、デスクトップのブラウザでこのページを開いてください。

実際に話すキャラクター

Kling 3.0はKuaishouの第3世代動画モデルであり、ラインアップの中で際立たせている機能は音声です。

音を生成するモデルは数多くあります。しかし、リップシンクする会話を生成できるものははるかに少なく、各キャラクターに異なる声を与え、5つの言語に対応し、2人がそれぞれ別の言語で話すシーンをサポートできるものはさらに限られます。Kling 3.0は、映像と同じ生成プロセスでそれらすべてを実現し、さらに1つのプロンプトから複数の独立したカメラ設定によるシーケンスを構成するマルチショット・ストーリーボードモードも備えています。

ショット内の人物に伝えるべき台詞がある場合は、Kling 3.0を使用してください。会話シーン、物語性のある短編、プレゼンター付きの解説コンテンツ、多言語キャンペーン版、そして通常なら組み立てに複数回の生成が必要になるマルチショットシーケンスを作成できます。

Characters That Actually Talk

Kling 3.0とは?

Kling 3.0 は、Kuaishou が開発した AI 動画生成モデルです。開始フレーム、終了フレーム、またはその両方と、それらの間で何が起こるべきかを記述したテキストを入力します。

このモデルは、3つの大きな強みを軸に構築されています:

  • 中国語、英語、日本語、韓国語、スペイン語に対応したリップシンク付き対話
  • 各キャラクターごとに異なる声。各自が異なる言語を話すシーンにも対応
  • 1つのプロンプトから一連のカメラ設定を計画する、マルチショットのストーリーボードモード

クリップは最大 60fps で最大15秒まで生成できます。音声は映像と同時に生成されます — 音楽、効果音、環境音、会話音声がまとめて生成されます。Virse ではこのラインを2つのエントリーとして掲載しており、Kuaishou は Standard をコスト効率の高い反復制作向け、Pro を最終品質向けと位置付けています。どちらも同一の入力を受け付けます。

What Is Kling 3.0?

Kling 3.0の仕様概要

リップシンクされた対話

口の動きに後から重ねるのではなく、口の動きに合わせてタイミング調整された音声。

5つの言語

中国語、英語、日本語、韓国語、スペイン語に対応し、混合言語のシーンも含みます。

キャラクターごとに異なる声

シーン内の各話者が、それぞれ異なる人物のように聞こえます。

最大15秒

単一パスのクリップ長は、前世代の上限から向上しています。

最大60fps

前バージョンの2倍のフレームレート。

マルチショット・ストーリーボードモード

1つのプロンプトから計画される、別々のカメラ設定によるシーケンス。

Kling 3.0 AI動画ジェネレーターの主な機能

Speech That Lands on the Mouth

口の動きに合う音声

リップシンクは、キャラクターが話しているように見えるか、噛んでいるように見えるかを分ける要素です。Kling 3.0 はセリフのタイミングを見た目の口の動きに合わせるため、会話が単に存在するだけでなく、実用的なものになります。

One Voice per Character

キャラクターごとに1つの声

2人芝居で、両者の声が同じに聞こえるのはすぐに不自然だと分かります。キャラクターごとに異なる声を使うことで、生成された会話シーンで最も分かりやすい違和感を取り除けます。

Multilingual, Including Within One Scene

多言語対応、1つのシーン内での混在も可能

5つの言語に対応しており、1つのシーン内でキャラクターが異なる言語を話すこともできます。これは本当に珍しく、複数市場で展開するキャンペーンに直接役立ちます。

Storyboard Mode for Sequences

シーケンス向けストーリーボードモード

3つのショットを生成してつなぎ合わせるのではなく、マルチショットモードでは1つのプロンプトからシーケンスを設計するため、各セットアップが最初から関連づけられます。

Sixty Frames per Second

毎秒60フレーム

前世代の2倍のフレームレートにより、30fps ではカクつき始める高速な動きやカメラ移動で特に差が現れます。

Two Tiers, One Brief

2つのティア、1つのブリーフ

Standard と Pro は同じ入力と同じプロンプトに対応しているため、イテレーションから納品への移行は書き直しではなくクリックだけで済みます。

VirseでKling 3.0を使って制作

対話の制作には、無音動画にはないリズムの問題があります。ページ上では自然に読めるセリフでも、実際に話すと4秒かかり、それは生成して初めてわかります。 Virseはスクリプトを出力の横に保持します。書かれた対話、それが再生されるフレーム、そしてすべてのテイクが1つのキャンバス上にあるため、セリフを調整して再実行する作業は、ファイルを探し回るのではなく、その場での編集になります。

スクリプトをテイクの横に保持

生成されたクリップの横に書き起こしたセリフを置いておくことで、タイミングの問題をその原因となった行まで追跡できます。

フレームを生成してから演技を生成

同じキャンバス上で画像モデルを使って冒頭の構図を作成し、そのまま Kling 3.0 に渡せます。

30以上のクリエイティブモデルにアクセス

キャンバスを離れたりブリーフを書き直したりすることなく、Kling 3.0 と 30+ 種類の他の画像・動画モデルを行き来できます。

言語バリエーションをまとめてバージョン管理

各市場の言語で同じシーンを生成し、テイクを横に並べて比較できます。

Kling 3.0で何を作成できますか?

Dialogue Scenes

対話シーン

音声を口の動きに合わせ、演技にも一致させる必要がある短いやり取り。

Narrative Shorts

物語形式のショート動画

無関係なクリップを組み合わせるのではなく、シーケンスとして設計されたマルチショットの連続シーン。

Presenter and Explainer Video

プレゼンターおよび解説動画

市場が必要とする対応言語のいずれかで、人物がカメラに向かって話すシーン。

Multilingual Campaign Versions

多言語キャンペーン版

再設計せずに、言語ごとに撮り直した同じシーン。

Product Motion With Sound

音声付きの商品モーション

効果や環境音が映像とともに生成される、リビールやデモンストレーション。

Character-Led Social Content

キャラクター主導のソーシャルコンテンツ

一連の投稿を通じて、短いセリフを話す recurring characters。

VirseでKling 3.0を使用する方法

  1. ティアを選ぶ

    シーンを作り込んでいる間はStandard、納品するバージョンにはProを使用します。

  2. フレームを追加する

    開始フレーム、終了フレーム、またはその両方をアップロードします。両端を固定すると、最も予測しやすい結果が得られます。

  3. シーンだけでなく、セリフを書く

    実際のセリフを引用符で囲み、誰が話すのかを明記します。

  4. まずタイミングを判断する

    画質を見る前に、まずリズムを確認するために一度視聴します。ペーシングの問題は、短い部分の問題です。

Kling 3.0プロンプトの書き方

有用なKling 3.0プロンプトには、通常5つの要素が含まれます。

  • 開始時の状態
  • セリフ
  • カメラ
  • 環境音
  • 終了時の状態

こう書く代わりに

店主が客と話している、映画的で自然な会話。

こう書く

書店のカウンターの後ろにいる50代の女性から始まる。カメラに対して横向きで、レシートを整理している。彼女は顔を上げて「あと10分で閉店です」と言い、それからレシートの整理に戻る。客の位置からの固定ミディアムショットで、動きなし。静かな店内の環境音、紙を扱う音、ガラス越しに聞こえる遠くの通りの騒音、音楽なし。最後は彼女が再び頭を下げた状態で終わる。

Kling 3.0プロンプト例

二人芝居の対話

小さなカフェのテーブルに座る2人を、横から静的なミディアムショットで捉える。 男性が「彼女に言わなかったんだね」と言う。女性は間を置いてから、「言う必要はなかった」と答える。 それぞれの声は明確に異なり、ゆったりとした話し方で、セリフの間に一拍の沈黙を置く。 カフェの環境音、カップの音、低い話し声。音楽なし。女性が視線をそらすところで終わる。

複数ショットのシーケンス

ワークショップでの3ショットのシーケンスを、1つの連続したシーンとして計画する。 ショット1:ワイド、女性が出入口から入ってくる。ショット2:ミディアム、彼女が工具箱を作業台に置く。ショット3:クローズ、彼女の手がラッチを開ける。 一貫した頭上照明と、全体を通して同じキャラクター。 ワークショップの環境音、足音、そして最後のショットでラッチがカチッと鳴る音。セリフなし、音楽なし。

カメラに向かうプレゼンター

柔らかくぼけたオフィスの背景を背に、無地のグレーのシャツを着た男性が立っている。腰から上のフレーミングで、カメラの方を向いている。 彼は「今四半期に変わったことが3つありますが、計画されていたのはそのうち1つだけでした」と言う。 カメラは固定で、動きなし。正面左から均一で柔らかなキーライト。 静かな室内音のみで、音楽や背景の話し声はない。最後は彼が口を閉じて間を置く。

Kling 3.0 ProとKling 3.0 Standardの比較

比較項目Kling 3.0 StandardKling 3.0 Pro
対象コスト効率の高い反復作業最終品質の出力
入力Proと同一Standardと同一
対話サポートはいはい
ストーリーボードモードはいはい
音声任意、別料金任意、別料金
一般的な用途ブロッキングのタイミングと演技納品版に使うテイク

Kling 3.0でより良い結果を得るためのヒント

セリフは短く保つ

3秒のクリップには、自然なペースで短い文が1つ程度収まります。段落を入れると、モデルは急いで話すか、途中で切り詰めることになります。

音声、環境音、音楽を分ける

それらを3つのレイヤーとして名付けます。1つの文にまとめると、混乱したまとまりのない内容になります。

沈黙を演出する

セリフの前に間を置くことは演出で指定できる選択であり、たいていは音が途切れなく続くよりも伝わりやすくなります。

シーケンスにはストーリーボードモードを使用

3つのショットを順番に記述するほうが、モデルに解釈させる必要のある1つの連続テイクに圧縮するより効果的です。

Kling 3.0 FAQ

Kling 3.0 とは何ですか?
Kling 3.0 は Kuaishou の第3世代動画モデルで、リップシンクされた会話を含む同時生成音声付きで、最大15秒、最大60fpsのクリップを生成します。
Kling 3.0 は会話を生成できますか?
はい — 中国語、英語、日本語、韓国語、スペイン語でリップシンクされた音声に対応し、キャラクターごとに異なる声を使えます。また、キャラクターが異なる言語を話すシーンにも対応しています。
Kling 3.0 は無料ですか?料金はいくらですか?
Kling 3.0 は Virse の有料プランで利用できます。生成は毎月のクレジット枠から秒単位で課金され、上位プランではフェアユースの範囲内で従量制なしで利用できます。現在のプラン料金は Virse の料金ページに掲載されています。
Kling 3.0 のクリップの長さはどれくらいにできますか?
1回の生成につき最大15秒、最大60フレーム毎秒です。
Kling 3.0 Pro と Standard の違いは何ですか?
Kuaishou は、Standard をコスト効率の高いイテレーション用の階層、Pro を最終品質向けの階層として位置づけています。どちらも同じ入力と同じプロンプトを受け付けます。
マルチショット・ストーリーボードモードとは何ですか?
1つのプロンプトから一連の異なるカメラ設定を計画するモードです。ショットを個別に生成してつなぎ合わせるのではなく、設計段階から互いに関連するようにします。
Kling 3.0 向けの会話はどのように書けばよいですか?
話し言葉のセリフは引用符で囲み、誰が話すのかを明記します。3秒につき短い1文程度に抑え、環境音や音楽はセリフとは別に記述してください。
Virse で Kling 3.0 を使うにはどうすればよいですか?
ティアを選び、エンドポイントフレームを読み込み、ブリーフ内で会話を引用し、生成します。

語る言葉を与える

セリフを書き、声を指定すれば、口の動き、タイミング、話される部屋の雰囲気はモデルが処理します。