Dialog Tersinkronisasi Bibir
Ucapan disesuaikan waktunya dengan gerakan mulut, bukan sekadar ditumpangkan di atasnya.
Kling 3.0 dari Kuaishou dapat berbicara — dialog tersinkronisasi bibir dalam lima bahasa, suara berbeda untuk tiap karakter, dan mode storyboard yang menyusun keseluruhan rangkaian.
Buka halaman ini di peramban desktop untuk mulai berkarya.
Kling 3.0 adalah model video generasi ketiga Kuaishou, dan kemampuan yang membedakannya dari jajaran lainnya adalah ujaran.
Banyak model menghasilkan suara. Jauh lebih sedikit yang menghasilkan dialog yang sinkron dengan gerak bibir, dan lebih sedikit lagi yang memberi setiap karakter suara yang khas, menangani lima bahasa, serta mendukung adegan ketika dua orang berbicara dalam bahasa yang berbeda. Kling 3.0 melakukan semua itu dalam proses yang sama dengan gambar, bersama mode storyboard multi-shot yang menyusun rangkaian pengaturan kamera terpisah dari satu prompt.
Gunakan Kling 3.0 saat seseorang dalam shot memiliki sesuatu untuk dikatakan. Buat adegan dialog, film pendek naratif, konten penjelasan dengan presenter, versi kampanye multibahasa, dan rangkaian multi-shot yang jika tidak akan memerlukan beberapa kali generasi untuk dirakit.

Kling 3.0 adalah model pembuatan video AI yang dikembangkan oleh Kuaishou. Anda memberinya bingkai pembuka, bingkai penutup, atau keduanya, beserta deskripsi tertulis tentang apa yang seharusnya terjadi di antaranya.
Model ini dibangun di sekitar tiga kekuatan utama:
Klip berjalan hingga lima belas detik pada hingga 60fps. Suara dihasilkan bersama dengan gambar — musik, efek, suasana, dan ucapan secara bersamaan. Virse mencantumkan lini ini sebagai dua entri, dengan Kuaishou memosisikan Standard sebagai tingkat iterasi yang hemat biaya dan Pro sebagai tingkat kualitas akhir; keduanya menerima input yang identik.

Ucapan disesuaikan waktunya dengan gerakan mulut, bukan sekadar ditumpangkan di atasnya.
Bahasa Mandarin, Inggris, Jepang, Korea, dan Spanyol, termasuk adegan campuran bahasa.
Setiap pembicara dalam sebuah adegan terdengar seperti orang yang berbeda.
Panjang klip sekali proses, naik dari batas maksimum generasi sebelumnya.
Dua kali lipat frame rate dari versi sebelumnya.
Rangkaian pengaturan kamera terpisah yang direncanakan dari satu prompt.

Lip-sync adalah perbedaan antara karakter yang berbicara dan karakter yang tampak seperti sedang mengunyah. Kling 3.0 menyesuaikan waktu penyampaian dengan gerakan mulut yang terlihat, yang membuat dialog dapat digunakan, bukan sekadar ada.

Dalam adegan dua orang, jika keduanya terdengar sama, itu langsung terasa salah. Suara yang berbeda untuk tiap karakter menghilangkan tanda paling jelas dalam adegan dialog yang dihasilkan.

Lima bahasa didukung, dan satu adegan dapat berisi karakter yang berbicara dalam bahasa berbeda — yang benar-benar tidak biasa dan langsung berguna untuk kampanye yang dirilis di berbagai pasar.

Alih-alih menghasilkan tiga shot lalu menyuntingnya menjadi satu, mode multi-shot merencanakan rangkaian dari satu prompt, sehingga susunan shot saling berkaitan sejak awal.

Dua kali lipat frame rate generasi sebelumnya, yang paling terlihat pada gerakan cepat dan pergerakan kamera ketika 30fps mulai tersendat.

Standard dan Pro menerima input serta prompt yang sama, jadi berpindah dari iterasi ke hasil akhir cukup dengan satu klik, bukan menulis ulang.
Pengerjaan dialog memiliki masalah ritme yang tidak dimiliki video bisu. Sebuah kalimat yang terbaca baik di halaman membutuhkan empat detik untuk diucapkan, dan Anda baru mengetahuinya setelah menghasilkan video. Virse menjaga skrip tetap berdampingan dengan output. Dialog tertulis, frame tempat dialog diputar, dan setiap take berada di satu kanvas, sehingga menyesuaikan satu kalimat dan menjalankannya ulang menjadi pengeditan di tempat, bukan mencari-cari di antara file.
Letakkan dialog tertulis di samping klip yang dihasilkan agar masalah timing dapat dilacak ke baris yang menyebabkannya.
Bangun komposisi pembuka dengan model gambar di kanvas yang sama dan serahkan langsung ke Kling 3.0.
Berpindah antara Kling 3.0 dan 30+ model gambar serta video lainnya tanpa meninggalkan kanvas atau menulis ulang brief.
Hasilkan adegan yang sama dalam bahasa tiap pasar dan susun take-nya berdampingan.

Percakapan singkat ketika ucapan harus tepat mengikuti mulut dan sesuai dengan performa.

Rangkaian multi-shot yang direncanakan sebagai sebuah urutan, bukan dirakit dari klip yang tidak saling terkait.

Seseorang berbicara ke kamera, dalam bahasa mana pun yang didukung dan dibutuhkan pasar.

Adegan yang sama direkam ulang untuk tiap bahasa tanpa mendesain ulang.

Reveal dan demonstrasi ketika efek serta ambience dihasilkan bersama gambar.

Karakter berulang yang menyampaikan kalimat singkat di serangkaian postingan.
Standard saat Anda sedang merancang adegan, Pro untuk versi yang akan dirilis.
Unggah frame pembuka, frame penutup, atau keduanya. Kedua ujung yang ditetapkan memberikan hasil yang paling dapat diprediksi.
Masukkan dialog sebenarnya dalam tanda kutip dan sebutkan siapa yang mengucapkannya.
Tonton sekali untuk merasakan ritmenya sebelum melihat kualitas gambar. Masalah pacing adalah masalah singkat.
Prompt Kling 3.0 yang berguna biasanya mencakup lima elemen:
Alih-alih menulis
Seorang pemilik toko berbicara dengan pelanggan, sinematik, dialog alami.
Tulis
Buka dengan seorang wanita berusia lima puluhan di balik konter toko buku, dari samping terhadap kamera, merapikan tanda terima. Ia mendongak dan berkata, 'Kami tutup sepuluh menit lagi,' lalu kembali ke tanda terima. Bidikan medium statis dari posisi pelanggan, tanpa gerakan. Ambiens interior yang tenang, suara kertas dipegang, suara jalan yang jauh melalui kaca, tanpa musik. Akhiri dengan kepalanya kembali menunduk.
Dua orang di meja kafe kecil, terlihat dari samping dalam bidikan medium statis. Pria itu berkata, "Kamu tidak memberitahunya." Wanita itu menunggu, lalu menjawab, "Aku tidak perlu." Masing-masing suara berbeda, penyampaian tidak terburu-buru, ada jeda hening di antara dialog. Ambiens kafe dengan cangkir dan obrolan pelan, tanpa musik. Akhiri dengan wanita itu memalingkan pandangan.
Urutan tiga bidikan di sebuah bengkel, direncanakan sebagai satu adegan kontinu. Bidikan satu: lebar, seorang wanita masuk melalui pintu. Bidikan dua: medium, ia meletakkan kotak peralatan di bangku kerja. Bidikan tiga: dekat, tangannya membuka kait. Pencahayaan atas yang konsisten dan karakter yang sama sepanjang adegan. Ambiens bengkel, langkah kaki, dan bunyi klik kait pada bidikan terakhir. Tanpa dialog, tanpa musik.
Seorang pria mengenakan kemeja abu-abu polos berdiri dengan latar kantor yang buram lembut, dibingkai dari pinggang ke atas, menghadap kamera. Ia berkata, "Tiga hal berubah kuartal ini, dan hanya satu di antaranya yang direncanakan." Kamera statis, tanpa gerakan. Cahaya utama lembut merata dari kiri depan. Suasana ruangan hening, tanpa musik, tanpa suara latar. Akhiri dengan ia berhenti sejenak, mulut tertutup.
| Dimensi | Kling 3.0 Standard | Kling 3.0 Pro |
|---|---|---|
| Diposisikan untuk | Iterasi hemat biaya | Output kualitas final |
| Input | Identik dengan Pro | Identik dengan Standard |
| Dukungan dialog | Ya | Ya |
| Mode storyboard | Ya | Ya |
| Audio | Opsional, dihargai terpisah | Opsional, dihargai terpisah |
| Penggunaan umum | Mengatur timing blocking dan performa | Take yang akan dirilis |
Klip tiga detik menampung kira-kira satu kalimat pendek dengan tempo alami. Satu paragraf memaksa model untuk terburu-buru atau memotongnya.
Sebutkan sebagai tiga lapisan. Menggabungkannya menjadi satu kalimat menghasilkan campuran yang membingungkan.
Jeda yang ditahan sebelum sebuah dialog adalah pilihan yang bisa diarahkan, dan biasanya terbaca lebih baik daripada suara yang terus-menerus.
Mendeskripsikan tiga bidikan secara berurutan lebih baik daripada memadatkannya menjadi satu pengambilan kontinu yang harus ditafsirkan model.
Tulis dialognya, sebutkan nama suaranya, dan biarkan model menangani mulut, timing, serta ruangan tempat dialog itu diucapkan.