Générateur de vidéos IA Kling 3.0

Kling 3.0 de Kuaishou parle — dialogues synchronisés sur les lèvres en cinq langues, une voix différente par personnage et un mode storyboard qui structure toute une séquence.

Ouvrez cette page sur un navigateur de bureau pour commencer à créer.

Des personnages qui parlent vraiment

Kling 3.0 est le modèle vidéo de troisième génération de Kuaishou, et la capacité qui le distingue du reste de la gamme est la parole.

De nombreux modèles génèrent du son. Beaucoup moins génèrent des dialogues synchronisés avec les mouvements des lèvres, et moins encore donnent à chaque personnage une voix distincte, prennent en charge cinq langues et gèrent des scènes où deux personnes parlent des langues différentes. Kling 3.0 fait tout cela en même temps que l’image, avec un mode storyboard multi-plans qui organise une séquence de configurations de caméra distinctes à partir d’un seul prompt.

Utilisez Kling 3.0 lorsqu’une personne dans le plan a quelque chose à dire. Créez des scènes de dialogue, des courts métrages narratifs, du contenu explicatif avec un présentateur, des versions de campagnes multilingues et des séquences multi-plans qui nécessiteraient autrement plusieurs générations pour être assemblées.

Characters That Actually Talk

Qu’est-ce que Kling 3.0 ?

Kling 3.0 est un modèle de génération vidéo par IA développé par Kuaishou. Vous lui fournissez une image d’ouverture, une image de clôture, ou les deux, ainsi qu’une description écrite de ce qui doit se passer entre elles.

Le modèle repose sur trois atouts majeurs :

  • Dialogues synchronisés sur les lèvres en chinois, anglais, japonais, coréen et espagnol
  • Voix distinctes pour chaque personnage, y compris dans des scènes où chacun parle une langue différente
  • Un mode storyboard multi-plans qui planifie une séquence de configurations de caméra à partir d’un seul prompt

Les clips durent jusqu’à quinze secondes à jusqu’à 60fps. Le son est co-généré avec l’image — musique, effets, ambiance et parole ensemble. Virse répertorie la gamme sous deux entrées, Kuaishou positionnant Standard comme le niveau d’itération économique et Pro comme celui de la qualité finale ; tous deux acceptent des entrées identiques.

What Is Kling 3.0?

Aperçu des caractéristiques de Kling 3.0

Dialogue synchronisé sur les lèvres

Parole calée sur le mouvement de la bouche plutôt que simplement superposée.

Cinq langues

Chinois, anglais, japonais, coréen et espagnol, y compris dans des scènes mêlant plusieurs langues.

Voix distinctes par personnage

Chaque locuteur d’une scène sonne comme une personne différente.

Jusqu’à quinze secondes

Durée de clip en une seule passe, supérieure au plafond de la génération précédente.

Jusqu’à 60 i/s

Deux fois la fréquence d’images de la version précédente.

Mode storyboard multi-plans

Une séquence de configurations de caméra distinctes planifiée à partir d’un seul prompt.

Fonctionnalités clés du générateur de vidéos IA Kling 3.0

Speech That Lands on the Mouth

Une parole qui tombe sur la bouche

La synchronisation labiale fait toute la différence entre un personnage qui parle et un personnage qui semble mâcher. Kling 3.0 cale le débit sur le mouvement visible de la bouche, ce qui rend les dialogues exploitables, et non simplement présents.

One Voice per Character

Une voix par personnage

Dans une scène à deux personnages, le fait que les deux personnes aient la même voix sonne immédiatement faux. Des voix distinctes pour chaque personnage suppriment l’indice le plus évident dans les scènes de dialogue générées.

Multilingual, Including Within One Scene

Multilingue, y compris dans une même scène

Cinq langues sont prises en charge, et une scène peut contenir des personnages parlant des langues différentes — ce qui est réellement inhabituel et directement utile pour les campagnes déployées sur plusieurs marchés.

Storyboard Mode for Sequences

Mode storyboard pour les séquences

Plutôt que de générer trois plans puis de les monter ensemble, le mode multi-plans planifie la séquence à partir d’un seul prompt, de sorte que les configurations se répondent par conception.

Sixty Frames per Second

Soixante images par seconde

Deux fois la fréquence d’images de la génération précédente, ce qui se voit surtout dans les mouvements rapides et les mouvements de caméra, là où le 30fps commence à saccader.

Two Tiers, One Brief

Deux niveaux, un seul brief

Standard et Pro acceptent les mêmes entrées et les mêmes prompts, si bien que passer de l’itération à la livraison se fait en un clic, sans réécriture.

Créer avec Kling 3.0 dans Virse

Le travail sur les dialogues pose un problème de rythme que la vidéo muette n’a pas. Une réplique qui passe bien sur la page prend quatre secondes à prononcer, et vous ne le découvrez qu’après la génération. Virse garde le script à côté du rendu. Le dialogue écrit, les images sur lesquelles il se joue et chaque prise se trouvent sur une même toile, si bien qu’ajuster une réplique et relancer la génération devient une modification sur place plutôt qu’une recherche dans les fichiers.

Gardez le script à côté de la prise

Placez le dialogue écrit à côté du clip généré afin que les problèmes de timing puissent être rattachés à la réplique qui les a provoqués.

Générez les images, puis la performance

Construisez la composition d’ouverture avec un modèle d’image sur le même canevas et transmettez-la directement à Kling 3.0.

Accédez à plus de 30 modèles créatifs

Passez de Kling 3.0 à plus de 30 autres modèles d’image et de vidéo sans quitter le canevas ni réécrire le brief.

Versionnez ensemble les variantes linguistiques

Générez la même scène dans la langue de chaque marché et alignez les prises côte à côte.

Que pouvez-vous créer avec Kling 3.0 ?

Dialogue Scenes

Scènes de dialogue

De courts échanges où la parole doit tomber juste avec la bouche et correspondre à l’interprétation.

Narrative Shorts

Courts métrages narratifs

Des séquences multi-plans planifiées comme une séquence plutôt qu’assemblées à partir de clips sans rapport.

Presenter and Explainer Video

Vidéo de présentation et d’explication

Une personne parlant face caméra, dans celle des langues prises en charge dont un marché a besoin.

Multilingual Campaign Versions

Versions de campagne multilingues

La même scène retournée pour chaque langue sans la reconcevoir.

Product Motion With Sound

Animation produit avec son

Des révélations et des démonstrations où les effets et l’ambiance sont générés avec l’image.

Character-Led Social Content

Contenu social porté par les personnages

Des personnages récurrents qui prononcent de courtes répliques sur toute une série de posts.

Comment utiliser Kling 3.0 dans Virse

  1. Choisir une formule

    Standard pendant que vous mettez au point la scène, Pro pour la version qui sera livrée.

  2. Ajoutez vos images

    Importez l’image d’ouverture, l’image de clôture, ou les deux. Fixer les deux extrémités donne le résultat le plus prévisible.

  3. Écrivez la réplique, pas seulement la scène

    Mettez le dialogue réel entre guillemets et indiquez qui le prononce.

  4. Évaluez d’abord le timing

    Regardez une première fois pour le rythme avant d’examiner la qualité de l’image. Les problèmes de rythme sont des problèmes de durée.

Comment rédiger un prompt Kling 3.0

Un prompt Kling 3.0 utile comprend généralement cinq éléments :

  • État initial
  • La réplique
  • Caméra
  • Ambiance
  • État final

Au lieu d’écrire

Un libraire parlant à un client, cinématographique, dialogue naturel.

Écrivez

Ouverture sur une femme d'une cinquantaine d'années derrière le comptoir d'une librairie, de profil par rapport à la caméra, triant des reçus. Elle lève les yeux et dit : 'Nous fermons dans dix minutes', puis retourne aux reçus. Plan moyen statique depuis la position du client, aucun mouvement. Ambiance intérieure calme, manipulation de papier, bruit de rue lointain à travers la vitre, pas de musique. Terminer avec sa tête de nouveau baissée.

Exemples de prompts Kling 3.0

Dialogue à deux personnages

Deux personnes à une petite table de café, vues de côté dans un plan moyen fixe. L’homme dit : "You didn't tell her." La femme attend, puis répond : "I didn't have to." Chaque voix est distincte, le débit est posé, avec un temps de silence entre les répliques. Ambiance de café avec des tasses et des conversations à voix basse, pas de musique. Terminer sur la femme qui détourne le regard.

Séquence multi-plans

Une séquence en trois plans dans un atelier, conçue comme une scène continue. Plan un : large, une femme entrant par une porte. Plan deux : moyen, elle pose une boîte à outils sur l’établi. Plan trois : serré, ses mains ouvrent le loquet. Éclairage zénithal cohérent et même personnage tout au long de la scène. Ambiance d’atelier, bruits de pas et déclic du loquet dans le dernier plan. Pas de dialogue, pas de musique.

Présentateur face caméra

Un homme en chemise grise unie se tenant devant un arrière-plan de bureau en flou artistique, cadré à mi-corps, face caméra. Il dit : "Trois choses ont changé ce trimestre, et une seule était prévue." Caméra statique, aucun mouvement. Éclairage principal doux et uniforme venant de l'avant gauche. Ambiance sonore calme de la pièce, pas de musique, pas de voix en arrière-plan. Terminer par une pause, bouche fermée.

Kling 3.0 Pro vs Kling 3.0 Standard

CritèreKling 3.0 StandardKling 3.0 Pro
Positionné pourItération rentableSortie de qualité finale
EntréesIdentique à ProIdentique à Standard
Prise en charge du dialogueOuiOui
Mode storyboardOuiOui
AudioFacultatif, facturé séparémentFacultatif, facturé séparément
Utilisation typiqueCalage du timing et du jeuLa prise qui sera livrée

Conseils pour de meilleurs résultats avec Kling 3.0

Gardez des répliques courtes

Un clip de trois secondes contient environ une courte phrase à un rythme naturel. Un paragraphe oblige le modèle à se précipiter ou à le tronquer.

Séparez parole, ambiance et musique

Nommez-les comme trois couches. Les regrouper dans une seule phrase produit un mélange confus.

Dirigez le silence

Une pause marquée avant une réplique est un choix dirigeable, et elle se lit généralement mieux qu’un son continu.

Utilisez le mode storyboard pour les séquences

Décrire trois plans dans l’ordre vaut mieux que les compresser en une seule prise continue que le modèle doit interpréter.

FAQ Kling 3.0

Qu'est-ce que Kling 3.0 ?
Kling 3.0 est le modèle vidéo de troisième génération de Kuaishou, générant des clips d'une durée allant jusqu'à quinze secondes à jusqu'à 60 ips, avec un audio cogénéré incluant des dialogues synchronisés avec les lèvres.
Kling 3.0 peut-il générer des dialogues ?
Oui — la parole synchronisée avec les lèvres en chinois, anglais, japonais, coréen et espagnol, avec une voix distincte par personnage et la prise en charge de scènes où les personnages parlent différentes langues.
Kling 3.0 est-il gratuit, et combien coûte-t-il ?
Kling 3.0 est disponible avec les offres payantes de Virse. La génération est facturée à la seconde à partir d'une dotation mensuelle en crédits, et les offres supérieures la rendent illimitée dans le cadre d'une utilisation raisonnable. Les tarifs actuels des offres sont indiqués sur la page des tarifs de Virse.
Quelle peut être la durée d'un clip Kling 3.0 ?
Jusqu'à quinze secondes par génération, à jusqu'à 60 images par seconde.
Quelle est la différence entre Kling 3.0 Pro et Standard ?
Kuaishou positionne Standard comme le niveau d'itération économique et Pro comme celui de la qualité finale. Les deux acceptent les mêmes entrées et les mêmes prompts.
Qu'est-ce que le mode storyboard multi-plans ?
Un mode qui planifie une séquence de prises de vue distinctes à partir d’un seul prompt, afin que les plans soient liés entre eux dès la conception plutôt que générés séparément puis montés ensemble.
Comment écrire des dialogues pour Kling 3.0 ?
Mettez la réplique entre guillemets et indiquez qui la prononce. Limitez-vous à environ une courte phrase toutes les trois secondes, et décrivez l’ambiance et la musique séparément de la parole.
Comment utiliser Kling 3.0 dans Virse ?
Choisissez une formule, chargez vos images de début et de fin, citez le dialogue dans le brief, puis générez.

Donnez-leur quelque chose à dire

Écrivez la réplique, nommez la voix, et laissez le modèle gérer la bouche, le timing et la pièce où elle est prononcée.