Generador de vídeo con IA Kling 3.0

Kling 3.0 de Kuaishou habla: diálogo sincronizado con los labios en cinco idiomas, una voz distinta por personaje y un modo storyboard que estructura una secuencia completa.

Abre esta página en un navegador de escritorio para empezar a crear.

Personajes que hablan de verdad

Kling 3.0 es el modelo de vídeo de tercera generación de Kuaishou, y la capacidad que lo diferencia del resto del catálogo es el habla.

Muchos modelos generan sonido. Muchos menos generan diálogos con sincronización labial, y aún menos dan a cada personaje una voz distintiva, gestionan cinco idiomas y admiten escenas en las que dos personas hablan idiomas diferentes. Kling 3.0 hace todo eso en la misma pasada que la imagen, junto con un modo de guion gráfico multip plano que organiza una secuencia de configuraciones de cámara separadas a partir de un solo prompt.

Usa Kling 3.0 cuando alguien en el plano tenga algo que decir. Crea escenas con diálogos, cortos narrativos, contenido explicativo con un presentador, versiones de campañas multilingües y secuencias multip plano que, de otro modo, requerirían varias generaciones para montarse.

Characters That Actually Talk

¿Qué es Kling 3.0?

Kling 3.0 es un modelo de generación de vídeo con IA desarrollado por Kuaishou. Le proporcionas un fotograma inicial, un fotograma final o ambos, junto con una descripción escrita de lo que debería ocurrir entre ellos.

El modelo se basa en tres grandes fortalezas:

  • Diálogos sincronizados con los labios en chino, inglés, japonés, coreano y español
  • Voces diferenciadas por personaje, incluidas escenas en las que cada uno habla un idioma distinto
  • Un modo de storyboard multipla­no que planifica una secuencia de configuraciones de cámara a partir de una sola instrucción

Los clips duran hasta quince segundos a un máximo de 60fps. El sonido se genera conjuntamente con la imagen: música, efectos, ambiente y voz a la vez. Virse presenta la línea como dos opciones, con Kuaishou posicionando Standard como el nivel de iteración rentable y Pro como el de calidad final; ambos aceptan entradas idénticas.

What Is Kling 3.0?

Especificaciones de Kling 3.0 de un vistazo

Diálogo sincronizado con los labios

Voz sincronizada con el movimiento de la boca, en lugar de superpuesta.

Cinco idiomas

Chino, inglés, japonés, coreano y español, incluidas escenas con mezcla de idiomas.

Voces distintas por personaje

Cada hablante de una escena suena como una persona distinta.

Hasta quince segundos

Duración del clip en una sola pasada, superior al límite de la generación anterior.

Hasta 60 fps

El doble de la frecuencia de fotogramas que la versión precedente.

Modo storyboard con varias tomas

Una secuencia de configuraciones de cámara independientes planificada a partir de una sola instrucción.

Funciones clave del generador de vídeo con IA Kling 3.0

Speech That Lands on the Mouth

Voz que encaja con la boca

La sincronización labial es la diferencia entre un personaje que habla y uno que parece estar masticando. Kling 3.0 ajusta el momento de la locución al movimiento visible de la boca, que es lo que hace que el diálogo sea utilizable en lugar de simplemente estar presente.

One Voice per Character

Una voz por personaje

En una escena a dos, que ambas personas suenen igual resulta inmediatamente erróneo. Las voces diferenciadas por personaje eliminan el indicio más obvio en las escenas de diálogo generadas.

Multilingual, Including Within One Scene

Multilingüe, incluso dentro de una misma escena

Se admiten cinco idiomas, y una escena puede contener personajes que hablen distintos idiomas — algo realmente inusual y directamente útil para campañas que se lanzan en varios mercados.

Storyboard Mode for Sequences

Modo storyboard para secuencias

En lugar de generar tres planos y montarlos juntos, el modo multipiano planifica la secuencia a partir de un único prompt, de modo que las configuraciones se relacionan entre sí por diseño.

Sixty Frames per Second

Sesenta fotogramas por segundo

El doble de la frecuencia de fotogramas de la generación anterior, algo que se nota sobre todo en el movimiento rápido y en los movimientos de cámara, donde 30fps empieza a entrecortarse.

Two Tiers, One Brief

Dos niveles, un briefing

Standard y Pro aceptan las mismas entradas y los mismos prompts, así que pasar de la iteración a la entrega es un clic en lugar de una reescritura.

Crea con Kling 3.0 en Virse

El trabajo con diálogos tiene un problema de ritmo que el vídeo sin voz no tiene. Una frase que se lee bien en la página tarda cuatro segundos en decirse, y solo lo descubres después de generar. Virse mantiene el guion junto al resultado. El diálogo escrito, los fotogramas sobre los que se reproduce y cada toma están en un mismo lienzo, así que ajustar una frase y volver a ejecutarla es una edición en el mismo lugar, en vez de una búsqueda entre archivos.

Mantén el guion junto a la toma

Coloca el diálogo escrito junto al clip generado para que los problemas de sincronización puedan rastrearse hasta la línea que los ha causado.

Genera fotogramas y después la interpretación

Crea la composición inicial con un modelo de imagen en el mismo lienzo y pásasela directamente a Kling 3.0.

Accede a más de 30 modelos creativos

Pasa de Kling 3.0 a más de 30 modelos de imagen y vídeo sin salir del lienzo ni reescribir el briefing.

Versiona juntas las variantes de idioma

Genera la misma escena en el idioma de cada mercado y coloca las tomas una junto a otra.

¿Qué puedes crear con Kling 3.0?

Dialogue Scenes

Escenas con diálogo

Intercambios breves en los que el habla tiene que coincidir con la boca y encajar con la interpretación.

Narrative Shorts

Cortos narrativos

Secuencias multipiano planificadas como una secuencia en lugar de ensamblarse a partir de clips no relacionados.

Presenter and Explainer Video

Vídeo de presentador y explicativo

Una persona hablando a cámara, en cualquiera de los idiomas admitidos que necesite un mercado.

Multilingual Campaign Versions

Versiones de campañas multilingües

La misma escena rodada de nuevo para cada idioma sin rediseñarla.

Product Motion With Sound

Movimiento de producto con sonido

Presentaciones y demostraciones en las que los efectos y el ambiente se generan junto con la imagen.

Character-Led Social Content

Contenido social protagonizado por personajes

Personajes recurrentes pronunciando frases breves a lo largo de una serie de publicaciones.

Cómo usar Kling 3.0 en Virse

  1. Elige un nivel

    Standard mientras estás definiendo la escena; Pro para la versión que se entrega.

  2. Añade tus fotogramas

    Sube el fotograma inicial, el fotograma final o ambos. Fijar ambos extremos ofrece el resultado más predecible.

  3. Escribe la frase, no solo la escena

    Pon el diálogo real entre comillas y di quién lo pronuncia.

  4. Evalúa primero el tempo

    Míralo una vez para comprobar el ritmo antes de fijarte en la calidad de imagen. Los problemas de ritmo son problemas del brief.

Cómo escribir un prompt para Kling 3.0

Un prompt útil para Kling 3.0 suele incluir cinco elementos:

  • Estado inicial
  • La frase
  • Cámara
  • Ambiente
  • Estado final

En lugar de escribir

Un tendero hablando con un cliente, cinematográfico, diálogo natural.

Escribe

Abre con una mujer de unos cincuenta años detrás del mostrador de una librería, de perfil respecto a la cámara, ordenando recibos. Levanta la vista y dice: 'Cerramos en diez minutos', y luego vuelve a los recibos. Plano medio estático desde la posición del cliente, sin movimiento. Ambiente interior tranquilo, manejo de papeles, ruido lejano de la calle a través del cristal, sin música. Termina con la cabeza de ella bajada de nuevo.

Ejemplos de prompts para Kling 3.0

Diálogo entre dos personajes

Dos personas en una pequeña mesa de café, vistas de lado en un plano medio estático. El hombre dice: "No se lo dijiste." La mujer espera y luego responde: "No hizo falta." Cada voz distinta, interpretación pausada, un instante de silencio entre las frases. Ambiente de café con tazas y murmullo bajo, sin música. Terminar con la mujer mirando hacia otro lado.

Secuencia de varios planos

Una secuencia de tres planos en un taller, planteada como una única escena continua. Plano uno: plano general, una mujer entrando por una puerta. Plano dos: plano medio, deja una caja de herramientas sobre el banco. Plano tres: primer plano, sus manos abriendo el pestillo. Iluminación cenital uniforme y el mismo personaje durante toda la secuencia. Ambiente de taller, pasos y el clic del pestillo en el plano final. Sin diálogo, sin música.

Presentador a cámara

Un hombre con una camisa gris lisa de pie contra un fondo de oficina desenfocado suavemente, encuadrado de cintura para arriba, mirando a cámara. Dice: "Han cambiado tres cosas este trimestre, y solo una estaba prevista." Cámara estática, sin movimiento. Luz principal suave y uniforme desde el frente izquierdo. Ambiente de sala silencioso, sin música, sin voces de fondo. Termina con él haciendo una pausa, con la boca cerrada.

Kling 3.0 Pro frente a Kling 3.0 Standard

DimensiónKling 3.0 StandardKling 3.0 Pro
Pensado paraIteración rentableSalida de calidad final
EntradasIdéntico a ProIdéntico a Standard
Compatibilidad con diálogoSíSí
Modo storyboardSíSí
AudioOpcional, con precio aparteOpcional, con precio aparte
Uso habitualBloqueo del tempo y la interpretaciónLa toma que se entrega

Consejos para obtener mejores resultados con Kling 3.0

Mantén las frases cortas

Un clip de tres segundos contiene aproximadamente una frase corta a ritmo natural. Un párrafo obliga al modelo a acelerarlo o truncarlo.

Separa voz, ambiente y música

Nómbralos como tres capas. Agruparlos en una sola frase produce una mezcla confusa.

Dirige el silencio

Una pausa sostenida antes de una línea es una decisión de dirección, y normalmente se percibe mejor que un sonido continuo.

Usa el modo storyboard para secuencias

Describir tres planos en orden es mejor que comprimirlos en una única toma continua que el modelo tenga que interpretar.

Preguntas frecuentes sobre Kling 3.0

¿Qué es Kling 3.0?
Kling 3.0 es el modelo de vídeo de tercera generación de Kuaishou, que genera clips de hasta quince segundos a hasta 60fps con audio cogenerado que incluye diálogo sincronizado con los labios.
¿Puede Kling 3.0 generar diálogos?
Sí — voz sincronizada con los labios en chino, inglés, japonés, coreano y español, con una voz distinta por personaje y compatibilidad con escenas en las que los personajes hablan diferentes idiomas.
¿Kling 3.0 es gratis y cuánto cuesta?
Kling 3.0 está disponible en los planes de pago de Virse. La generación se factura por segundo a partir de una asignación mensual de créditos, y los planes superiores la hacen ilimitada dentro de un uso razonable. Las tarifas actuales de los planes figuran en la página de precios de Virse.
¿Cuánto puede durar un clip de Kling 3.0?
Hasta quince segundos por generación, a hasta 60 fotogramas por segundo.
¿Cuál es la diferencia entre Kling 3.0 Pro y Standard?
Kuaishou posiciona Standard como el nivel de iteración rentable y Pro como el de calidad final. Ambos aceptan las mismas entradas y los mismos prompts.
¿Qué es el modo de storyboard multitoma?
Un modo que planifica una secuencia de configuraciones de cámara distintas a partir de un único prompt, para que los planos se relacionen entre sí por diseño en lugar de generarse por separado y montarse después.
¿Cómo escribo diálogos para Kling 3.0?
Pon la frase hablada entre comillas e indica quién la dice. Limítala a aproximadamente una frase corta por cada tres segundos, y describe el ambiente y la música por separado del habla.
¿Cómo uso Kling 3.0 en Virse?
Elige un nivel, carga tus fotogramas de inicio y fin, cita el diálogo en el brief y genera.

Dales algo que decir

Escribe la frase, nombra la voz y deja que el modelo se encargue de la boca, el tempo y la sala en la que se pronuncia.