2K de serie
No es un nivel premium: cada generación sale en 2K.
El modelo Hailuo 03 de MiniMax produce vídeo 2K silencioso, impulsado ya sea por un primer y último fotograma o por un conjunto de imágenes de referencia.
Abre esta página en un navegador de escritorio para empezar a crear.
Minimax H3 es el modelo de vídeo de MiniMax, y su posicionamiento en Virse es inusualmente sencillo de describir: produce 2K, no produce sonido y no hay nada más que decidir.
La mayoría de los modelos de vídeo presentan una cuadrícula —resolución, relación de aspecto, nivel de calidad— y cada elección supone un pequeño peaje para empezar. Este tiene una única configuración. Cada generación sale en 2K con audio nativo, incluido diálogo sincronizado con los labios, de modo que un clip llega con sonido en lugar de esperar a una pasada de musicalización.
Utiliza Minimax H3 cuando la resolución sea el requisito y el audio no lo sea. Produce movimiento de producto con mucho detalle, series protagonizadas por personajes a partir de imágenes de referencia y metraje destinado a una línea de tiempo en la que el sonido se gestiona por separado.

Minimax H3 es un modelo de generación de vídeo con IA desarrollado por MiniMax, conocido por su nombre de backend Hailuo 03. Virse lo ofrece como dos entradas con diferentes datos de entrada y la misma salida.
El modelo se basa en tres grandes fortalezas:
Minimax H3 toma un primer fotograma, un último fotograma o ambos, además de un brief escrito. Minimax H3 Reference toma en su lugar imágenes de referencia, llevando sus sujetos, estilo y lenguaje visual a una secuencia generada. Ambos generan salida 2K con audio nativo.
No es un nivel premium: cada generación sale en 2K.
Con cada clip llega una pista de audio generada, y no hay opción para desactivarla.
Impulsado por fotogramas e impulsado por referencias, listados por separado.
Sin selector de resolución ni grado de calidad. El audio está siempre activado en lugar de ser opcional.
La entrada Reference acepta imágenes proporcionadas como impulsor.
La entrada estándar fija cualquiera de los extremos del plano, o ambos.
2K es lo que hace este modelo. No hay ningún nivel que sopesar ni ruta de actualización que considerar, lo que elimina la fuente más común de duda antes de una generación.
La sincronización labial y el ambiente se producen en la misma pasada que la imagen. Aquí eso es lo predeterminado, no un ajuste que tengas que acordarte de activar.
Cuando un personaje tiene que aparecer en seis clips y seguir siendo reconocible, mostrar ejemplos al modelo es mejor que describirlos. La entrada Reference existe específicamente para eso.
Varias imágenes pueden desempeñar cada una una función distinta —una para la persona, una para el entorno, una para el estilo— en lugar de promediarse en una sola influencia.
La entrada estándar acepta tanto un primer fotograma como un último fotograma, lo que convierte la generación en un recorrido entre dos composiciones conocidas en lugar de uno abierto.
Elegir entre trabajar a partir de fotogramas o a partir de referencias depende de con qué material cuentas, no de lo que te puedes permitir.
El trabajo de continuidad basado en referencias depende de que el conjunto de referencias se mantenga estable. Cambia una imagen entre clips y el personaje cambia, normalmente de una forma que nadie nota hasta que se monta la secuencia. Virse mantiene el conjunto en un solo lugar. Las imágenes de referencia viven en el lienzo junto a cada clip generado a partir de ellas, por lo que se reutilizan las mismas entradas en lugar de volver a recopilarlas, y la deriva se hace visible cuando aún hay tiempo para corregirla.
Mantén juntas en el lienzo las imágenes del personaje, del producto y del estilo, y apunta cada clip a las mismas.

Crea las imágenes fijas con un modelo de imagen en el mismo lienzo y luego pásaselas a Minimax H3 sin exportarlas.

Muévete entre Minimax H3 y más de 30 modelos de imagen y vídeo sin salir del lienzo ni reescribir el briefing.

Organiza la serie en orden para que sea evidente si un sujeto ha variado entre la toma dos y la toma cinco.

Varios clips con la misma persona, cohesionados por un conjunto de referencias compartido.
Rotaciones, revelaciones y pasadas de detalle a una resolución que resiste el recorte.
Referencias de prendas y estilo que dirigen el movimiento sin tener que volver a describirlas cada vez.
Clips estilizados en los que un lenguaje visual definido debe mantenerse de una toma a otra.
Clips guiados por fotogramas en los que la composición ya está decidida.
Material para líneas de tiempo en las que el diálogo y el ambiente generados son un punto de partida, no algo que se añade después.
Basado en fotogramas cuando conoces la composición; basado en referencias cuando un sujeto debe seguir siendo reconocible.
Carga los dos fotogramas de punto final, o el conjunto de referencias con una tarea indicada para cada imagen.
Indica qué se mueve en la escena, cómo se comporta la cámara y a qué ritmo.
Mantén las mismas entradas y cambia solo las instrucciones para que la serie mantenga la coherencia.
Un prompt útil de Minimax H3 suele incluir cuatro elementos:
En lugar de escribir
Una modelo caminando por una galería, cinematográfico, usando las referencias adjuntas.
Escribe
Usa a la persona de la Imagen 1, el abrigo de la Imagen 2 y el interior de la galería de la Imagen 3. Ella camina desde el borde izquierdo del encuadre hacia el centro a un ritmo pausado y se detiene mirando un cuadro fuera de cámara a la derecha. La cámara la sigue a una distancia constante, manteniéndola al mismo tamaño en el encuadre durante todo el tiempo. Termina con ella inmóvil, de perfil, en el centro del encuadre.
Usa a la mujer de la Imagen 1 y el interior del taller de la Imagen 2. Ella está sentada en un banco, con las manos trabajando en algo fuera de encuadre. Hace una pausa, mira hacia la ventana de la izquierda y luego vuelve a sus manos. La cámara mantiene un plano medio estático desde una altura ligeramente superior a la del banco, sin movimiento y sin cortes. Conserva su rostro, pelo y ropa exactamente como se muestran en la Imagen 1. Termina con la cabeza de ella inclinada de nuevo.
Abrir con la composición de la Imagen 1: una cartera de cuero de pie sobre un alféizar de piedra pálida, con las hebillas orientadas hacia la cámara. La cámara orbita lentamente hacia la izquierda unos cuarenta y cinco grados, manteniendo la cartera centrada y a un tamaño constante. La luz permanece fija mientras la cámara se mueve, de modo que los reflejos se desplazan por el cuero y los herrajes. Terminar con una vista de tres cuartos en la que se vea el fuelle lateral y las costuras.
Comenzar con la Imagen 1: un escenario vacío con un único pie de micrófono, con las luces de sala encendidas. Las luces de sala se atenúan durante la primera mitad del clip mientras un único foco cenital se intensifica sobre el micrófono. Nada más se mueve. La cámara mantiene un plano general fijo durante todo el tiempo. Terminar con la Imagen 2: el escenario a oscuras salvo por el micrófono iluminado.
| Dimensión | Minimax H3 | Minimax H3 Reference |
|---|---|---|
| Entrada | Primer fotograma, último fotograma o ambos | Imágenes de referencia proporcionadas |
| Salida | 2K sin sonido | 2K sin sonido |
| Ideal para | Planos con una composición definida | Sujetos que deben seguir siendo reconocibles |
| Control de extremos | Se pueden fijar ambos extremos | Guiado por referencias en lugar de fotogramas |
| Uso típico | Movimiento de producto, transiciones | Series de personajes, campañas estilizadas |
| Coste de cambio | Misma estructura de instrucciones en ambos | Misma estructura de instrucciones en ambos |
Subir tres imágenes sin indicar cuál es el sujeto es la forma más habitual de que estos briefings salgan mal.
Cambiar una sola imagen entre clips basta para romper la continuidad. Cambia el briefing en su lugar.
La salida incluye sonido. Las indicaciones de diálogo, efectos y ambiente en el prompt dan forma a lo que se genera.
Los planos que pasan de un estado definido a otro son lo que mejor hace la entrada estándar.
Elige la entrada que se ajuste a lo que tienes, describe el movimiento y recibe 2K sin una pantalla de configuración de por medio.