Inferencia en ocho pasos
Renderiza en ocho pasos de muestreo, configurable hasta uno.
Un modelo de 6.000 millones de parámetros comprimido en un proceso de inferencia de ocho pasos, creado para devolver una imagen utilizable antes de que pierdas el hilo de tus pensamientos.
Abre esta página en un navegador de escritorio para empezar a crear.
Z-Image Turbo se basa en una decisión: comprimir la inferencia a ocho pasos en lugar de los veinte a cincuenta que necesita un modelo de difusión estándar, y ver cuánta calidad se mantiene.
Bastante, de hecho. Sus puntos fuertes publicados son la salida fotorrealista, la representación de texto bilingüe en inglés y chino, y el seguimiento de instrucciones, nada de lo cual cabría esperar que un modelo tan pequeño y tan rápido hiciera bien. A lo que renuncia es al margen, no a la competencia.
Utiliza Z-Image Turbo al inicio del trabajo. Busca una dirección visual, comprueba si una idea se entiende en absoluto, rellena un diseño con marcadores de posición y genera el volumen de imágenes desechables que pensar correctamente requiere en realidad.

Z-Image Turbo es un modelo de texto a imagen de 6.000 millones de parámetros. Su arquitectura es un transformador de difusión de flujo único en el que los tokens de texto, los tokens semánticos y los tokens de imagen comparten un único transformador en lugar de procesarse en ramas separadas.
El modelo se basa en tres grandes puntos fuertes:
El recuento de pasos es configurable hasta uno, y es posible lograr una latencia inferior a un segundo en hardware de centro de datos. Los pesos se publican abiertamente, aunque en Virse se ejecuta como un modelo alojado sin nada que instalar.

Renderiza en ocho pasos de muestreo, configurable hasta uno.
Alcanzable en hardware de centro de datos, que es a lo que apunta todo el diseño.
Deliberadamente pequeño, que es de donde viene la velocidad.
Los tokens de texto, semánticos y de imagen comparten un único transformer en lugar de ramas separadas.
La tipografía en inglés y chino se trata como lenguaje, no como decoración.
Renderizado realista en lugar de un aspecto de estilo propio estilizado.
Ocho pasos frente a los veinte a cincuenta habituales no es un ajuste de optimización, es la arquitectura. Todo lo demás de este modelo se deriva de la decisión de hacer que cada render termine antes de que pierdas el hilo.
Seis mil millones de parámetros son una fracción de los que incorporan los modelos insignia, y aun así se mantienen tanto el fotorrealismo como el seguimiento de instrucciones. La diferencia se nota en el margen de capacidad, no en la competencia básica.
Tanto el texto en inglés como en chino se renderizan como lenguaje legible. Entre los modelos rápidos, eso es lo bastante inusual como para importar cuando un diseño necesita una etiqueta en cualquiera de los dos alfabetos.
Cuando un render tarda menos de un segundo, generar un conjunto de seis es una sola decisión, no seis.
Una composición que te guste aquí puede pasar directamente a un modelo de imagen más pesado como referencia, o a un modelo de vídeo como fotograma inicial, sin salir del lienzo.
El modelo se publica de forma abierta, pero en Virse funciona como un servicio alojado, sin ningún entorno que configurar.
Un modelo rápido solo es tan útil como lo que viene después de él. Por sí solo es una curiosidad; como primera etapa de un flujo de trabajo, cambia la economía de todo lo que viene después. Virse hace que ese traspaso sea directo. Un resultado generado aquí puede convertirse en una referencia para un modelo insignia o en un fotograma inicial para un modelo de vídeo sin tener que exportarlo, renombrarlo y volver a subirlo.
Genera treinta direcciones en el tiempo que un modelo insignia tarda en hacer dos, y luego dedica esfuerzo real solo a lo que sobreviva.
Envía la composición que ha funcionado directamente a un modelo más pesado como imagen de referencia, en el mismo lienzo.
Cambia entre Z-Image Turbo y más de 30 modelos de imagen y vídeo sin salir del lienzo ni reescribir el brief.
Las direcciones descartadas permanecen dispuestas junto a la elegida, que es de donde salen la mayoría de las ideas de segunda ronda.
Búsquedas visuales amplias al inicio de un proyecto, cuando el número de direcciones importa más que el acabado de cualquiera de ellas.
Construye un tablero coherente en una sola sesión en lugar de montarlo a partir de resultados de búsqueda.
Rellena una maqueta de diseño con imágenes que sean aproximadamente correctas antes de que nadie haya decidido cuáles serán las reales.
Determina qué redacción produce qué resultado antes de dedicar tiempo a averiguarlo con un modelo más lento.
Itera de forma económica sobre el fotograma del que partirá un modelo de vídeo.
Ritmos de publicación en los que cada imagen debe ser razonable, no excepcional.
Nombra el sujeto, el entorno y el tratamiento. Los briefs largos se desaprovechan a esta velocidad.
Ejecuta seis a la vez. Todo el lote vuelve en aproximadamente el tiempo que tarda un render insignia.
Compara la composición, la paleta y el ambiente. El detalle fino aún no es lo que estás evaluando.
Lleva el prompt que ha funcionado a un modelo con mayor margen de capacidad para la versión que se entrega.
Un prompt útil para Z-Image Turbo suele incluir tres elementos:
En lugar de escribir
Una figura solitaria de pie al borde de un acantilado azotado por el viento durante la hora dorada, con el pelo capturado en pleno movimiento, mechones individuales atrapando la luz de contorno, abrigo de lana desgastado con textura de fibra visible, aves marinas a lo lejos, rayos divinos volumétricos, tomada con un 85 mm a f/1.4.
Escribe
Una figura de pie al borde de un acantilado al atardecer, vista desde atrás, plano general. Luz baja y cálida. Pictórico, colores apagados.
Un solo árbol en una ladera por lo demás vacía, visto desde un ángulo bajo contra un cielo nublado. Plano general, árbol ligeramente a la derecha del centro. Paleta apagada gris verdosa, fotográfico.
Un mercado callejero urbano de noche. Ilustración plana, paleta limitada de cuatro colores, trazos negros gruesos, sin degradados. Distribución uniforme de puestos por todo el encuadre, visto de frente.
La fachada de una pequeña tienda de fideos al anochecer, vista de frente desde el otro lado de la calle. Un cartel horizontal sobre la puerta dice NORTHSIDE NOODLES, con 面馆 debajo a la mitad de tamaño. Luz cálida saliendo del interior, pavimento mojado reflejándola, tratamiento fotográfico.
| Dimensión | Z-Image Turbo | Nano Banana Pro |
|---|---|---|
| Parámetros | 6 mil millones | Escala insignia |
| Pasos de inferencia | 8, configurable a 1 | Flujo estándar |
| Objetivo de diseño | Latencia | Límite máximo de salida |
| Renderizado de texto | Inglés y chino, cadenas cortas | Pasajes largos y diseños multilingües |
| Gestión de referencias | Guiado por un único prompt | Mezcla de varias imágenes con roles |
| Dónde encaja | Exploración y marcadores de posición | Recursos finales, impresión, trabajo para clientes |
Estás evaluando composición, paleta y atmósfera. El detalle no entra en juego y no debería formar parte de la valoración.
Variación suficiente para ver un patrón, con la rapidez suficiente para que nunca te plantees si merece la pena.
Más allá de eso, estarás describiendo cosas que ocho pasos de inferencia no resolverán.
En cuanto vuelvas a ejecutar para corregir pequeños detalles, cambia de modelo en lugar de cambiar de prompt.
Cuando un renderizado termina antes de que hayas terminado de pensar, la limitación deja de ser el tiempo y pasa a ser cuántos resultados puedes revisar de forma útil.