Inférence en huit étapes
Effectue le rendu en huit étapes d’échantillonnage, configurable jusqu’à une seule.
Un modèle de 6 milliards de paramètres compressé dans un pipeline d’inférence en huit étapes, conçu pour produire une image exploitable avant que le fil de votre pensée ne passe à autre chose.
Ouvrez cette page sur un navigateur de bureau pour commencer à créer.
Z-Image Turbo repose sur un choix : ramener l’inférence à huit étapes au lieu des vingt à cinquante dont un modèle de diffusion standard a besoin, et voir quelle part de qualité subsiste.
Beaucoup, en réalité. Ses points forts publiés sont un rendu photoréaliste, le rendu de texte bilingue en anglais et en chinois, et le respect des instructions — rien de tout cela ne correspond à ce que l’on attendrait d’un modèle aussi petit et aussi rapide. Ce qu’il sacrifie, c’est de la marge, pas de la compétence.
Utilisez Z-Image Turbo en amont du travail. Cherchez une direction visuelle, vérifiez si une idée se comprend tout court, remplissez une mise en page avec des espaces réservés et générez le volume d’images jetables que toute vraie réflexion exige.

Z-Image Turbo est un modèle texte-image de 6 milliards de paramètres. Son architecture est un transformeur de diffusion à flux unique dans lequel les jetons de texte, les jetons sémantiques et les jetons d’image partagent un même transformeur plutôt que d’être traités dans des branches séparées.
Le modèle s’articule autour de trois grands atouts :
Le nombre d’étapes est configurable jusqu’à une seule, et une latence inférieure à la seconde est atteignable sur du matériel de centre de données. Les poids sont publiés ouvertement, même si dans Virse il s’exécute comme un modèle hébergé, sans rien à installer.

Effectue le rendu en huit étapes d’échantillonnage, configurable jusqu’à une seule.
Réalisable sur du matériel de centre de données, ce que vise toute la conception.
Délibérément petit, ce qui explique sa vitesse.
Les jetons de texte, sémantiques et d’image partagent un même transformeur plutôt que des branches séparées.
Les caractères anglais et chinois sont traités comme du langage plutôt que comme de la décoration.
Rendu réaliste plutôt qu’un style maison stylisé.
Huit étapes contre les vingt à cinquante habituelles : ce n’est pas un ajustement de réglage, c’est l’architecture. Tout le reste de ce modèle découle de la décision de faire en sorte que chaque rendu se termine avant que vous ne perdiez le fil.
Six milliards de paramètres ne représentent qu’une fraction de ce que portent les modèles phares, pourtant le photoréalisme comme le respect des consignes tiennent bon. Le compromis se manifeste dans la marge de manœuvre plutôt que dans la compétence de base.
Les textes en anglais et en chinois s’affichent tous deux dans une langue lisible. Parmi les modèles rapides, c’est assez inhabituel pour compter lorsqu’une mise en page nécessite un libellé dans l’une ou l’autre écriture.
Quand un rendu prend moins d’une seconde, générer une série de six relève d’une seule décision plutôt que de six.
Une composition qui vous plaît ici peut être envoyée directement vers un modèle d’image plus lourd comme référence, ou vers un modèle vidéo comme première image, sans quitter le canevas.
Le modèle est publié ouvertement, mais dans Virse, il fonctionne comme un service hébergé, sans environnement à configurer.
Un modèle rapide n’est utile que si ce qui se trouve en aval l’est aussi. À lui seul, c’est une curiosité ; en tant que première étape d’un pipeline, il change l’économie de tout ce qui suit. Virse rend ce passage direct. Un résultat généré ici peut devenir une référence pour un modèle phare ou une image d’ouverture pour un modèle vidéo sans être exporté, renommé, puis téléversé à nouveau.
Générez trente directions pendant le temps qu’il faut à un modèle phare pour en produire deux, puis ne consacrez un véritable effort qu’à ce qui reste.
Envoyez la composition qui a fonctionné directement dans un modèle plus lourd comme image de référence, sur le même canevas.
Passez de Z-Image Turbo à plus de 30 autres modèles d’image et de vidéo sans quitter le canevas ni réécrire le brief.
Les directions écartées restent disposées à côté de celle choisie, et c’est là que naissent la plupart des idées de deuxième tour.
Des recherches visuelles larges au début d’un projet, lorsque le nombre de directions compte davantage que la finition de chacune.
Construisez un moodboard cohérent en une seule session plutôt que d’en assembler un à partir de résultats de recherche.
Remplissez une maquette de design avec des images à peu près justes avant que quiconque ait décidé quelles seront les vraies.
Déterminez quelle formulation produit quel résultat avant de passer du temps sur un modèle plus lent pour le découvrir.
Itérez à moindre coût sur l’image de départ d’un modèle vidéo.
Des cadences de publication où chaque image doit être correcte plutôt qu’exceptionnelle.
Nommez le sujet, le décor et le traitement. Les briefs longs sont inutiles à cette vitesse.
Lancez-en six à la fois. Le lot entier revient à peu près dans le temps nécessaire au rendu d’un seul modèle phare.
Comparez la composition, la palette et l’ambiance. Les détails fins ne sont pas encore ce que vous évaluez.
Transférez le prompt qui a fonctionné vers un modèle offrant plus de marge pour la version finale.
Un prompt Z-Image Turbo utile comprend généralement trois éléments :
Au lieu d’écrire
Une silhouette solitaire debout au bord d’une falaise battue par les vents à l’heure dorée, les cheveux saisis en plein mouvement, des mèches individuelles captant le contre-jour, manteau en laine usé avec texture des fibres visible, oiseaux marins au loin, rayons divins volumétriques, prise de vue au 85mm à f/1.4.
Écrivez
Une silhouette debout au bord d’une falaise au coucher du soleil, vue de dos, plan large. Lumière basse et chaude. Style pictural, couleurs douces.
Un arbre seul sur une colline par ailleurs vide, vu en contre-plongée sur fond de ciel couvert. Plan large, arbre légèrement à droite du centre. Palette gris-vert atténuée, photographique.
Un marché de rue urbain de nuit. Illustration plate, palette limitée à quatre couleurs, traits noirs épais, sans dégradés. Répartition uniforme des stands dans le cadre, vue de face.
La devanture d’un petit restaurant de nouilles au crépuscule, vue de face depuis l’autre côté de la rue. Une enseigne horizontale au-dessus de la porte indique NORTHSIDE NOODLES, avec 面馆 en dessous, deux fois plus petit. Lumière chaude se déversant depuis l’intérieur, chaussée mouillée qui la reflète, traitement photographique.
| Critère | Z-Image Turbo | Nano Banana Pro |
|---|---|---|
| Paramètres | 6 milliards | Échelle d’un modèle phare |
| Étapes d’inférence | 8, configurable à 1 | Pipeline standard |
| Objectif de conception | Latence | Plafond de sortie |
| Rendu du texte | Anglais et chinois, chaînes courtes | Longs passages et mises en page multilingues |
| Gestion des références | Piloté par un seul prompt | Fusion de plusieurs images avec des rôles |
| Où l’utiliser | Exploration et espaces réservés | Ressources finales, impression, travail client |
Vous examinez la composition, la palette et l’ambiance. Le détail n’est pas à l’ordre du jour et ne doit pas faire partie de l’évaluation.
Assez de variation pour distinguer une tendance, assez rapide pour que vous ne vous demandiez jamais si cela en vaut la peine.
Au-delà, vous décrivez des choses que huit étapes d’inférence ne résoudront pas.
Dès que vous relancez pour corriger de petits détails, changez de modèle plutôt que de modifier les prompts.
Quand un rendu se termine avant que vous ayez fini de réfléchir, la contrainte n’est plus le temps, mais le nombre de résultats que vous pouvez examiner utilement.