Inferensi Delapan Langkah
Merender dalam delapan langkah sampling, dapat dikonfigurasi hingga satu langkah.
Model 6 miliar parameter yang dipadatkan menjadi pipeline inferensi delapan langkah, dibuat untuk menghasilkan gambar yang siap pakai sebelum alur pikiran Anda beralih.
Buka halaman ini di peramban desktop untuk mulai berkarya.
Z-Image Turbo dibangun di atas satu keputusan: memampatkan inferensi menjadi delapan langkah alih-alih dua puluh hingga lima puluh langkah yang dibutuhkan model difusi standar, lalu melihat seberapa banyak kualitas yang tetap bertahan.
Ternyata, cukup banyak. Keunggulan yang dipublikasikan adalah output fotorealistis, rendering teks dwibahasa Inggris dan Mandarin, serta kepatuhan terhadap instruksi — yang semuanya bukan hal yang Anda harapkan dapat dikuasai oleh model sekecil dan secepat ini. Yang dikorbankannya adalah ruang pengembangan, bukan kompetensi.
Gunakan Z-Image Turbo di tahap awal pekerjaan. Cari arah visual, uji apakah sebuah ide dapat terbaca sama sekali, isi tata letak dengan placeholder, dan hasilkan volume gambar sekali pakai yang memang dibutuhkan untuk berpikir dengan benar.

Z-Image Turbo adalah model teks-ke-gambar dengan 6 miliar parameter. Arsitekturnya berupa transformer difusi aliran tunggal di mana token teks, token semantik, dan token gambar berbagi satu transformer alih-alih diproses dalam cabang terpisah.
Model ini dibangun di atas tiga kekuatan utama:
Jumlah langkah dapat dikonfigurasi hingga satu, dan latensi sub-detik dapat dicapai pada perangkat keras pusat data. Bobotnya dipublikasikan secara terbuka, meskipun di Virse model ini berjalan sebagai model ter-hosting tanpa perlu menginstal apa pun.

Merender dalam delapan langkah sampling, dapat dikonfigurasi hingga satu langkah.
Dapat dicapai pada perangkat keras pusat data, yang memang menjadi target seluruh desain ini.
Sengaja dibuat kecil, dan dari situlah kecepatannya berasal.
Token teks, semantik, dan gambar berbagi satu transformer alih-alih cabang terpisah.
Tipografi bahasa Inggris dan Mandarin ditangani sebagai bahasa, bukan sebagai dekorasi.
Rendering realistis, bukan tampilan khas yang distilisasi.
Delapan langkah dibandingkan dua puluh hingga lima puluh yang lazim bukanlah penyesuaian tuning, melainkan arsitekturnya. Semua hal lain tentang model ini berangkat dari keputusan untuk membuat setiap render selesai sebelum Anda kehilangan alur.
Enam miliar parameter hanyalah sebagian kecil dari yang dimiliki model unggulan, tetapi fotorealisme dan kepatuhan terhadap instruksi tetap terjaga. Komprominya tampak pada ruang ekstra, bukan pada kompetensi dasar.
Teks bahasa Inggris dan Mandarin sama-sama dirender sebagai bahasa yang dapat dibaca. Di antara model cepat, hal itu cukup tidak biasa sehingga penting ketika sebuah tata letak memerlukan label dalam salah satu aksara tersebut.
Ketika sebuah render memakan waktu kurang dari satu detik, menghasilkan satu set berisi enam menjadi satu keputusan, bukan enam keputusan.
Komposisi yang Anda sukai di sini dapat langsung masuk ke model gambar yang lebih berat sebagai referensi, atau ke model video sebagai frame pembuka, tanpa meninggalkan kanvas.
Model ini dipublikasikan secara terbuka, tetapi di Virse model ini berjalan sebagai layanan terhosting tanpa lingkungan yang perlu dikonfigurasi.
Model cepat hanya berguna sejauh apa yang ada di hilirnya. Jika berdiri sendiri, ia hanyalah sebuah keingintahuan; sebagai tahap pertama dari sebuah pipeline, ia mengubah keekonomian semua hal setelahnya. Virse membuat serah terima itu langsung. Hasil yang dibuat di sini dapat menjadi referensi untuk model unggulan atau frame pembuka untuk model video tanpa perlu diekspor, diganti nama, dan diunggah ulang.
Hasilkan tiga puluh arah dalam waktu yang dibutuhkan model unggulan untuk dua, lalu curahkan upaya nyata hanya pada yang bertahan.
Kirim komposisi yang berhasil langsung ke model yang lebih berat sebagai gambar referensi, di kanvas yang sama.
Beralih antara Z-Image Turbo dan 30+ model gambar dan video lainnya tanpa meninggalkan kanvas atau menulis ulang brief.
Arah yang ditolak tetap ditata di samping yang dipilih, dan dari sanalah sebagian besar ide putaran kedua muncul.
Pencarian visual yang luas di awal proyek, ketika jumlah arah lebih penting daripada penyelesaian akhir dari salah satunya.
Bangun board yang koheren dalam satu sesi, alih-alih merakitnya dari hasil pencarian.
Isi comp desain dengan gambar yang kira-kira tepat sebelum siapa pun memutuskan seperti apa gambar aslinya.
Cari tahu susunan kata seperti apa menghasilkan hasil seperti apa sebelum menghabiskan waktu pada model yang lebih lambat untuk mengetahuinya.
Iterasikan frame awal untuk model video dengan biaya rendah.
Ritme posting di mana setiap gambar harus layak, bukan luar biasa.
Sebutkan subjek, latar, dan perlakuannya. Brief panjang terbuang sia-sia pada kecepatan ini.
Jalankan enam sekaligus. Seluruh batch kembali kira-kira dalam waktu yang dibutuhkan satu render flagship.
Bandingkan komposisi, palet, dan suasana. Detail halus belum menjadi hal yang Anda nilai.
Bawa prompt yang berhasil ke model dengan headroom lebih tinggi untuk versi yang siap dirilis.
Prompt Z-Image Turbo yang berguna biasanya mencakup tiga elemen:
Alih-alih menulis
Sosok tunggal berdiri di tepi tebing yang diterpa angin pada golden hour, rambut tertangkap di tengah gerakan, helai-helai individual menangkap rim light, mantel wol usang dengan tekstur serat yang terlihat, burung laut di kejauhan, volumetric god rays, dibidik dengan 85mm pada f/1.4.
Tulis
Sosok berdiri di tepi tebing saat matahari terbenam, terlihat dari belakang, bidikan lebar. Cahaya rendah yang hangat. Bergaya lukisan, warna-warna redup.
Satu pohon di lereng bukit yang selain itu kosong, dilihat dari sudut rendah dengan latar langit mendung. Bidikan lebar, pohon sedikit di kanan tengah. Palet abu-abu kehijauan yang redup, fotografis.
Pasar jalanan kota pada malam hari. Ilustrasi datar, palet terbatas empat warna, garis hitam tebal, tanpa gradasi. Sebaran kios merata di seluruh frame, dilihat dari depan.
Bagian depan kedai mi kecil saat senja, dilihat lurus dari seberang jalan. Papan horizontal di atas pintu bertuliskan NORTHSIDE NOODLES, dengan 面馆 di bawahnya berukuran setengahnya. Cahaya hangat memancar dari dalam, trotoar basah memantulkannya, perlakuan fotografis.
| Dimensi | Z-Image Turbo | Nano Banana Pro |
|---|---|---|
| Parameter | 6 miliar | Skala flagship |
| Langkah inferensi | 8, dapat dikonfigurasi ke 1 | Pipeline standar |
| Target desain | Latensi | Batas output |
| Rendering teks | Bahasa Inggris dan Mandarin, string pendek | Paragraf panjang dan tata letak multibahasa |
| Penanganan referensi | Berbasis satu prompt | Penggabungan multi-gambar dengan peran |
| Posisinya | Eksplorasi dan placeholder | Aset final, cetak, pekerjaan klien |
Anda sedang melihat komposisi, palet, dan suasana. Detail tidak menjadi pertimbangan dan seharusnya tidak menjadi bagian dari penilaian.
Variasi yang cukup untuk melihat pola, cukup cepat sehingga Anda tidak pernah mempertimbangkan apakah itu sepadan.
Di luar itu, Anda sedang mendeskripsikan hal-hal yang tidak akan diselesaikan oleh delapan langkah inferensi.
Saat Anda menjalankan ulang untuk memperbaiki detail kecil, gantilah model, bukan mengganti prompt.
Saat render selesai sebelum Anda selesai berpikir, batasannya bukan lagi waktu, melainkan berapa banyak hasil yang dapat Anda tinjau dengan berguna.