Z-Image Turbo AI画像ジェネレーター

60億パラメーターのモデルを8ステップの推論パイプラインに圧縮し、思考の流れが次へ移る前に使える画像を返すよう設計されています。

作成を始めるには、デスクトップのブラウザでこのページを開いてください。

声に出して考えられるほど高速

Z-Image Turbo は、標準的な拡散モデルが必要とする20〜50ステップではなく、推論を8ステップに圧縮し、どれだけ品質が残るかを確かめる、という一つの判断を軸に構築されています。

結果として、かなり多くが残ります。公表されている強みは、フォトリアルな出力、英語と中国語のバイリンガルなテキストレンダリング、そして指示への忠実な追従です。これらはいずれも、これほど小さく、これほど高速なモデルが得意とするとは想像しにくいものです。犠牲にしているのは余力であり、能力ではありません。

作業の初期段階で Z-Image Turbo を使ってください。ビジュアルの方向性を探り、アイデアがそもそも伝わるかを試し、レイアウトをプレースホルダーで埋め、きちんと考えるために実際に必要となる大量の使い捨て画像を生成できます。

z-image-turbo-value-proposition-think-out-loud-01.jpg

Z-Image Turboとは?

Z-Image Turboは、60億パラメータのテキスト画像生成モデルです。そのアーキテクチャはシングルストリーム拡散トランスフォーマーであり、テキストトークン、セマンティックトークン、画像トークンが別々の分岐で処理されるのではなく、1つのトランスフォーマーを共有します。

このモデルは、主に3つの強みを中心に構築されています:

  • 標準的な拡散モデルで必要とされる20~50ステップに対し、8ステップの推論パイプライン
  • 比較的小さなパラメータ数にもかかわらず、フォトリアルな出力
  • 英語と中国語のバイリンガルなテキストレンダリングと、信頼性の高い指示遵守

ステップ数は1まで設定可能で、データセンター向けハードウェアではサブ秒レイテンシを実現できます。重みはオープンに公開されていますが、Virseではインストール不要のホスト型モデルとして動作します。

What Is Z-Image Turbo?

Z-Image Turboの仕様一覧

8ステップ推論

8回のサンプリングステップでレンダリングし、1回まで設定可能です。

サブ秒レイテンシー

データセンターのハードウェアで実現可能であり、それこそが設計全体の狙いです。

60億パラメーター

意図的に小型化されており、そこから速度が生まれます。

シングルストリームTransformer

テキスト、セマンティック、画像のトークンは別々の分岐ではなく、1つのTransformerを共有します。

バイリンガルテキスト描画

英語と中国語の文字を装飾ではなく言語として扱います。

フォトリアルな出力

スタイル化された独自の見た目ではなく、リアルなレンダリングを行います。

Z-Image Turbo AI画像ジェネレーターの主な機能

設計目標としての速度

通常の20〜50ステップに対する8ステップは、チューニング上の微調整ではなく、アーキテクチャそのものです。このモデルの他のすべては、流れを見失う前に各レンダリングを完了させるという決定から生まれています。

小型モデル、本格的な出力

60億パラメータはフラッグシップモデルが備える規模のほんの一部にすぎませんが、フォトリアリズムと指示への追従性はどちらも維持されています。そのトレードオフは、基本的な能力ではなく余力の部分に表れます。

バイリンガル文字

英語と中国語のテキストはどちらも読みやすい言語としてレンダリングされます。高速モデルの中では、これはレイアウトにどちらかの文字体系のラベルが必要な場合に重要になるほど珍しいことです。

本質的にバッチ向き

レンダリングが1秒未満で済むなら、6つのセットを生成することは6回の判断ではなく、1回の判断になります。

他のすべてのモデルに供給

ここで気に入った構図は、キャンバスを離れることなく、リファレンスとしてより重い画像モデルへ、または冒頭フレームとして動画モデルへ、そのまま送れます。

オープンウェイト、ここでホスト

このモデルはオープンに公開されていますが、Virseでは設定すべき環境なしにホスト型サービスとして実行されます。

VirseでZ-Image Turboを活用して構築

高速モデルは、その下流にあるもの次第で初めて有用になります。単体では興味深い存在にすぎませんが、パイプラインの第一段階として使えば、その後のすべての工程の経済性を変えます。 Virseなら、その受け渡しが直接行えます。ここで生成した結果は、エクスポート、リネーム、再アップロードをすることなく、フラッグシップモデルの参照画像や動画モデルの開始フレームにできます。

確定前に広く探索

フラッグシップモデルが2つを生成する時間で30通りの方向性を生成し、生き残ったものだけに本格的な労力をかけられます。

再アップロードなしで有望案を昇格

うまくいった構図を、同じキャンバス上でリファレンス画像としてより重いモデルにそのまま送れます。

30以上のクリエイティブモデルにアクセス

キャンバスを離れたりブリーフを書き直したりすることなく、Z-Image Turboと30以上の他の画像・動画モデルを行き来できます。

探索全体を可視化したまま維持

採用されなかった方向性は選ばれたものの横に並べたまま残り、そこから第2ラウンドのアイデアの多くが生まれます。

Z-Image Turboで何を作成できますか?

コンセプト探索

プロジェクトの開始時に、1つひとつの仕上がりよりも方向性の数が重要なときに行う幅広いビジュアル探索。

ムードボード

検索結果から寄せ集めるのではなく、1回の作業で一貫したボードを作成できます。

レイアウトのプレースホルダー

本番の画像が何になるのか誰もまだ決めていない段階で、デザインカンプをおおよそ適切な画像で埋められます。

プロンプトテスト

遅いモデルに時間を費やして確かめる前に、どの文言がどの結果を生むのかを把握できます。

動画キーフレームのドラフト

動画モデルが開始点にするフレームを低コストで反復できます。

高頻度のソーシャル投稿

各画像が例外的であることよりも、妥当であることが求められる投稿ペース。

VirseでZ-Image Turboを使用する方法

  1. 短いプロンプトを書く

    被写体、設定、表現手法を指定します。この速度では長いブリーフは無駄になります。

  2. セットを生成する

    一度に6つ実行します。バッチ全体が、フラッグシップモデルのレンダー1回分ほどの時間で返ってきます。

  3. 細部ではなく方向性を判断する

    構図、パレット、ムードを比較します。細部の精度は、まだ評価する対象ではありません。

  4. 選んだ案を別の場所で作り直す

    うまくいったプロンプトを、最終版に使うために、より余力のある上位モデルへ持っていきます。

Z-Image Turboプロンプトの書き方

有用なZ-Image Turboプロンプトには、通常3つの要素が含まれます:

  • 被写体
  • 設定
  • スタイル

こう書く代わりに

ゴールデンアワーの風吹きすさぶ崖の縁に立つ孤独な人物。髪は動きの途中で捉えられ、一本一本の毛筋がリムライトを受けて輝き、風雨にさらされたウールコートには繊維の質感が見える。遠くには海鳥、ボリュメトリックなゴッドレイ、85mm、f/1.4で撮影。

こう書く

夕暮れの崖の縁に立つ人物を背後から捉えたワイドショット。暖かい低い光。絵画的で落ち着いた色彩。

Z-Image Turboプロンプト例

構図テスト

ほかに何もない丘の斜面に立つ1本の木。曇り空を背景にローアングルから見た構図。 ワイドショット、木は中心よりわずかに右。 くすんだグレーグリーンのパレット、写真風。

スタイル探索

夜の都市のストリートマーケット。 フラットなイラスト、4色に限定したパレット、太い黒の線画、グラデーションなし。 フレーム全体に屋台を均等に配置し、正面から見た構図。

バイリンガル看板

夕暮れ時の小さな麺料理店の正面。通りの向かいから真正面に見た構図。 ドアの上にある横長の看板にはNORTHSIDE NOODLESと書かれ、その下に半分のサイズで面馆とある。 店内から暖かい光がこぼれ、濡れた舗道がそれを反射している、写真風の表現。

Z-Image TurboとNano Banana Proの比較

比較項目Z-Image TurboNano Banana Pro
パラメータ6 billionフラッグシップ級の規模
推論ステップ8、1まで設定可能標準パイプライン
設計ターゲットレイテンシ出力上限
テキスト描画英語と中国語、短い文字列長い文章と多言語レイアウト
参照の扱い単一プロンプト駆動役割付きの複数画像ブレンド
適した用途探索とプレースホルダー最終アセット、印刷、クライアントワーク

高速モデルをさらに活用するためのヒント

品質ではなく方向性を判断

見るべきものは構図、パレット、ムードです。ディテールは検討対象ではなく、評価に含めるべきではありません。

6枚単位で生成

パターンを見つけられるだけの十分なバリエーションがあり、それを行う価値があるかどうかを考えることがないほど高速です。

プロンプトは40語未満に

それ以上は、8回の推論ステップでは解決できない事柄を記述していることになります。

その段階を卒業すべき時を見極める

細部の修正のために再実行する段階になったら、プロンプトを変えるのではなくモデルを切り替えましょう。

Z-Image Turbo FAQ

Z-Image Turboとは何ですか?
Z-Image Turboは、単一ストリームの拡散トランスフォーマーを基盤とする60億パラメータのテキスト画像生成モデルで、非常に低いレイテンシを実現するために8ステップの推論パイプラインへ圧縮されています。
Z-Image Turboはなぜこれほど高速なのですか?
標準的な拡散モデルは、画像1枚あたり20〜50のサンプリングステップを要します。このモデルは8ステップで、1ステップまで設定できるため、データセンターのハードウェア上でサブ秒の生成が可能になります。
Z-Image Turboは無料ですか?料金はいくらですか?
Virseの有料プランで利用できます。生成は画像ごとの課金ではなく月間クレジット枠から消費され、上位プランではフェアユースの範囲内で実質無制限になります。現在のプラン料金はVirseの料金ページに掲載されています。
Z-Image Turboは画像内のテキストを描画できますか?
はい、英語と中国語の両方に対応しています。長い文章よりも、看板やラベルのような短い文字列が得意範囲です。
Z-Image Turboは優れていますか?
探索や大量生成には適しています。サイズの割にフォトリアルで指示にもよく従いますが、細部の精密さや複雑なタイポグラフィでフラッグシップモデルと競うために作られているわけではありません。
Z-Image Turboはオープンソースですか?
重みは公開されています。Virseではホスト型モデルとして実行されるため、ダウンロードや設定は不要です。
最終画像には代わりに何を使うべきですか?
テキストとアイデンティティの一貫性にはNano Banana Pro、ブランド制約のある作業にはFLUX 2 Pro、長く複数の制約があるブリーフにはGPT Image 2を使用してください。
VirseでZ-Image Turboを使うにはどうすればよいですか?
モデル一覧から選択し、短いプロンプトを書いて生成します。同時に複数実行できます――その速さこそがポイントです。

単体ではなくセットで考える

考え終える前にレンダーが完了すると、制約は時間ではなく、有用に確認できる結果の数になります。