Z-Image Turbo AI 图像生成器

一个 60 亿参数模型,被压缩为八步推理流程,旨在在你的思路继续推进之前就返回一张可用的图片。

请在桌面端浏览器打开本页开始创作。

快到足以边想边试

Z-Image Turbo 的构建围绕一个决策展开:将推理压缩到八步,而不是标准扩散模型所需的二十到五十步,并看看还能保留多少质量。

事实证明,相当多。其公开的优势包括照片级真实感输出、英中双语文本渲染,以及对指令的遵循——这些都不是你会预期一个如此小巧、如此快速的模型所擅长的。它牺牲的是上限,而不是能力。

在工作前期使用 Z-Image Turbo。探索视觉方向,测试一个想法是否能被理解,用占位图填充版面,并生成真正充分思考所实际需要的大量可丢弃图像。

z-image-turbo-value-proposition-think-out-loud-01.jpg

什么是 Z-Image Turbo?

Z-Image Turbo 是一个拥有 60 亿参数的文本到图像模型。其架构是单流扩散 Transformer,其中的文本 token、语义 token 和图像 token 共享同一个 Transformer,而不是在不同分支中分别处理。

该模型围绕三大核心优势构建:

  • 八步推理流水线,相比之下,标准扩散需要 20 到 50 步
  • 尽管参数量相对较小,仍能输出照片级真实感图像
  • 支持英文和中文双语文本渲染,并能可靠遵循指令

步数可配置低至一步,并且在数据中心硬件上可实现亚秒级延迟。权重已公开发布,不过在 Virse 中,它作为托管模型运行,无需安装任何内容。

What Is Z-Image Turbo?

Z-Image Turbo 规格一览

八步推理

以八个采样步骤渲染,并可配置为低至一步。

亚秒级延迟

可在数据中心硬件上实现,这正是整个设计所针对的目标。

60 亿参数

刻意做小,而速度正来源于此。

单流 Transformer

文本、语义和图像 token 共用一个 transformer,而不是分开的分支。

双语文本渲染

将英文和中文文字作为语言来处理,而不是作为装饰。

照片级真实输出

真实感渲染,而不是风格化的固定视觉。

Z-Image Turbo AI 图像生成器的主要功能

以速度为设计目标

用八步对比通常的二十到五十步,这不是调参微调,而是架构本身。这个模型的其他一切,都源于一个决定:让每次渲染都在你思路中断之前完成。

小模型,真实输出

六十亿参数只是旗舰模型所拥有参数量的一小部分,但它仍能保持照片级真实感和对指令的遵循。这种取舍体现为上限空间,而不是基本能力。

双语字体

英文和中文文本都能渲染成可读语言。在快速模型中,这一点已足够少见;当版式需要任一文字的标签时,它就很重要。

天生适合批量处理

当一次渲染用时不到一秒时,生成一组六张图就是一次决策,而不是六次决策。

为其他所有模型提供输入

你在这里喜欢的构图可以直接作为参考交给更重的图像模型,或作为开场帧交给视频模型,而无需离开画布。

开放权重,在此托管

该模型以开放方式发布,但在 Virse 中它作为托管服务运行,无需配置任何环境。

在 Virse 中使用 Z-Image Turbo 构建

快速模型的价值,取决于它下游承接的内容。单独来看,它只是一个新奇事物;作为流程的第一阶段,它会改变后续一切的经济成本。 Virse 让这种交接变得直接。在这里生成的结果,可以成为旗舰模型的参考,或成为视频模型的开场帧,而无需导出、重命名再重新上传。

提交前广泛探索

在旗舰模型生成两张图所需的时间里生成三十个方向,然后只把真正的精力花在留下来的方案上。

无需重新上传即可升级优胜结果

将效果不错的构图作为参考图像,直接送入同一画布上的更重模型。

访问 30+ 个创意模型

在 Z-Image Turbo 和 30 多个其他图像与视频模型之间切换,无需离开画布或重写简报。

让整个搜索过程保持可见

被否掉的方向会与选中的方案并排保留,而多数第二轮想法正是从这里产生的。

你可以用 Z-Image Turbo 创作什么?

概念探索

适用于项目初期的大范围视觉探索,此时方向数量比任何单一方案的完成度更重要。

情绪板

在一次工作中搭建出一块连贯的情绪板,而不是从搜索结果里拼凑一个。

布局占位图

在任何人决定真实图像应是什么之前,先用大致合适的图像填充设计稿。

提示词测试

先弄清楚什么措辞会产生什么结果,再把时间花在较慢的模型上验证。

视频关键帧草稿

以低成本迭代视频模型的起始画面。

高频社交内容

适用于每张图只需合理而不必卓越的发布节奏。

如何在 Virse 中使用 Z-Image Turbo

  1. 编写简短提示词

    说明主体、场景和处理方式。在这样的速度下,长篇需求说明没有意义。

  2. 生成一组结果

    一次运行六张。整批返回所需的时间,大约相当于一个旗舰模型渲染所需的时间。

  3. 判断方向,而不是细节

    比较构图、色板和氛围。精细细节还不是你当前要评估的内容。

  4. 在其他地方重建胜出方案

    将表现有效的提示词带到更高上限的模型中,用于制作最终发布的版本。

如何编写 Z-Image Turbo 提示词

一个有用的 Z-Image Turbo 提示词通常包含三个要素:

  • 主体
  • 场景
  • 风格

与其这样写

黄金时刻,一名孤独的身影站在风吹拂的悬崖边,头发定格在运动瞬间,根根发丝捕捉到轮廓光,饱经风霜的羊毛大衣带有清晰可见的纤维纹理,远处有海鸟,体积感耶稣光,使用 85mm 镜头、f/1.4 拍摄。

不如这样写

日落时分,一个身影站在悬崖边,从背后观看,广角镜头。温暖的低角度光线。绘画感,柔和的色彩。

Z-Image Turbo 提示词示例

构图测试

一棵孤树立在除此之外空无一物的山坡上,从低角度仰视,背景是阴天的天空。 广角画面,树位于中心略偏右。 柔和的灰绿色调,摄影风格。

风格搜索

夜晚的城市街头市场。 扁平插画,限定四色色板,粗重黑色线条,无渐变。 摊位在画面中均匀分布,正面视角。

双语招牌

黄昏时分的一家小面馆门面,从街对面正面观看。 门上方的横向招牌写着 NORTHSIDE NOODLES,下方有 面馆,字号为其一半。 室内暖光溢出,潮湿路面反射着光,摄影风格处理。

Z-Image Turbo 与 Nano Banana Pro 对比

对比维度Z-Image TurboNano Banana Pro
参数60 亿旗舰级规模
推理步数8,可配置为 1标准流程
设计目标延迟输出上限
文本渲染英文和中文,短字符串长段落和多语言版式
参考处理单提示词驱动带角色的多图融合
适用位置探索和占位图最终素材、印刷、客户项目

从快速模型中获得更多效果的技巧

判断方向,而不是质量

你关注的是构图、色彩和情绪。细节不在考量范围内,也不应成为评估的一部分。

每组六张生成

有足够的变化让你看出模式,速度也足够快,让你根本不会考虑值不值得。

将提示词控制在四十个词以内

再往上,你描述的就是八步推理无法解决的事情了。

知道何时已超越这一阶段

一旦你开始反复运行来修正小细节,就该切换模型,而不是切换提示词。

Z-Image Turbo 常见问题

什么是 Z-Image Turbo?
Z-Image Turbo 是一个拥有 60 亿参数的文生图模型,基于单流扩散 Transformer 构建,并压缩为八步推理流程,以实现极低延迟。
为什么 Z-Image Turbo 如此快速?
标准扩散模型每张图像需要 20 到 50 个采样步骤。这个模型只需八步,并可配置低至一步,这使其能够在数据中心硬件上实现亚秒级生成。
Z-Image Turbo 免费吗,费用是多少?
它适用于 Virse 的付费套餐。生成会消耗每月额度,而不是按张收费;更高等级的套餐在合理使用范围内不计量。当前套餐价格列在 Virse 定价页面上。
Z-Image Turbo 能在图像中渲染文字吗?
可以,英文和中文都支持。它适合处理标识牌、标签等短文本,而不是长篇段落。
Z-Image Turbo 好用吗?
用于探索和批量生成的话,是的。它具备照片级真实感,并且以其规模而言能够很好地遵循指令,但它并非为在精细细节或复杂排版上与旗舰模型竞争而打造。
Z-Image Turbo 是开源的吗?
权重已公开发布。在 Virse 中,它作为托管模型运行,因此无需下载或配置任何内容。
我应该用什么来生成最终图像?
用于文字和身份一致性的 Nano Banana Pro,用于受品牌约束工作的 FLUX 2 Pro,或用于长篇多约束简报的 GPT Image 2。
如何在 Virse 中使用 Z-Image Turbo?
从模型列表中选择它,写一个简短提示词,然后生成。一次运行多个——速度正是重点。

以成组思维,而非单张思维

当渲染在你还没思考完之前就完成时,限制就不再是时间,而是你能有效查看多少结果。