八步推理
以八个采样步骤渲染,并可配置为低至一步。
请在桌面端浏览器打开本页开始创作。
Z-Image Turbo 的构建围绕一个决策展开:将推理压缩到八步,而不是标准扩散模型所需的二十到五十步,并看看还能保留多少质量。
事实证明,相当多。其公开的优势包括照片级真实感输出、英中双语文本渲染,以及对指令的遵循——这些都不是你会预期一个如此小巧、如此快速的模型所擅长的。它牺牲的是上限,而不是能力。
在工作前期使用 Z-Image Turbo。探索视觉方向,测试一个想法是否能被理解,用占位图填充版面,并生成真正充分思考所实际需要的大量可丢弃图像。

Z-Image Turbo 是一个拥有 60 亿参数的文本到图像模型。其架构是单流扩散 Transformer,其中的文本 token、语义 token 和图像 token 共享同一个 Transformer,而不是在不同分支中分别处理。
该模型围绕三大核心优势构建:
步数可配置低至一步,并且在数据中心硬件上可实现亚秒级延迟。权重已公开发布,不过在 Virse 中,它作为托管模型运行,无需安装任何内容。

以八个采样步骤渲染,并可配置为低至一步。
可在数据中心硬件上实现,这正是整个设计所针对的目标。
刻意做小,而速度正来源于此。
文本、语义和图像 token 共用一个 transformer,而不是分开的分支。
将英文和中文文字作为语言来处理,而不是作为装饰。
真实感渲染,而不是风格化的固定视觉。
用八步对比通常的二十到五十步,这不是调参微调,而是架构本身。这个模型的其他一切,都源于一个决定:让每次渲染都在你思路中断之前完成。
六十亿参数只是旗舰模型所拥有参数量的一小部分,但它仍能保持照片级真实感和对指令的遵循。这种取舍体现为上限空间,而不是基本能力。
英文和中文文本都能渲染成可读语言。在快速模型中,这一点已足够少见;当版式需要任一文字的标签时,它就很重要。
当一次渲染用时不到一秒时,生成一组六张图就是一次决策,而不是六次决策。
你在这里喜欢的构图可以直接作为参考交给更重的图像模型,或作为开场帧交给视频模型,而无需离开画布。
该模型以开放方式发布,但在 Virse 中它作为托管服务运行,无需配置任何环境。
快速模型的价值,取决于它下游承接的内容。单独来看,它只是一个新奇事物;作为流程的第一阶段,它会改变后续一切的经济成本。 Virse 让这种交接变得直接。在这里生成的结果,可以成为旗舰模型的参考,或成为视频模型的开场帧,而无需导出、重命名再重新上传。
在旗舰模型生成两张图所需的时间里生成三十个方向,然后只把真正的精力花在留下来的方案上。
将效果不错的构图作为参考图像,直接送入同一画布上的更重模型。
在 Z-Image Turbo 和 30 多个其他图像与视频模型之间切换,无需离开画布或重写简报。
被否掉的方向会与选中的方案并排保留,而多数第二轮想法正是从这里产生的。
适用于项目初期的大范围视觉探索,此时方向数量比任何单一方案的完成度更重要。
在一次工作中搭建出一块连贯的情绪板,而不是从搜索结果里拼凑一个。
在任何人决定真实图像应是什么之前,先用大致合适的图像填充设计稿。
先弄清楚什么措辞会产生什么结果,再把时间花在较慢的模型上验证。
以低成本迭代视频模型的起始画面。
适用于每张图只需合理而不必卓越的发布节奏。
说明主体、场景和处理方式。在这样的速度下,长篇需求说明没有意义。
一次运行六张。整批返回所需的时间,大约相当于一个旗舰模型渲染所需的时间。
比较构图、色板和氛围。精细细节还不是你当前要评估的内容。
将表现有效的提示词带到更高上限的模型中,用于制作最终发布的版本。
一个有用的 Z-Image Turbo 提示词通常包含三个要素:
与其这样写
黄金时刻,一名孤独的身影站在风吹拂的悬崖边,头发定格在运动瞬间,根根发丝捕捉到轮廓光,饱经风霜的羊毛大衣带有清晰可见的纤维纹理,远处有海鸟,体积感耶稣光,使用 85mm 镜头、f/1.4 拍摄。
不如这样写
日落时分,一个身影站在悬崖边,从背后观看,广角镜头。温暖的低角度光线。绘画感,柔和的色彩。
| 对比维度 | Z-Image Turbo | Nano Banana Pro |
|---|---|---|
| 参数 | 60 亿 | 旗舰级规模 |
| 推理步数 | 8,可配置为 1 | 标准流程 |
| 设计目标 | 延迟 | 输出上限 |
| 文本渲染 | 英文和中文,短字符串 | 长段落和多语言版式 |
| 参考处理 | 单提示词驱动 | 带角色的多图融合 |
| 适用位置 | 探索和占位图 | 最终素材、印刷、客户项目 |
你关注的是构图、色彩和情绪。细节不在考量范围内,也不应成为评估的一部分。
有足够的变化让你看出模式,速度也足够快,让你根本不会考虑值不值得。
再往上,你描述的就是八步推理无法解决的事情了。
一旦你开始反复运行来修正小细节,就该切换模型,而不是切换提示词。