GPT Image 2 AI 图像生成器

OpenAI 的 GPT Image 2.0 能读懂百字创作简报并尝试完成其中的所有要求,同时提供从 1K 到 4K 的独立质量和分辨率控制。

请在桌面端浏览器打开本页开始创作。

写出完整简报,并让它被准确遵循

GPT Image 2 是 OpenAI 的图像模型,其标志性表现是:长指令不会被平均化为一个笼统印象。

大多数模型会随着简报变长而退化。添加第五项要求,第二项就会悄悄消失;指定八个对象,结果只得到六个。GPT Image 2 旨在将多部分约束一起保持住,OpenAI 引述的指令遵循准确率约为 98%,并且它渲染文本时接近字符级精度,而不是近似字母形态。

当图片有具体要求而不只是氛围时,请使用 GPT Image 2。构建受监管的包装样稿、由规格驱动的产品图像、带注释的布局、多对象静物,以及任何审核者会根据清单检查输出结果的内容。

Write the Whole Brief and Have It Honoured

什么是 GPT Image 2.0?

GPT Image 2 是由 OpenAI 开发的 AI 图像生成模型,是 GPT Image 1.5 和 GPT Image 1 的继任者,也是 ChatGPT 中图像生成功能背后的模型。Virse 将其直接开放,并提供聊天界面所隐藏的质量和分辨率控制。

该模型围绕三大核心优势构建:

  • 多约束指令遵循,据称准确率约为 98%(percent)
  • 接近字符级精度的文本渲染
  • 在单一模型中提供独立的质量和分辨率控制

GPT Image 2 采用自回归架构,而不是大多数同类模型使用的扩散方法;OpenAI 称,这使其生成速度比上一版本快三到五倍。原生输出为 2K,并可提供 4K;宽高比范围从 3:1 到 1:3;渲染质量可在 Low、Medium 或 High 中选择,且与尺寸相互独立。

What Is GPT Image 2.0?

GPT Image 2 规格一览

原生 2K,可用 4K

标准输出为 2K,并提供 4K 用于印刷和大幅裁切。

三档质量等级

低、中、高三档,可与输出尺寸分开选择。

四种输出尺寸

1K、2K、3K 和 4K,每种尺寸都可用于所有质量等级。

~98% 指令遵循度

多部分创作简报返回时,各部分依然完整保留。

宽高比 3:1 至 1:3

同一份创作简报即可生成从宽幅全景到高挑竖版的画面。

自回归架构

一种不同于扩散模型的生成方式,据称可带来 3–5x 的速度提升。

GPT Image 2 AI 图像生成器的主要功能

Long Briefs Are Worth Writing

长创作简报值得撰写

由于该模型能够同时承载许多约束,你写下多少细节,就能得到多少细节。在这里,百字规格说明并不是白费力气,不像在那些会先概括你的意图再生成的模型上那样。

Quality and Size Move Independently

质量和尺寸可独立调整

两个控制项而非一个,意味着既可以生成大型草稿,也可以生成小型成品。大多数模型会把保真度与输出大小绑定在一起,让你无法将二者分开。

Near Character-Level Text

接近字符级的文本

标题、标签和标识会以可读的形式呈现,而不是近似模拟;这使它成为这里处理含有文字的图像时最强的模型之一。

Coherent Multi-Object Scenes

连贯的多对象场景

在多个物体必须正确关联的构图中——比如坐落在表面上、投下匹配的阴影、共享同一个光照方向——整体会保持一致,而不会偏离成物理上说不通的画面。

Reference Image Input

参考图像输入

将图片与提示词一起提供,模型就会以这些图片为依据进行创作,保留你指定的内容,并更改你要求修改的部分。

World Knowledge From the GPT Family

来自 GPT 系列的世界知识

该模型利用与其文本同类模型相同的底层知识,这体现在它无需从零描述也能处理真实物体、语境和惯例。

在 Virse 中使用 GPT Image 2 构建

带有固定要求的创作简报很少一开始就是完整成稿。它们通常由规格表、品牌指南、参考照片以及三轮反馈拼合而成。 Virse 会把这些素材放在输出旁边。创作简报、其来源参考,以及围绕它生成的每个版本都会保留在同一画布上,因此对照要求检查结果时,无需再打开第二个窗口。

将规格说明放在渲染图旁边

把需求清单放在画布上、紧挨着图像,这样审核就能对照源内容进行,而不是凭记忆判断。

Keep the Spec Beside the Render

低规格起稿,高规格交付

先在 Low 等级确定构图,待内容达成一致后,再用完全相同的简报以 Medium 或 High 重新运行。

Draft Low, Deliver High

访问 30+ 个创意模型

在 GPT Image 2 和其他 30 多个图像与视频模型之间切换,无需离开画布,也无需重写简报。

Access 30+ Creative Models

随着变化对创作简报进行版本管理

每一轮反馈都会在上一版旁边生成一个新版本,因此从初稿到获批素材的轨迹会完整保留。

Version a Brief as It Changes

你可以用 GPT Image 2 创作什么?

Spec-Driven Product Imagery

规格驱动的产品图像

必须在布局和表面处理上完全匹配书面规格说明的渲染图。

Packaging and Label Comps

包装和标签样稿

承载准确产品名称、描述语和法定必备文案的包装正面版式。

Annotated Diagrams

带注释的图表

标签必须正确而非仅作装饰的剖面图和解释性图形。

Multi-Object Still Life

多对象静物

每个物品的位置、比例和阴影都已被指定的摆放方案。

Interior and Architectural Views

室内与建筑视图

按照描述的平面方案搭建的空间,而不是近似的氛围。

Editorial Illustration

编辑插画

用于文章的概念图像,其中简报同时承载多个想法。

如何在 Virse 中使用 GPT Image 2

  1. 将质量设置为低

    在你还在决定画面应包含什么内容时,从最低档开始。

  2. 写出完整规格

    列出每个元素、其位置,以及任何必须精确如此的事项。在这里,篇幅长是优势。

  3. 对照你的清单检查输出

    逐项比较,而不是凭整体印象比较;然后为任何缺失内容添加相应条款。

  4. 按交付设置重新运行

    将已验证可用的简报提升到目标尺寸下的中等或高等质量,并保持内容不变。

如何编写 GPT Image 2 提示词

一个有用的 GPT Image 2 提示词通常包含五个要素:

  • 每个物体
  • 其位置
  • 光照
  • 相机
  • 图中文字

与其这样写

一个舒适的阅读角,温暖而迷人,拥有美丽的自然光。

不如这样写

一个嵌入凸窗的窗边座椅,覆以褪色的绿色天鹅绒,三只不成套的靠垫靠在左侧。一本精装书打开后正面朝下放在座椅上。傍晚阳光从右侧以低角度射入,将窗框的影子投在靠垫上。玻璃外是虚焦的花园。从两米外正面拍摄,座椅占据画面下方三分之二。

GPT Image 2 提示词示例

Interior Built to Spec

按规格打造的室内空间

一间狭窄的一字形厨房,从门口正面拍摄,视线与眼平齐。 左侧墙面是一排哑光鼠尾草绿色橱柜,配有黄铜杯形拉手。右侧为开放式搁架,上面单排摆放着六个白色陶瓷碗。尽头有一扇窗,百叶帘放下一半。 仅有来自窗户的阴天日光,无人工照明,阴影柔和。 地面为未上釉的赤陶瓷砖,以跑马式砌法铺设。

Multi-Object Still Life

多物体静物

四件物品摆放在一张风化橡木桌上,从上方45度角拍摄。 一个锡壶位于后方左侧,一块折叠的灰色亚麻布在其前方,三颗核桃散落在布的右侧,一个单独的梨放在前方右角。 每件物品投下的阴影都与来自左上方的单一光源一致。核桃之间略微分开,彼此没有接触。 色调柔和,对比克制,可见木纹从左向右延伸。

Label Comp With Exact Copy

带精确文案的标签合成图

一只长方形果酱罐,正面拍摄,背景为素净的奶油色。 正面标签上方三分之一处以窄衬线字体写着 ORCHARD ROW,下方以一半大小的斜体写着“Damson & Bay Leaf”,底部边缘以小型大写字母写着“227g”。 来自左前方的温暖均匀光线,在罐子右侧形成一道柔和阴影。 标签占据罐身高度中间的60%,两侧留白相等。

GPT Image 2 与 GPT Image 1.5 和 GPT Image 1 对比

对比维度GPT Image 1GPT Image 1.5GPT Image 2
质量控制无无低 / 中 / 高
分辨率控制无无1K / 2K / 3K / 4K
架构扩散时代扩散时代自回归
生成速度基准基准比前代快 3–5 倍
文字渲染近似改进接近字符级
仍然适合用于匹配现有素材集匹配现有素材集所有新工作

获得更佳 GPT Image 2 结果的技巧

写得比你觉得必要的更多

这是一种少见的模型:更长的简报会带来更好的图像。你省略的细节,就是模型替你决定的细节。

明确位置,而不只是列出对象

“左后方有一个水壶”是可执行的。“一个水壶”则把位置交给运气,而位置通常正是评审意见关注的内容。

逐字输入任何文本

应该出现在图像中的文字,必须出现在提示词中。被描述的文字会变成编造出来的文字。

在脑中将质量和尺寸分开考虑

质量会改变图像的渲染效果;尺寸会改变图像的大小。同时更改两者会让人无法判断是哪一个造成了差异。

GPT Image 2 常见问题

什么是 GPT Image 2.0?
GPT Image 2 是 OpenAI 的图像生成模型,是 GPT Image 1.5 和 GPT Image 1 的后继产品。它提供独立的质量设置和从 1K 到 4K 的分辨率,原生输出为 2K。
GPT Image 2 能生成 4K 图像吗?
可以,每个质量等级都支持。原生输出为 2K,并提供 4K 选项,适用于打印和大幅裁剪。
GPT Image 2 是免费的吗,费用是多少?
GPT Image 2 可在 Virse 的付费套餐中使用。生成会消耗每月信用额度,而不是按图像收费;更高级套餐在合理使用范围内不限量。当前套餐价格列在 Virse 定价页面上。
低、中、高设置有什么区别?
它们控制渲染保真度,而不是内容。同一个提示词在每个等级下都会生成同一幅图;高质量会呈现低质量中较模糊的精细细节、纹理和边缘。
GPT Image 2 与 GPT Image 1.5 有何不同?
GPT Image 2 更新,采用自回归架构,生成速度快三到五倍,并增加了早期版本没有的质量和分辨率控制。
GPT Image 2 能在图像中渲染文字吗?
可以,精度接近字符级。请在提示词中输入确切文字,而不是描述应出现哪些文字。
GPT Image 2 能基于参考图像工作吗?
可以。将图片与文字简报一起提供,模型会同时基于图片和文字生成。
如何在 Virse 中使用 GPT Image 2?
从模型列表中选择它,选择尺寸和质量等级,写下你的简报,然后生成。当内容尚未最终确定时,请从低质量等级开始。

先明确指定,再逐项核对

写下需求清单,把完整内容交给模型,然后根据清单而不是感觉来审核结果。