原生 2K,可用 4K
标准输出为 2K,并提供 4K 用于印刷和大幅裁切。
OpenAI 的 GPT Image 2.0 能读懂百字创作简报并尝试完成其中的所有要求,同时提供从 1K 到 4K 的独立质量和分辨率控制。
请在桌面端浏览器打开本页开始创作。
GPT Image 2 是 OpenAI 的图像模型,其标志性表现是:长指令不会被平均化为一个笼统印象。
大多数模型会随着简报变长而退化。添加第五项要求,第二项就会悄悄消失;指定八个对象,结果只得到六个。GPT Image 2 旨在将多部分约束一起保持住,OpenAI 引述的指令遵循准确率约为 98%,并且它渲染文本时接近字符级精度,而不是近似字母形态。
当图片有具体要求而不只是氛围时,请使用 GPT Image 2。构建受监管的包装样稿、由规格驱动的产品图像、带注释的布局、多对象静物,以及任何审核者会根据清单检查输出结果的内容。

GPT Image 2 是由 OpenAI 开发的 AI 图像生成模型,是 GPT Image 1.5 和 GPT Image 1 的继任者,也是 ChatGPT 中图像生成功能背后的模型。Virse 将其直接开放,并提供聊天界面所隐藏的质量和分辨率控制。
该模型围绕三大核心优势构建:
GPT Image 2 采用自回归架构,而不是大多数同类模型使用的扩散方法;OpenAI 称,这使其生成速度比上一版本快三到五倍。原生输出为 2K,并可提供 4K;宽高比范围从 3:1 到 1:3;渲染质量可在 Low、Medium 或 High 中选择,且与尺寸相互独立。

标准输出为 2K,并提供 4K 用于印刷和大幅裁切。
低、中、高三档,可与输出尺寸分开选择。
1K、2K、3K 和 4K,每种尺寸都可用于所有质量等级。
多部分创作简报返回时,各部分依然完整保留。
同一份创作简报即可生成从宽幅全景到高挑竖版的画面。
一种不同于扩散模型的生成方式,据称可带来 3–5x 的速度提升。

由于该模型能够同时承载许多约束,你写下多少细节,就能得到多少细节。在这里,百字规格说明并不是白费力气,不像在那些会先概括你的意图再生成的模型上那样。

两个控制项而非一个,意味着既可以生成大型草稿,也可以生成小型成品。大多数模型会把保真度与输出大小绑定在一起,让你无法将二者分开。

标题、标签和标识会以可读的形式呈现,而不是近似模拟;这使它成为这里处理含有文字的图像时最强的模型之一。

在多个物体必须正确关联的构图中——比如坐落在表面上、投下匹配的阴影、共享同一个光照方向——整体会保持一致,而不会偏离成物理上说不通的画面。

将图片与提示词一起提供,模型就会以这些图片为依据进行创作,保留你指定的内容,并更改你要求修改的部分。

该模型利用与其文本同类模型相同的底层知识,这体现在它无需从零描述也能处理真实物体、语境和惯例。
带有固定要求的创作简报很少一开始就是完整成稿。它们通常由规格表、品牌指南、参考照片以及三轮反馈拼合而成。 Virse 会把这些素材放在输出旁边。创作简报、其来源参考,以及围绕它生成的每个版本都会保留在同一画布上,因此对照要求检查结果时,无需再打开第二个窗口。
把需求清单放在画布上、紧挨着图像,这样审核就能对照源内容进行,而不是凭记忆判断。

先在 Low 等级确定构图,待内容达成一致后,再用完全相同的简报以 Medium 或 High 重新运行。

在 GPT Image 2 和其他 30 多个图像与视频模型之间切换,无需离开画布,也无需重写简报。

每一轮反馈都会在上一版旁边生成一个新版本,因此从初稿到获批素材的轨迹会完整保留。


必须在布局和表面处理上完全匹配书面规格说明的渲染图。

承载准确产品名称、描述语和法定必备文案的包装正面版式。

标签必须正确而非仅作装饰的剖面图和解释性图形。

每个物品的位置、比例和阴影都已被指定的摆放方案。

按照描述的平面方案搭建的空间,而不是近似的氛围。

用于文章的概念图像,其中简报同时承载多个想法。
在你还在决定画面应包含什么内容时,从最低档开始。
列出每个元素、其位置,以及任何必须精确如此的事项。在这里,篇幅长是优势。
逐项比较,而不是凭整体印象比较;然后为任何缺失内容添加相应条款。
将已验证可用的简报提升到目标尺寸下的中等或高等质量,并保持内容不变。
一个有用的 GPT Image 2 提示词通常包含五个要素:
与其这样写
一个舒适的阅读角,温暖而迷人,拥有美丽的自然光。
不如这样写
一个嵌入凸窗的窗边座椅,覆以褪色的绿色天鹅绒,三只不成套的靠垫靠在左侧。一本精装书打开后正面朝下放在座椅上。傍晚阳光从右侧以低角度射入,将窗框的影子投在靠垫上。玻璃外是虚焦的花园。从两米外正面拍摄,座椅占据画面下方三分之二。

一间狭窄的一字形厨房,从门口正面拍摄,视线与眼平齐。 左侧墙面是一排哑光鼠尾草绿色橱柜,配有黄铜杯形拉手。右侧为开放式搁架,上面单排摆放着六个白色陶瓷碗。尽头有一扇窗,百叶帘放下一半。 仅有来自窗户的阴天日光,无人工照明,阴影柔和。 地面为未上釉的赤陶瓷砖,以跑马式砌法铺设。

四件物品摆放在一张风化橡木桌上,从上方45度角拍摄。 一个锡壶位于后方左侧,一块折叠的灰色亚麻布在其前方,三颗核桃散落在布的右侧,一个单独的梨放在前方右角。 每件物品投下的阴影都与来自左上方的单一光源一致。核桃之间略微分开,彼此没有接触。 色调柔和,对比克制,可见木纹从左向右延伸。

一只长方形果酱罐,正面拍摄,背景为素净的奶油色。 正面标签上方三分之一处以窄衬线字体写着 ORCHARD ROW,下方以一半大小的斜体写着“Damson & Bay Leaf”,底部边缘以小型大写字母写着“227g”。 来自左前方的温暖均匀光线,在罐子右侧形成一道柔和阴影。 标签占据罐身高度中间的60%,两侧留白相等。
| 对比维度 | GPT Image 1 | GPT Image 1.5 | GPT Image 2 |
|---|---|---|---|
| 质量控制 | 无 | 无 | 低 / 中 / 高 |
| 分辨率控制 | 无 | 无 | 1K / 2K / 3K / 4K |
| 架构 | 扩散时代 | 扩散时代 | 自回归 |
| 生成速度 | 基准 | 基准 | 比前代快 3–5 倍 |
| 文字渲染 | 近似 | 改进 | 接近字符级 |
| 仍然适合用于 | 匹配现有素材集 | 匹配现有素材集 | 所有新工作 |
这是一种少见的模型:更长的简报会带来更好的图像。你省略的细节,就是模型替你决定的细节。
“左后方有一个水壶”是可执行的。“一个水壶”则把位置交给运气,而位置通常正是评审意见关注的内容。
应该出现在图像中的文字,必须出现在提示词中。被描述的文字会变成编造出来的文字。
质量会改变图像的渲染效果;尺寸会改变图像的大小。同时更改两者会让人无法判断是哪一个造成了差异。