2K nativo, 4K disponible
Salida estándar a 2K, con 4K disponible para impresión y recortes grandes.
GPT Image 2.0 de OpenAI lee un briefing de cien palabras e intenta cumplirlo por completo, con controles independientes de calidad y resolución de 1K a 4K.
Abre esta página en un navegador de escritorio para empezar a crear.
GPT Image 2 es el modelo de imagen de OpenAI, y su comportamiento definitorio es que una instrucción larga no se promedia en una impresión general.
La mayoría de los modelos se degradan a medida que un briefing se alarga. Añade un quinto requisito y el segundo desaparece silenciosamente; especifica ocho objetos y obtienes seis. GPT Image 2 se creó para mantener unidas restricciones de varias partes, con OpenAI citando una precisión en el seguimiento de instrucciones de alrededor del 98 por ciento, y renderiza texto con una precisión cercana al nivel de carácter en lugar de aproximar las formas de las letras.
Usa GPT Image 2 cuando la imagen tenga requisitos en lugar de una sensación general. Crea composiciones de embalajes regulados, imágenes de producto basadas en especificaciones, diseños anotados, bodegones con múltiples objetos y cualquier cosa en la que un revisor vaya a comprobar el resultado frente a una lista.

GPT Image 2 es un modelo de generación de imágenes con IA desarrollado por OpenAI, el sucesor de GPT Image 1.5 y GPT Image 1, y el modelo detrás de la generación de imágenes en ChatGPT. Virse lo expone directamente, con los controles de calidad y resolución que la interfaz de chat mantiene ocultos.
El modelo se basa en tres grandes fortalezas:
GPT Image 2 funciona con una arquitectura autorregresiva en lugar del enfoque de difusión que utiliza la mayoría de sus homólogos, algo a lo que OpenAI atribuye una generación entre tres y cinco veces más rápida que la versión anterior. La salida nativa es 2K, con 4K disponible; las relaciones de aspecto van de 3:1 a 1:3, y la calidad de renderizado se puede seleccionar entre Baja, Media o Alta, independientemente del tamaño.

Salida estándar a 2K, con 4K disponible para impresión y recortes grandes.
Baja, media y alta, elegidas por separado del tamaño de salida.
1K, 2K, 3K y 4K, cada una disponible en todos los grados de calidad.
Los briefings con varias partes se devuelven con las partes intactas.
Desde panorámicas amplias hasta formatos verticales altos a partir del mismo briefing.
Un enfoque de generación diferente al de la difusión, al que se atribuye una mejora de velocidad de 3–5x.

Como el modelo mantiene muchas restricciones a la vez, el detalle que escribes es el detalle que obtienes. Una especificación de cien palabras no es aquí un esfuerzo desperdiciado como lo es en modelos que resumen tu intención antes de generar.

Dos controles en lugar de uno significan que son posibles tanto un borrador grande como un resultado final pequeño. La mayoría de los modelos vinculan la fidelidad al tamaño de salida y no te dejan forma de separarlos.

Los titulares, las etiquetas y la señalización vuelven legibles en lugar de aproximados, lo que sitúa a este entre los modelos más potentes aquí para imágenes que contienen palabras.

Las composiciones en las que varios objetos deben relacionarse correctamente — sentados sobre superficies, proyectando sombras coincidentes, compartiendo una misma dirección de luz — se mantienen coherentes en lugar de derivar hacia sinsentidos físicos.

Proporciona imágenes junto con el prompt y el modelo trabaja a partir de ellas, conservando lo que nombras y cambiando lo que pides.

El modelo se basa en el mismo conocimiento subyacente que sus hermanos de texto, lo que se nota en cómo maneja objetos, contextos y convenciones reales sin que haya que describirlos desde cero.
Los briefings con requisitos fijos rara vez llegan terminados. Se ensamblan a partir de una hoja de especificaciones, una guía de marca, una foto de referencia y tres rondas de comentarios. Virse mantiene ese material junto al resultado. El briefing, las referencias de las que procede y cada generación basada en él permanecen en un único lienzo, de modo que comprobar un resultado frente a sus requisitos no implica abrir una segunda ventana.
Coloca la lista de requisitos en el lienzo junto a la imagen para que la revisión se haga contra la fuente en lugar de depender de la memoria.

Fija la composición en el grado Low y luego vuelve a ejecutar el mismo briefing en Medium o High una vez acordado el contenido.

Muévete entre GPT Image 2 y más de 30 otros modelos de imagen y vídeo sin salir del lienzo ni reescribir el briefing.

Cada ronda de feedback produce una nueva generación junto a la anterior, de modo que el recorrido desde el primer borrador hasta el activo aprobado permanece intacto.


Renderizados que deben ajustarse a una especificación escrita hasta el detalle de la disposición y el acabado.

Diseños de frontal de envase con nombres exactos de producto, descriptores y textos legalmente requeridos.

Secciones transversales y gráficos explicativos cuyas etiquetas tienen que ser correctas, no decorativas.

Disposiciones en las que se especifican la posición, la escala y la sombra de cada elemento.

Espacios construidos según un plan descrito en lugar de un ambiente aproximado.

Imágenes conceptuales para artículos en los que el briefing contiene varias ideas a la vez.
Empieza con el grado más bajo mientras aún decides qué debe contener la imagen.
Enumera cada elemento, su posición y cualquier cosa que deba ser exactamente así. La longitud es una ventaja aquí.
Compara elemento por elemento en lugar de por impresión general, y luego añade la cláusula para cualquier cosa que falte.
Lleva el briefing de trabajo a Medio o Alto en tu tamaño objetivo, sin cambios.
Un prompt útil de GPT Image 2 suele incluir cinco elementos:
En lugar de escribir
Un rincón de lectura acogedor, cálido e invitador, con una hermosa luz natural.
Escribe
Un asiento de ventana integrado en una ventana saliente, tapizado en terciopelo verde descolorido, con tres cojines desparejados apoyados contra el lado izquierdo. Un libro de tapa dura yace abierto boca abajo sobre el asiento. El sol de última hora de la tarde entra desde la derecha en un ángulo bajo, proyectando la sombra del marco de la ventana sobre los cojines. Más allá del cristal, un jardín desenfocado. Toma frontal desde dos metros de distancia, con el asiento ocupando los dos tercios inferiores del encuadre.

Una cocina estrecha tipo pasillo fotografiada desde el umbral, de frente, a la altura de los ojos. Muebles en verde salvia mate con tiradores de concha de latón a lo largo de la pared izquierda. Estanterías abiertas a la derecha con seis cuencos de cerámica blanca en una sola fila. Una ventana al fondo con el estor bajado hasta la mitad. Luz diurna nublada procedente únicamente de la ventana, sin luz artificial, sombras suaves. El suelo es de baldosas de terracota sin esmaltar colocadas en un patrón a matajuntas.

Cuatro objetos dispuestos sobre una mesa de roble envejecido, fotografiados desde 45 grados por encima. Una jarra de peltre al fondo a la izquierda, un paño de lino gris doblado delante de ella, tres nueces dispersas a la derecha del paño y una sola pera en la esquina delantera derecha. Cada objeto proyecta una sombra coherente con una única fuente de luz desde la parte superior izquierda. Las nueces están ligeramente separadas, sin tocarse entre sí. Paleta apagada, contraste contenido, veta de la madera visible de izquierda a derecha.

Un tarro rectangular de conservas fotografiado de frente contra un fondo liso de color crema. La etiqueta frontal dice ORCHARD ROW en una serif estrecha en el tercio superior, con "Damson & Bay Leaf" debajo en cursiva a la mitad del tamaño, y "227g" en versalitas en el borde inferior. Luz cálida y uniforme desde el frente izquierdo, una sombra suave a la derecha del tarro. La etiqueta ocupa el 60 por ciento central de la altura del tarro, con márgenes iguales a ambos lados.
| Dimensión | GPT Image 1 | GPT Image 1.5 | GPT Image 2 |
|---|---|---|---|
| Control de calidad | Ninguno | Ninguno | Baja / Media / Alta |
| Control de resolución | Ninguno | Ninguno | 1K / 2K / 3K / 4K |
| Arquitectura | De la era de la difusión | De la era de la difusión | Autoregresiva |
| Velocidad de generación | Base | Base | 3–5x más rápido que su predecesor |
| Renderización de texto | Aproximado | Mejorado | Casi a nivel de carácter |
| Aún merece la pena usarlo para | Igualar un conjunto de recursos existente | Igualar un conjunto de recursos existente | Todo el trabajo nuevo |
Este es el raro modelo en el que un briefing más largo devuelve una imagen mejor. El detalle que omites es detalle que el modelo elige por ti.
"Una jarra al fondo a la izquierda" es accionable. "Una jarra" deja la ubicación al azar, y la ubicación suele ser aquello sobre lo que tratan los comentarios de revisión.
Las palabras que deben aparecer en la imagen tienen que aparecer en el prompt. El texto descrito se convierte en texto inventado.
La calidad cambia lo bien que se renderiza la imagen; el tamaño cambia lo grande que es. Cambiar ambos a la vez hace imposible saber cuál produjo la diferencia.
Escribe la lista de requisitos, entrégala completa y revisa el resultado comparándolo con la lista, no con una sensación.