lunes, 3 de agosto de 2026

IA y modelos

OpenAI lanza ChatGPT Images 2.0 con renderizado de texto mejorado

OpenAI lanzó ChatGPT Images 2.0, un nuevo modelo que presenta un renderizado de texto mejorado, resolución de hasta 2K y "capacidades de pensamiento" para tareas complejas de generación de imágenes.

OpenAI launches ChatGPT Images 2.0 with improved text rendering
Foto: OpenAI press kit

OpenAI ha lanzado ChatGPT Images 2.0, un modelo que mejora significativamente el renderizado de texto y elementos detallados como la iconografía y los componentes de interfaz de usuario (UI). Históricamente, los generadores de imágenes han tenido dificultades con la ortografía, produciendo a menudo texto ilegible. El nuevo modelo aborda esto generando texto de manera efectiva dentro de las imágenes, como la creación de un menú de restaurante que enumera ceviche con un precio de USD 13.50 sin los errores ortográficos típicos de modelos anteriores como DALL-E 3. Además, el modelo muestra un progreso marcado en el manejo de texto no latino, específicamente en japonés, coreano, hindi y bengalí.

En un comunicado de prensa, OpenAI declaró: “Images 2.0 aporta un nivel de especificidad y fidelidad sin precedentes a la creación de imágenes. No solo puede conceptualizar imágenes más sofisticadas, sino que realmente da vida a esa visión de manera efectiva, capaz de seguir instrucciones, preservar los detalles solicitados y renderizar los elementos detallados que a menudo rompen los modelos de imagen: texto pequeño, iconografía, elementos de UI, composiciones densas y restricciones estilísticas sutiles, todo a una resolución de hasta 2K”. El modelo introduce lo que OpenAI llama “capacidades de pensamiento”, que según la empresa permiten al sistema buscar en la web, generar múltiples imágenes a partir de un solo prompt y verificar sus propias creaciones. Sin embargo, los usuarios deben tener en cuenta que el corte de conocimiento del modelo (la fecha después de la cual el modelo no tiene datos de entrenamiento) es diciembre de 2025.

Históricamente, los generadores de imágenes por inteligencia artificial (IA) han tenido dificultades para escribir correctamente porque generalmente utilizaban modelos de difusión, que son modelos de IA que reconstruyen imágenes a partir de ruido. “Los modelos de difusión […] están reconstruyendo una entrada dada”, dijo a TechCrunch en 2024 Asmelash Teka Hadgu, fundador y CEO de Lesan AI. “Podemos asumir que las escrituras en una imagen son una parte muy, muy pequeña, por lo que el generador de imágenes aprende los patrones que cubren más de estos píxeles”. Aunque los investigadores han explorado otros mecanismos como los modelos autorregresivos, OpenAI se negó a responder qué tipo de modelo impulsa a ChatGPT Images 2.0.

El acceso al nuevo modelo comienza el martes para todos los usuarios de ChatGPT y Codex, con niveles de pago que ofrecen resultados más avanzados. OpenAI también está lanzando la API gpt-image-2 para desarrolladores, con precios que dependen de la calidad y resolución de los resultados.

Por qué importa

El lanzamiento de ChatGPT Images 2.0 marca una mejora significativa en la generación de imágenes por IA, específicamente en la capacidad de renderizar texto y elementos detallados como la iconografía y los elementos de UI, que históricamente han sido difíciles para los modelos basados en difusión.