lunes, 3 de agosto de 2026

IA y modelos

Google lanza Gemini Omni para simular la realidad con IA multimodal

Google lanzó Gemini Omni, una nueva familia de modelos multimodales capaz de crear video a partir de diversas entradas, comenzando hoy con el despliegue de Gemini Omni Flash.

Google launches Gemini Omni to simulate reality with multimodal AI
Foto: Google

Google lanzó Gemini Omni, una nueva familia de modelos multimodales diseñada para crear contenido a partir de cualquier entrada. El primer modelo de la familia, Gemini Omni Flash, se lanza hoy en la aplicación Gemini, YouTube Shorts y el estudio creativo de IA Flow. El lanzamiento representa un cambio estratégico para la empresa, que anunció Gemini por primera vez hace tres años. El CEO de Google, Sundar Pichai, explicó que cuando se anunció Gemini por primera vez, el objetivo era construir un modelo nativamente multimodal entrenado con texto, código, audio, imágenes y video para darle una comprensión más profunda del mundo. Pichai señaló que, con los modelos mundiales, la IA está pasando de predecir texto a simular la realidad, y Gemini Omni representa el siguiente paso en esa dirección.

El modelo Gemini Omni Flash es capaz de renderizar 10 segundos de video. Nicole Brichtova, directora de gestión de productos de Google DeepMind, describió esta limitación como una elección estratégica para la accesibilidad del consumidor en lugar de una restricción técnica, señalando que la empresa quería poner la herramienta en más manos. Google posiciona a Omni Flash principalmente como una herramienta para el consumidor. Gabe Barth-Maron, ingeniero de investigación en DeepMind, describió los resultados diciendo: “Son como memes personalizados”. Brichtova explicó que el lanzamiento representa el siguiente paso para combinar la inteligencia de Gemini con las capacidades de renderizado de los modelos de medios de la empresa, distinguiendo a Omni del modelo de video existente de Google, Veo.

Google planea hacer que Omni esté disponible a través de una API en las próximas semanas. La tecnología permite a los usuarios generar videos usando sus propios avatares digitales. Sin embargo, para prevenir deepfakes, los usuarios deberán pasar por un proceso de incorporación dedicado. Este proceso requiere que los usuarios se graben a sí mismos y digan una serie de números antes de que el avatar sea almacenado. Además, todos los videos creados con Omni incluirán la marca de agua digital SynthID de Google para verificar si fueron generados a través de productos de Gemini. El lanzamiento se produce mientras competidores como Luma AI construyen herramientas de agentes similares. Durante una sesión informativa para medios el lunes, los ejecutivos de Google detallaron la visión estratégica detrás del lanzamiento, enfatizando la transición de la simple predicción de texto a la simulación de la realidad.

Por qué importa

El lanzamiento de Gemini Omni por parte de Google representa un paso concreto hacia el objetivo de la empresa de construir un modelo de lenguaje grande multimodal que pueda razonar a través de texto, imagen, audio y video para simular la realidad.