Con Gemini Omni, Google no sólo lanza una nueva generación de modelos de IA. El gigante americano también está transformando Gemini en un taller creativo multimodal, capaz de comprender una intención, una imagen, un vídeo, una banda sonora o una instrucción textual, para luego producir o modificar una escena de vídeo con una continuidad mucho más fina que antes.
Google presenta Omni como el punto de encuentro entre “ La capacidad de razonar de Géminis » y « La capacidad de Veo para crear. «. El primer modelo de esta nueva familia, Gemini Omni Flash, se describe como capaz de “ cree cualquier cosa a partir de cualquier entrada, empezando por el vídeo «. Mucho más que un modelo multimodal capaz de generar vídeo, Omni comprende una escena, la manipula y la hace evolucionar.
No es un Gemini 3.5 con cámara
Gemini 3.5 son LLM multimodales con capacidad de razonamiento y codificación, agentes y ejecución de flujo de trabajo. Están diseñados para comprender, planificar, automatizar y orquestar. En primer lugar, son modelos diseñados para producir texto.
Gemini Omni está diseñado para crear, transformar y editar todo tipo de medios, incluso si esta primera generación se dirige principalmente a la producción de vídeo.
En otras palabras, Gemini 3.x es el motor agente, Gemini Omni es un motor de preparación. Mientras que Gemini 3.5 Flash ayuda a ejecutar tareas complejas, Omni ayuda a crear una secuencia visual coherente. También reemplaza a Veo en la aplicación Gemini, una señal de que Google ya no quiere separar la IA conversacional y la IA de vídeo.
Omni obviamente conserva la herencia de Veo: generación de video, realismo, movimiento, audio nativo. Pero añade la lógica de Géminis: multimodalidad, comprensión del contexto, edición conversacional y capacidad de acumular instrucciones sin empezar de cero.
<
El aporte de los “Modelos Mundiales”
Técnicamente, lo que diferencia a Gemini Omni de los modelos Gemini anteriores es que incorpora algunas tecnologías exploradas por los «Modelos Mundiales». Investigadores como Yann Le Cun no creen en el futuro de los LLM puros porque, aunque dominan el idioma, no comprenden el mundo que nos rodea. El ex investigador de Meta creó recientemente su propia startup AMI Labs para explorar el potencial de World Models.
Tenga en cuenta que Google no dice que Omni sea un modelo mundial en sentido estricto. Pero el modelo claramente retoma varios conceptos que forman sus fundamentos: comprensión espacial, coherencia temporal, física intuitiva, memoria de escenas, capacidad de anticipar lo que lógicamente debe suceder.
Son estas capacidades las que permiten a Gemini Omni producir secuencias más creíbles: un reflejo debe permanecer coherente, un objeto debe seguir una trayectoria plausible, un gesto debe secuenciarse correctamente, una transformación no debe alterar toda la escena. Mientras que los antiguos modelos de vídeo sabían generar hermosas imágenes animadas, Omni busca más entender la escena como un pequeño mundo que mantener.
El vídeo se vuelve editable mediante diálogo.
Aquí es donde Gemini Omni supera a los modelos de generación de vídeo anteriores. Google explica que cada instrucción puede “basarse en la anterior”. Por lo tanto, el usuario puede partir de un vídeo existente, solicitar una modificación, luego otra, luego otra, conservando los personajes, la atmósfera, la escena y la coherencia general.
Puedes pedir cambiar la iluminación, añadir un objeto, transformar un escenario, modificar una acción, sincronizar un movimiento con música o utilizar un boceto como guía visual. Tantas operaciones que seguían siendo muy dolorosas con los antiguos modelos de vídeo: a menudo era necesario regenerar una secuencia completa para corregir un detalle. Con Omni, el vídeo se convierte en material fácilmente editable.
Un despliegue ya estratégico
Gemini Omni Flash se implementa hoy en la aplicación Gemini y Google Flow (la herramienta de edición de video con IA) para los suscriptores de Google AI Plus, Pro y Ultra.
Al integrar este modelo de esta manera, es posible utilizar Gemini como herramienta de edición de video sin tener que hacer malabarismos con los modelos.
Google también planea su llegada a YouTube Shorts Remix y YouTube Create, con acceso gratuito a determinadas funciones. Las API para desarrolladores y empresas seguirán más adelante.
Del lado francés, tendremos que tener un poco de paciencia. Google especifica que el acceso a su modelo está reservado a mayores de 18 años, y que las funciones varían según el país y la oferta. Por lo tanto, algunas funciones como los avatares o la edición de vídeo a vídeo aún no están disponibles en Europa (y por tanto en Francia).
Con Omni, Google no sólo lanza un nuevo modelo de vídeo. El editor prepara un giro: el de un vídeo con IA que ya no solo generamos, sino que dirigimos, corregimos y reinventamos a través de la conversación.
<
____________________________
Lea también:
Google I/O 2026: Gemini Flash 3.5 supera a Gemini Pro 3.1
Google reinventa la Búsqueda de Google en modo agente
Gemini Spark: la respuesta de Google a OpenClaw y Claude Cowork
Google I/O '25: VEO 3, Imagen 4, Lyria 2… ¡IA más creativa que nunca!
[



