Aplicaciones

Con Gemini Omni, la aplicación Gemini se convierte en un verdadero estudio de vídeo

Con Gemini Omni, Google no sólo lanza una nueva generación de modelos de IA. El gigante americano también está transformando Gemini en un taller creativo multimodal, capaz de comprender una intención, una imagen, un vídeo, una banda sonora o una instrucción textual, para luego producir o modificar una escena de vídeo con una continuidad mucho más fina que antes.

Google presenta Omni como el punto de encuentro entre “ La capacidad de razonar de Géminis » y « La capacidad de Veo para crear. «. El primer modelo de esta nueva familia, Gemini Omni Flash, se describe como capaz de “ cree cualquier cosa a partir de cualquier entrada, empezando por el vídeo «. Mucho más que un modelo multimodal capaz de generar vídeo, Omni comprende una escena, la manipula y la hace evolucionar.

No es un Gemini 3.5 con cámara

Gemini 3.5 son LLM multimodales con capacidad de razonamiento y codificación, agentes y ejecución de flujo de trabajo. Están diseñados para comprender, planificar, automatizar y orquestar. En primer lugar, son modelos diseñados para producir texto.

Gemini Omni está diseñado para crear, transformar y editar todo tipo de medios, incluso si esta primera generación se dirige principalmente a la producción de vídeo.

En otras palabras, Gemini 3.x es el motor agente, Gemini Omni es un motor de preparación. Mientras que Gemini 3.5 Flash ayuda a ejecutar tareas complejas, Omni ayuda a crear una secuencia visual coherente. También reemplaza a Veo en la aplicación Gemini, una señal de que Google ya no quiere separar la IA conversacional y la IA de vídeo.

Omni obviamente conserva la herencia de Veo: generación de video, realismo, movimiento, audio nativo. Pero añade la lógica de Géminis: multimodalidad, comprensión del contexto, edición conversacional y capacidad de acumular instrucciones sin empezar de cero.

<

El aporte de los “Modelos Mundiales”

Técnicamente, lo que diferencia a Gemini Omni de los modelos Gemini anteriores es que incorpora algunas tecnologías exploradas por los «Modelos Mundiales». Investigadores como Yann Le Cun no creen en el futuro de los LLM puros porque, aunque dominan el idioma, no comprenden el mundo que nos rodea. El ex investigador de Meta creó recientemente su propia startup AMI Labs para explorar el potencial de World Models.

Tenga en cuenta que Google no dice que Omni sea un modelo mundial en sentido estricto. Pero el modelo claramente retoma varios conceptos que forman sus fundamentos: comprensión espacial, coherencia temporal, física intuitiva, memoria de escenas, capacidad de anticipar lo que lógicamente debe suceder.

Son estas capacidades las que permiten a Gemini Omni producir secuencias más creíbles: un reflejo debe permanecer coherente, un objeto debe seguir una trayectoria plausible, un gesto debe secuenciarse correctamente, una transformación no debe alterar toda la escena. Mientras que los antiguos modelos de vídeo sabían generar hermosas imágenes animadas, Omni busca más entender la escena como un pequeño mundo que mantener.

Omni physiqueOmni physique

El vídeo se vuelve editable mediante diálogo.

Aquí es donde Gemini Omni supera a los modelos de generación de vídeo anteriores. Google explica que cada instrucción puede “basarse en la anterior”. Por lo tanto, el usuario puede partir de un vídeo existente, solicitar una modificación, luego otra, luego otra, conservando los personajes, la atmósfera, la escena y la coherencia general.

Puedes pedir cambiar la iluminación, añadir un objeto, transformar un escenario, modificar una acción, sincronizar un movimiento con música o utilizar un boceto como guía visual. Tantas operaciones que seguían siendo muy dolorosas con los antiguos modelos de vídeo: a menudo era necesario regenerar una secuencia completa para corregir un detalle. Con Omni, el vídeo se convierte en material fácilmente editable.

gemini omnigemini omni

Un despliegue ya estratégico

Gemini Omni Flash se implementa hoy en la aplicación Gemini y Google Flow (la herramienta de edición de video con IA) para los suscriptores de Google AI Plus, Pro y Ultra.
Al integrar este modelo de esta manera, es posible utilizar Gemini como herramienta de edición de video sin tener que hacer malabarismos con los modelos.
Google también planea su llegada a YouTube Shorts Remix y YouTube Create, con acceso gratuito a determinadas funciones. Las API para desarrolladores y empresas seguirán más adelante.

Del lado francés, tendremos que tener un poco de paciencia. Google especifica que el acceso a su modelo está reservado a mayores de 18 años, y que las funciones varían según el país y la oferta. Por lo tanto, algunas funciones como los avatares o la edición de vídeo a vídeo aún no están disponibles en Europa (y por tanto en Francia).

Con Omni, Google no sólo lanza un nuevo modelo de vídeo. El editor prepara un giro: el de un vídeo con IA que ya no solo generamos, sino que dirigimos, corregimos y reinventamos a través de la conversación.

<

____________________________

Lea también:

Google I/O 2026: Gemini Flash 3.5 supera a Gemini Pro 3.1

Google reinventa la Búsqueda de Google en modo agente

Gemini Spark: la respuesta de Google a OpenClaw y Claude Cowork

Google I/O '25: VEO 3, Imagen 4, Lyria 2… ¡IA más creativa que nunca!

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *