Aplicaciones

Veo 3, Imagen 4, Lyria 2 … ¡AI es muy creativo!

La conferencia de «desarrollador» de Google se celebra esta semana en Mountain View. La oportunidad para que Google demuestre el progreso a veces sorprendente de estos nuevos modelos. AI ahora es fundamentalmente multimodal y es terriblemente ágil y creativo, ya sea para producir textos, imágenes, videos o música.

El universo de la creación de contenido y obras multimedia está completamente al revés por la llegada de la IA generativa. Modelos como OpenAi Sora, imagen de OpenAI GPT4O, Adobe Firefly, Midjourney, Runway, Suno AI o Udio, no solo han creado redes sociales de zumbido y eberluradas, sino que también comenzaron a remodelar completamente los procesos y el ecosistema para crear contenido comercial.

Con su imagen y modelos VEO perfectamente integrados en las tuberías de inserción de Vertex A y IA en los procesos, Google también ha contribuido mucho a esta transición. Y el editor golpeó duro con motivo de Google I/O 2025 con nuevas generaciones de modelos muy significativamente mejorados con cada vez más impresionante.

Veo 3: Ai se despide del cine mudo

Revolución, el nuevo modelo Veo 3 sonido adjunto a imagen. Hasta ahora, todos los modelos de generación de videos solo han producido secuencias silenciosas. Con Veo 3, la IA generativa va al cine de sonido. El modelo combina, por primera vez, la síntesis de imágenes animadas y la generación de audio nativa: los efectos de sonido, los atmósferas, los diálogos y la sincronización labial provienen de una sola tubería. El motor AI analiza los píxeles que acaba de crear para detener automáticamente cada efecto de sonido y cada entonación en la acción.

https://www.youtube.com/watch?v=yqg0oUaofh0<

Más allá de la llegada del sonido, la calidad de la imagen también está progresando: DeepMind resalta una mayor fidelidad hacia la física y la iluminación real, una mejor coherencia temporal y, en la demostración interna, una representación 4K que excede el rendimiento de VEO 2 .. Para el tiempo, la versión «View View» disponible en Vértice AI nunca con tapa sinternes a 720p/24 I/S, en ocho Second SEGMENTES 16: 9.

En términos de interfaz, el modelo acepta indiferentemente una imagen textual o una imagen de referencia, y sabe cómo reescribir las instrucciones para optimizar el resultado, una función de «reescritura rápida» inaugurada en esta versión. Las mejoras de monitoreo de instrucciones dan como resultado una precisión mucho mayor de la representación generada frente al escenario descrito. Además, Gemini Veo 3 hereda y extiende el módulo «Control de la cámara» que Google anuncia que también implementó en la última iteración de VEO 2. Debido a que VEO 2 continúa su carrera, Veo 3 permanece por el momento restringido a una audiencia rica y seleccionada. El hecho es que este ladrillo de control de la cámara ofrece una configuración explícita de los movimientos de la cámara por primera vez en un generador de video de IA: ampliar, girar hacia arriba, moverse a la derecha, retroceder, etc. En el mismo orden de ideas, VEO 2 y VEO 3 ahora incluyen las instrucciones que les piden que agregue o eliminen elementos muy específicos en una escena.

Imagen 4: Competencia seria por Openai

Imagen 4 Marque un avance notable en la generación de imágenes en Google. El modelo va mucho más allá de la mejora de la resolución: introduce controles y garantiza que cumplan con las expectativas de los equipos de TI.

Imagen 4 se destaca en la representación de micro-texturas (telas, gotas de agua, pelajes) con una precisión hasta ahora reservada para la representación 3D. Maneja estilos fotorrealistas y de montaña, en proporciones variadas y hasta una resolución de 2K adecuada para la impresión o proyección HD.
Otra mejora importante La visualización de textos en la imagen y la tipografía está progresando claramente: las letras están correctamente deletreadas y alineadas, hasta el punto de que el uso de este modelo para la creación de diapositivas o soportes profesionales sin retocar se vuelve no solo posible sino también creíble.

WM 7 Eggs.max 1536x1536.format webpWM 7 Eggs.max 1536x1536.format webp

En nuestras pruebas, Imagen 4 resultó ser un competidor formidable para GPT-4-Image d'OpenAi, incluso si la representación es muy diferente. Especialmente porque Imagen 4 fue significativamente más rápido. Y en el asunto, este es solo el comienzo. Google anuncia una evolución «rápida» que debería ofrecer una generación de imágenes diez veces más rápido que Imagen 3, sin pérdida de calidad.

Imagen 4 ya está integrado en Gemini, Whisk (con animación a través de VEO 2), en Vertex AI y en el espacio de trabajo (diapositivas, videos, documentos). Cada imagen lleva una marca Synthid, y el portal asociado le permite verificar este tatuaje antes de la difusión, garantizando la trazabilidad.

El progreso muy concreto realizado por Imagen 4 lo convierte en una herramienta formidable para automatizar canales gráficos y producción de contenido para redes sociales y sitios de comercio electrónico. Sin embargo, tenga cuidado, una representación de 2K pesa de 6 a 8 MB, con una cuota de 60 imágenes por minuto y por proyecto en Vetex AI: por lo tanto, será necesario proporcionar el almacenamiento, el presupuesto y la red en consecuencia. Pero la reducción de la retoques y la automatización de la tipografía proporcionan una ganancia real en la productividad, sujeto a la incorporación de controles Synthid y ortográficos en la cadena de aprobación.

Lyria Real Time: AI no reemplaza a esos músicos, DJS también

En noviembre de 2023, Google presentó el modelo de generación musical avanzada, Lyria DeepMind, capaz de producir música de alta calidad, que incluye instrumental y voces, con un nivel de lealtad profesional. Desde entonces, servicios como Suno AI y Udio han ayudado a popularizar los modelos generativos de audios. El año pasado, Google había presentado su plataforma Music Ai Sandbox (todavía en beta privada) animada por Lyria 2, que no solo permitió una generación en alta fidelidad (estéreo de 48 kHz), sino que, sobre todo, hizo posible fusionar secuencias musicales, para controlar precisamente el tono, el tempo y la estructura de las canciones, pero también para agregar voces de Sung simplemente proporcionando las palabras.

https://www.youtube.com/watch?v=ludnyq8ejo8<

En Google I/O 2025, DeepMind fue aún más lejos con «Realtime Lyria» A Time Real Time (o casi) Lyria 2. La declinación en tiempo real de Lyria permite una creación musical instantánea que se cree para la integración directa en aplicaciones y servicios multimedia, pero que finalmente le permite comportarse como un DJ. El modelo se distingue por su capacidad para generar música sincronizada a la segunda, en respuesta a las acciones del usuario o las necesidades de un video, un juego o un agente conversacional. Puede tratar en tiempo real, ajustar la dinámica o el tempo de la mosca, y reaccionar a los cambios de contexto para producir transiciones naturales, sin latencia audible. El modelo administra diferentes estilos e instrumentos, e incorpora un sonido o atmósferas continuas. La restitución sigue siendo fiel, con un buen manejo de estéreo y variaciones en la intensidad, adaptada tanto a la creación de jingles como fondos de sonido inmersivos o apoyo musical evolutivo.

Lyria Real Time está disponible en API, directamente integrable en tuberías de producción multimedia, web, aplicaciones móviles o entornos en la nube (como Vetex AI), pero también dentro de una nueva aplicación (no accesible para el momento fuera de los EE. UU.) Llamado Music FX DJ.

Leer también:

OpenAI acelera la industrialización del código con Codex, su nuevo agente de IA que compete en copiloto de GitHub

Sora, el modelo de Video IA de Operai Video está disponible en Francia y Europa

Meta -revela la película Gen, su modelo de video competitivo de Operai Sora

Google anuncia VEO, un modelo de competencia de OpenAi Sora

OpenAI mejora las capacidades de generación de imágenes de chatgpt

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *