Google ya tenía con Imagen 3 de un poderoso modelo de generación de imágenes, muy apreciado en los negocios. Al igual que Operai y su generación de imágenes integradas en «GPT-4O», Google lanza una funcionalidad de «imagen» derivada del modelo «Géminis 2.5» para no solo generar imágenes sino también retocarlas.
Google anuncia el lanzamiento de «Gemini 2.5 Flash Image», un modelo para la edición y generación de imágenes hoy integrada en la aplicación Gemini (web y móvil), pero también se ofrece a los desarrolladores a través de la API de Gemini, Google AI Studio y Vertex AI.
Si bien su modelo anterior de Imagen 3 se centró en la generación de imágenes, la «imagen flash Gemini 2.5» está más cerca en sus capacidades de la imagen GPT de OpenAI o Flux.1 Kontext. Este modelo hace posible hacer que el retoque fino se pilotee en un lenguaje natural, al tiempo que preserva la identidad visual de los sujetos (caras, animales, objetos) y fusionando varias fotos en la misma escena.
Más allá del simple «texto a imagen», el modelo gestiona ediciones de varias etapas y transformaciones locales: cambie un fondo, elimine un elemento, modifique una instalación o aplique el estilo de una imagen en un objeto de otro, sin degradar el resto de la foto. » Avanzamos la calidad visual y la capacidad del modelo para seguir las instrucciones. », Subraya Nicole Brichtova, líder de productos en Google Deepmind. Agrega que las salidas ahora son «más utilizables» porque el retoque está mejor integrado.
En el lado de rendimiento, el modelo, que Google probó bajo el nombre de código «nano-banana» en la plataforma Lmarena ha subido directamente en la parte superior de la clasificación comunitaria dedicada a la edición de imagen. Google confirma que este es el mismo modelo que el evaluado de forma anónima. Este nuevo modelo IA de hecho demuestra una mayor madurez en los casos de uso exigentes: es capaz de mantener la consistencia de un personaje en una serie de representación, para crear pruebas de diseño producidas desde múltiples ángulos o crear representaciones realmente homogéneas para todas las imágenes de una marca.
En la práctica, Gemini 2.5 Flash Image se dirige a una amplia variedad de necesidades que incluyen usos «Pro» en los negocios: iter de modelos al tiempo que mantiene la misma identidad visual, previsualizando el desarrollo de un espacio, creando soportes coherentes o produciendo variantes localizadas. Para los CIO, este lanzamiento marca menos una carrera por los efectos visuales que un paso hacia los flujos de trabajo controlables: granularidad de touch -ups, marcado de trazabilidad, costos predecibles e integración rápida en las herramientas existentes.
En términos de usos personales, el modelo está disponible en la aplicación Gemini en selección » Géminis 2.5 Flash «Y revisando la opción» Imagen «. Es suficiente preguntar en lenguaje natural» Crear una imagen de estilo de dibujos animados humorísticos «, de » Cambiar el disfraz de una persona en la foto «, de » Coloque a esta persona o animal en este o aquel lugar «, de » Fusionar varias fotos para crear una nueva escena «, de » Pinte las paredes de una habitación vacía y para agregar muebles «, d'» Aplicar el estilo de dicha imagen a una escena desde otra imagen «, etc.
En términos de cumplimiento y trazabilidad, todas las imágenes creadas o editadas llevan una marca de agua visible y una marca invisible Synthid. Google también recuerda la prohibición del contenido no otorgado bajo sus condiciones de uso. Después de las controversias del invierno pasado, el editor afirma haber endurecido sus salvaguardas mientras conserva la latitud creativa. Para las organizaciones sensibles a la reputación e integridad documental, estos mecanismos facilitan la implementación de controles internos (reconocimiento del contenido generado, las políticas habituales).
La edición/generación de imágenes se factura $ 30 por millón de tokens, cada imagen (hasta 1024 × 1024) consume 1,290 tokens, o alrededor de $ 0.039 por imagen. El modelo está en vista previa en el estudio API y AI, con la estabilización anunciada «En las próximas semanas». Google también destaca las integraciones y las tentaciones listas para usar en AI Studio para acelerar los prototipos.
Suficiente para permitir que las personas creen impresionantes montajes fotográficos y empresas para integrar las funcionalidades de generación de imágenes de imagen más fácil y económica en sus aplicaciones de marketing y, por lo tanto, probar usos «creativos» más accesibles sin dejar de lado la brida sobre el cumplimiento y el riesgo de reputación.
Leer también:
Google Gemini también a un modo de «aprendizaje guiado»
Olimpiadas de Matemáticas 2025: Géminis Ai de Google también, ¡oro!
AI: las acciones planificadas llegan a la aplicación Google Gemini
Google I/O '25: Géminis energiza un poco más de espacio de trabajo, ¡y es mágico!
[




