Google anuncia Gemini 2.0 Flash, la primera encarnación de la futura familia 2.0, una familia de modelos que Google afirma haber creado para la era de los agentes de IA. Y para demostrarlo, la firma americana presenta proyectos experimentales que se convertirán en funcionalidades de IA Gemini en 2025…
Mientras OpenAI desvela lentamente sus nuevas funciones para ChatGPT y su ecosistema de IA, Google contraataca en los medios anunciando su generación de modelos “Gemini 2.0”, pero sólo revela los pequeños Géminis 2.0 Flash mientras que parece cada vez más obvio que los actores de la IA están encontrando inmensas dificultades para producir una nueva generación de modelos de frontera muy grandes.
Según Google, su nueva generación de modelo de IA “Gemini 2.0” marca una importante evolución hacia lo que la compañía llama “la era agente”. Al revelar sólo la versión Flash, es bastante difícil apreciar realmente las contribuciones de esta generación “2.0”. Pero este lanzamiento confirma que los modelos pequeños ahora son capaces de cosas muy grandes.
Las principales innovaciones de Gemini 2.0 Flash
Si hay un punto fundamental que diferencia a “Gemini 2.0 Flash” de ediciones anteriores de Flash es sin duda la llegada de capacidades multimodales extendidas. Una prueba más de que los avances logrados por los modelos pequeños, resultantes de una técnica para reducir los modelos grandes llamada “dilución”, ahora les permite hacer casi tanto como los modelos grandes, mucho más costosos y que consumen mucha más energía. Cuanto más tiempo pasa, menos coherente y relevante se vuelve gastar mucho más (en dinero para los clientes pero también, para los hiperescaladores, en inferencia e infraestructura de aprendizaje) en modelos grandes. ¡Este es todo el problema con el GPT-5, Claude 1.5 Opus y Gemini 1.5 Ultra que todavía no hemos visto y que quizás nunca veamos!
El modelo ahora puede generar imágenes de forma nativa mezclado con el texto, producir texto y sintetizar el habla en varios idiomas con síntesis de voz personalizable, analizar imágenes e incluso vídeos casi en tiempo real, todo ello con el doble de rendimiento respecto a su predecesor. Esta notable mejora va acompañada de una integración nativa con los servicios de Google, permitiendo en particular ejecución de código y acceso directo en la búsqueda de Google.
Consciente de los problemas de seguridad, Google está adoptando un enfoque progresivo en el despliegue de estas tecnologías. La versión experimental de Gemini 2.0 Flash está disponible inmediatamente a través de la API de Google en Estudio de IA y IA de vérticemientras que algunas funciones avanzadas, como la generación de imágenes y la síntesis de voz, están reservadas para los socios de acceso temprano. El despliegue completo está previsto para enero de 2025.
Interacciones en tiempo real
Al mismo tiempo, en otros lugares, Google lanza un nuevo » API en vivo multimodal » ¡facilitando la creación de aplicaciones con transmisión de audio y video en tiempo real para crear aplicaciones que puedan analizar y responder instantáneamente a entradas multimodales! Y por tanto tener aplicaciones con el mismo tipo de interactividad hombre-máquina de “próxima generación” con la naturalidad y fluidez de un Gemini Live o un ChatGPT Advanced Voice Mode.
La “vista previa” de Gemini 2.0 Flash también aparece en el chatbot de Gemini a través de la aplicación Gemini en el escritorio y en la Web. Muy pronto se anuncia su integración en móviles.
INVESTIGACIÓN PROFUNDA, ¿la respuesta a la BÚSQUEDA GPT?
Mejor aún, los suscriptores de la versión paga del chatbot, Gemini Advanced, tendrán acceso a una característica completamente nueva” Investigación profunda » ¡que es la respuesta de Google a la función “Búsqueda GPT” de OpenAI en ChatGPT Plus!
Deep Research destaca por su capacidad para desarrollar sofisticados planes de investigación en varias etapas. El proceso se estructura en torno a un enfoque iterativo:
- El usuario formula una pregunta o define un tema de investigación.
- El sistema desarrolla un plan de investigación estructurado, sujeto a validación.
- El análisis se lleva a cabo mediante iteraciones sucesivas, y cada descubrimiento impulsa nuevas vías de exploración.
- Los resultados se resumen en un informe detallado, enriquecido con referencias obtenidas.
El enfoque metodológico de Deep Research se distingue por su capacidad de perfeccionar progresivamente sus investigaciones. El sistema analiza la información descubierta, lanza nuevas consultas basadas en sus hallazgos y repite este proceso hasta obtener una comprensión profunda del tema. El resultado final se materializa en forma de informe estructurado, directamente exportable a Google Docs para facilitar su posterior edición.
En otras palabras, «Deep Research» es una especie de adaptación del modo de búsqueda profunda de Microsoft Copilot o una combinación de «GPT Search» y el modo de razonamiento avanzado de OpenAI o1.
Según Google, el poder de la Investigación Profunda se basa en dos avances importantes en Gemini 2.0 (que se encontrarán en modelos futuros): la función de “razonamiento avanzado” que proporciona al modelo capacidades de análisis contextual en profundidad y la función de “razonamiento largo”. capacidades” que permiten el procesamiento de grandes volúmenes de información.
Para Google, “ La investigación profunda ahorra horas de trabajo » automatizando procesos de búsqueda complejos.
La función sólo está disponible en EE. UU. y es seguro que los europeos tendrán que esperar unos meses antes de aprovecharla.
Nuevos proyectos experimentales.
Más allá de estos anuncios, Google quiere imponer al inconsciente colectivo que “Gemini 2.0” en realidad inaugura una nueva era de la IA, la de los agentes de IA, la de la IA agente. Y para demostrarlo, la empresa ha levantado el velo sobre tres grandes proyectos que ilustran su visión de la IA agente:
Proyecto Astra : Un asistente universal de IA capaz de integrar información del mundo real y tomar iniciativas contextuales (sugerencias de restaurantes, planificación de rutas).
Proyecto Marinero : Una interfaz capaz de interpretar el contenido de los navegadores web en tiempo real, analizando texto, código e imágenes para proponer acciones relevantes.
julio : Un agente dedicado a desarrolladores que se integra con los flujos de trabajo de GitHub para automatizar la administración y depuración de código (Python y JavaScript).
En definitiva, Google pretende empezar el año 2025 tomando la delantera sobre la competencia. Si bien OpenAI debería discutir algunas características nuevas esta semana en torno a los “Agentes” y sus modelos, Google se está adelantando al presentar proyectos que aún están lejos de la funcionalidad de accesibilidad y al presentar su “Gamini 2.0 Flash”. ¡Suficiente para llamar la atención y poner al ecosistema de IA a la espera de más información sobre modelos más avanzados!
<
Lea también:
OpenAI lanza oficialmente su modelo de vídeo SORA pero no en Europa…
OpenAI lanza su IA “o1 Pro” a 200 dólares al mes
¡Google Gemini for Workspaces finalmente está disponible en francés!
Google formaliza Gemini Live en francés
Google da personalización a Gemini y lanza nuevos modelos
[

