Con Project Astra, Google está demostrando una nueva generación de asistente de IA capaz de percibir y comprender el mundo real para responder a las preguntas del usuario sobre lo que ve e interactuar con él mediante la voz de una forma más fluida y contextualizada.
Esta semana, OpenAI llevó la IA generativa a una nueva era, la de los modelos multimodales en tiempo real, para ofrecer más interacciones de voz humana y generar una nueva generación de asistentes de voz.
No tuvimos que esperar mucho para ver a Google responder cara a cara con su competidor, incluso si su » Proyecto Astra » no estará disponible durante varios meses. El Proyecto Astra demuestra cómo se pueden utilizar los modelos Gemini para conversar en tiempo real y percibir el mundo físico a través del teléfono inteligente o la cámara web.
A partir de ahora, Siri, Google Assistant y demás Alexa son cosa del pasado. Es hora de dar la bienvenida a una nueva generación de asistentes de audio que no sólo son más inteligentes y conversacionales, sino también más conectados con el mundo que te rodea.
En un vídeo también compartido en YouTube, el editor demostró cómo los teléfonos inteligentes o las gafas conectadas podrían en el futuro, gracias a la IA, capturar el mundo físico y transformarse en asistentes de voz inteligentes anclados en la realidad.
<
« Para ser verdaderamente útil, un asistente de IA debe comprender y responder al mundo complejo y dinámico tal como lo hacen los humanos: absorber y recordar lo que ve y oye para comprender el contexto y tomar medidas. También debe ser proactivo, educativo y personalizado, para que los usuarios puedan hablar con él de forma natural, sin retrasos ni demoras. » explica el editor.
El Proyecto Astra combina todos los esfuerzos de I+D de Google Deepmind para crear IA que puedan comprender información multimodal y al mismo tiempo reducir los tiempos de respuesta a algo conversacional. El Proyecto Astra da vida a la forma en que los futuros modelos Géminis percibirán el mundo, razonarán y conversarán para hacer que el ritmo y la calidad de la interacción sean más naturales.
Obviamente, existe un abismo entre las demostraciones en vivo de OpenAI y los videos grabados en los laboratorios de Google Deepmind. Sin embargo, el potencial está ahí y Google demuestra que se “apega” a las innovaciones del momento y sigue de cerca a OpenAI.
Por tanto, tendremos que esperar unos meses más antes de que este proyecto se haga realidad en nuestros smartphones Android.
Lea también:
GPT-4o: Un poco más cerca de HAL y 2001…
Next'2024: IA en ayuda de TI (Gemini Cloud Assist) y desarrolladores (Gemini Code Assist)
La excelente IA Claude-3 de Anthropic finalmente se abre a Europa
Next'24: Gemini Pro 1.5 se vuelve accesible para los desarrolladores
[

