En una miniconferencia, OpenAI presentó las próximas evoluciones de ChatGPT con un nuevo modelo “omni” que analiza audio, imagen e incluso vídeo con la misma agilidad que el texto. Las interacciones entre el hombre y la máquina se transforman por completo.
HAL 9000… La famosa computadora de IA de “ 2001: Una odisea del espacio «Con su capacidad de dialogar con los seres humanos con toda la expresividad necesaria ya no es una figura de ciencia ficción. Con el anuncio ayer por la tarde de GPT-4o“o” como en “omni”, La IA conversacional ha alcanzado un hito importante.
ChatGPT se presentó anteriormente como una «IA conversacional», pero su noción de conversación era limitada. Era una forma de conversación por turnos en la que cada persona solo podía intervenir una vez que la otra había terminado de hablar por completo. Y si bien esta interacción funciona bastante bien con un teclado y una pantalla, resulta muy poco amigable y poco humana cuando se cambia al modo de voz.
El modelo GPT-4o no es, en sí mismo, significativamente más «inteligente» que su predecesor GPT-4 Turbo, pero sus capacidades multimodales en tiempo real llevan las interacciones a una nueva dimensión. Por supuesto, OpenAI ha agudizado aún más las capacidades de razonamiento de ChatGPT. Está logrando avances innegables en problemas matemáticos y en el análisis de problemas multicapa, pero la verdadera revolución está en otra parte.
De aquí en adelante, El modelo GPT-4o puede hablar vocalmente como un ser humanoNo solo entiende perfectamente la expresión vocal, sino que también percibe las intenciones, variaciones y ritmo de la discusión. Puede interrumpirse o reanudarse durante las respuestas para redirigir la discusión. La IA también sabe expresarse poniendo en ello toda la entonación necesaria. Incluso puede responder cantando si el contexto se presta a ello.
Y las capacidades de GPT-4o no terminan ahí. Al igual que GPT-4 Vision, el modelo puede analizar e interpretar imágenes. Pero ahora puede hacerlo en tiempo real en una transmisión de video o una imagen animada, por ejemplo, interpretando lo que está sucediendo en su pantalla gracias a una nueva variación «ChatGPT Desktop» que fortalece las interacciones entre humanos, IA y computadoras. En términos más simples, “GPT-4o” ahora puede percibir el mundo físico A través de la cámara del teléfono inteligente o la cámara web del PC.
OpenAI demostró ayer en directo lo que el equipo de marketing de Google había insinuado con vídeos manipulados que mostraban el potencial «teórico» de Gemini Ultra. Google lo soñó, OpenAI lo hizo realidad.
Durante la demostración de 20 minutos, tuvimos una sensación de déjà vu… O más bien la impresión de vivir el proceso inverso al de 2001: Una odisea del espacio.En la película, David «Dave» Bowman apaga gradualmente la IA HAL 9000 eliminando sus memorias holográficas una por una. Poco a poco, la IA retrocede, retrocede en el tiempo hasta su entrenamiento, pierde su personalidad, regresa a la época en la que aprendió a cantar canciones infantiles cuando era niño. Antes de apagarse finalmente con un » Dave, tengo miedo… ».
Ayer, OpenAI nos dio la impresión de ir en reversa, demostrando una a una las capacidades cada vez más «artificialmente» humanas de su IA, capaz de contar historias, cantarlas, mostrar paciencia, atención y humor. Y muchos internautas debieron decirse… ChatGPT, me temo… »
Y si todavía no has visto la demo, ahora te toca a ti tener miedo… y sobre todo asombrarte. Sí, el progreso de nuestra IA es deslumbrante… Y es a los humanos a quienes se lo debemos. Pero también es difícil no preguntarse… Humanidad, temo lo que harás con este potencial… » !
<
09:42 – Conversación en tiempo real
11:50 – Expresividad de la voz de la IA
13:50 – La capacidad de la IA para “ver el mundo”, resolver problemas y guiar a los humanos
18:30 – Asistencia de IA en tiempo real con programación e interacciones avanzadas de escritorio
22:10 – La IA como intérprete multilingüe en tiempo real
23:30 – Entendiendo las emociones humanas
Aquí hay otra demostración espectacular para comprender completamente todo el progreso logrado por GPT-4o y el potencial de su percepción del mundo en tiempo real.
<
Y uno más sobre cómo GPT-4o puede percibir el mundo para ayudar a las personas con discapacidad visual.
<
Más rápido y más potente, GPT-4o ya está disponible en ChatGPT Plus (para el procesamiento de texto e imágenes), pero también en la versión gratuita de ChatGPT con un número limitado de interacciones. La versión gratuita de ChatGPT también se beneficia de la tienda GPT y de la personalización con IA, funciones que antes estaban reservadas a la versión de pago “Plus”. Las funciones de voz llegarán en las próximas semanas y, en un principio, estarán reservadas a los suscriptores de ChatGPT Plus y ChatGPT Teams.
Ahora esperamos la respuesta de Google en la conferencia Google I/O que comienza esta tarde y en la que la IA debería volver a ser el protagonista, con nuevas sorpresas reservadas.
Lea también:
El motor de voz de OpenAI imita tu voz en 15 segundos…
Stargate la megacomputadora de OpenAI y Microsoft
OpenAI responde abiertamente a las acusaciones de Elon Musk
OpenAI estaría desarrollando un motor de búsqueda web basado en su inteligencia artificial
[

