Durante una miniconferencia, OpenAI desveló los próximos desarrollos de ChatGPT con un nuevo modelo “omni” que analiza audio, imágenes e incluso vídeo con la misma agilidad que el texto. Las interacciones entre hombre y máquina se transforman por completo.
HAL 9000… La famosa computadora con IA de “ 2001, Una odisea en el espacio » con su capacidad para dialogar con el ser humano poniendo toda la expresividad necesaria ya no es una figura de ciencia ficción. Con el anuncio de anoche de GPT-4o, «o» de «omni», La IA conversacional ha alcanzado un hito significativo.
ChatGPT se presentó anteriormente como “IA conversacional”, pero su noción de conversación era limitada. Era una forma de turnarse donde cada persona sólo podía intervenir una vez que el otro había terminado por completo de expresarse. Y si esta interacción funciona bastante bien con un teclado y una pantalla, resulta muy hostil y humana cuando se cambia al modo de voz.
El modelo GPT-4o no es, en sí mismo, significativamente “más inteligente” que su predecesor GPT-4 Turbo. Pero sus capacidades multimodales en tiempo real llevan las interacciones a una nueva dimensión. Por supuesto, OpenAI ha perfeccionado aún más las capacidades de razonamiento de ChatGPT. Está logrando avances innegables en problemas matemáticos y en el análisis de problemas de múltiples capas. Pero la verdadera revolución está en otra parte.
De aquí en adelante, el modelo GPT-4o puede chatear por voz exactamente como un ser humano. No sólo comprende perfectamente la expresión vocal, sino que también percibe las intenciones, variaciones y ritmo de la discusión. Puede interrumpirlo o reanudarlo durante las respuestas para redirigir la discusión. La IA también sabe expresarse utilizando toda la entonación necesaria. Incluso puede responder cantando si el contexto lo permite.
Y las capacidades de GPT-4o no terminan ahí. El modelo puede, como GPT-4 Vision, analizar e interpretar imágenes. Pero ahora puede hacerlo en tiempo real en una transmisión de vídeo o una imagen animada, por ejemplo, interpretando lo que sucede en su pantalla gracias a una nueva versión «ChatGPT Desktop» que refuerza las interacciones entre humanos, IA y computadora. Más simple, “GPT-4o” ahora puede percibir el mundo físico a través de la cámara del teléfono inteligente o la cámara web de la PC.
OpenAI demostró ayer en vivo lo que el marketing de Google había sugerido con videos manipulados que demuestran el potencial «teórico» de Gemini Ultra. Google lo soñó, OpenAI lo hizo.
Durante la demostración de 20 minutos, tuvimos una sensación de déjà vu… O más bien la impresión de vivir el proceso inverso al de 2001: Odisea en el espacio.. En la película, David “Dave” Bowman apaga gradualmente la IA HAL 9000 eliminando sus memorias holográficas una por una. Poco a poco, la IA retrocede, retrocede en el tiempo en el que estaba aprendiendo, pierde su personalidad, vuelve a la época en la que aprendió a cantar canciones infantiles cuando era niña. Antes de salir finalmente con un “ Dave, tengo miedo… ».
Ayer OpenAI nos dio de algún modo la impresión de ir en sentido contrario, demostrando una a una las capacidades cada vez más «artificialmente» humanas» de su IA, capaz de contar historias, de cantarlas, de mostrar paciencia, atención y humor. Y muchas Los internautas deben haberse dicho a sí mismos… “ ChatGPT, me temo… »
Y si aún no has visto la demo, ahora te toca a ti tener miedo… y sobre todo sorprenderte. Sí, el progreso de nuestra IA es deslumbrante… Y se lo debemos a los humanos. Pero también es difícil no preguntarse” Humanidad, tengo miedo de lo que vais a hacer con este potencial… » !
<
09:42 – Conversación en tiempo real
11:50 – Expresividad de la voz AI
13:50 – Capacidad de la IA para “ver el mundo”, resolver problemas y guiar a los humanos
18:30 – IA para asistencia de programación en tiempo real e interacciones avanzadas de escritorio
22:10 – IA como intérprete multilingüe en tiempo real
23:30 – Comprender las emociones humanas
Aquí hay otra demostración espectacular para comprender completamente todos los avances realizados por GPT-4o y el potencial de su percepción del mundo en tiempo real.
<
Y uno más sobre cómo GPT-4o puede percibir el mundo para ayudar a las personas con discapacidad visual
<
Más rápido y potente, GPT-4o ya está disponible en ChatGPT Plus (para procesamiento de textos e imágenes), pero también en la versión gratuita de ChatGPT con un número limitado de interacciones. La versión gratuita de ChatGPT también se beneficia de la GPT Store y la personalización de IA, funciones previamente reservadas para la versión paga “Plus”. Las funciones de voz llegarán en las próximas semanas e inicialmente estarán reservadas para los suscriptores de ChatGPT Plus y ChatGPT Teams.
Ahora estamos esperando la respuesta de Google en la conferencia Google I/O que comienza esta tarde y en la que la IA debería volver a estar presente, ¿con nuevas sorpresas reservadas?
Lea también:
OpenAI Voice Engine imita tu voz en 15 segundos…
Stargate la mega computadora de OpenAI y Microsoft
OpenAI responde abiertamente a las acusaciones de Elon Musk
OpenAI desarrollaría un motor de búsqueda web basado en su IA
[

