Anoche y 48 horas después de la conferencia de Microsoft sobre la IA en el trabajo, OpenAI formalizó GPT-4, el modelo multimodal que debe suplantar al modelo GPT-3 que impulsa ChatGPT y tantas otras IA. En la práctica, GPT-4 ha impulsado la IA de Bing desde sus inicios, pero la información se mantuvo en secreto.
Es necesariamente un «momento» en el mundo de la IA: OpenAI anuncia GPT-4, su nuevo modelo lingüístico. No tan poderoso como afirman los rumores, pero más ágil y eficiente que la iteración anterior, GPT-4 debería ser el foco de atención del mundo de TI en las próximas semanas. Y por una buena razón, sucede a GPT-3, el modelo que introdujo la IA generativa en la vida diaria de todos, en el hogar y en el trabajo.
Como recordatorio, lanzado hace más de un año, GPT-3 es el modelo LLM que sirvió como base para GitHub Copilot (la IA que genera automáticamente líneas de programación), Einstein GPT, ClosersCopy (herramienta de traducción), Rytr, Headlime, Jasper.ai y por supuesto la revolución tecnológica del momento: ChatGPT.
De GPT-3 a GPT-4: ¿cuáles son las diferencias?
Así que inevitablemente se espera con ansias a su sucesor y sus características han sido fantaseadas por los rumores. Lejos de explotar billones de parámetros, GPT-4 se diferencia menos de GPT-3 por la complejidad de su red de parámetros que por su propia naturaleza. Si GPT-3 es un auténtico LLM (Large Language Model), GPT-4 es mucho más un LMM (Large Multimodal Model). En otras palabras, GPT-4 es tan fácil de entender para las imágenes y su contenido como para entender los textos y las preguntas de los usuarios.
Y esta es la principal diferencia con GPT-3. El otro es que la base de conocimientos utilizada para entrenar GPT-4 también es más actuallo que a veces hace que sus respuestas sean más relevantes.
Para el usuario, OpenAI reconoce que » en una conversación formal, la distinción entre GPT-3.5 y GPT-4 puede ser sutil. La diferencia aparece cuando la complejidad de la tarea solicitada alcanza un umbral suficiente «. Pero en términos generales, según OpenAI, » GPT-4 demuestra ser más confiable, más creativo y capaz de manejar instrucciones mucho más matizadas que GPT-3.5. »
Otra diferencia sutil pero que puede resultar muy importante en el uso: mientras que GPT 3.5 tuvo problemas para mantenerse consistente y preservar contextos más allá de las 3000 palabras de texto, GPT-4 puede aceptar hasta 25,000 palabras sin confundirse.
Finalmente, GPT-4 puede mostrar diferentes personalidades y adaptar sus respuestas en consecuencia. “En lugar de la personalidad clásica de ChatGPT con verbosidad, tono y estilo fijos, los desarrolladores (y pronto los usuarios de ChatGPT) ahora pueden prescribir el estilo de su IA”, dice OpenAI. Y esta capacidad no es una sorpresa, ya que se descubrió en Bing IA recientemente, aunque solo los probadores internos de Microsoft pueden activarla por el momento.
Anunciamos GPT-4, un gran modelo multimodal, con nuestros mejores resultados en capacidades y alineación: https://t.co/TwLFssyALF pic.twitter.com/lYWwPjZbSg
— OpenAI (@OpenAI) 14 de marzo de 2023
GPT-4, ya en Bing, pronto en ChatGPT
Porque, sí, GPT-4 en realidad ya es utilizado por más de un millón de usuarios de Internet casi a diario durante casi un mes: usuarios validados por Microsoft en la lista de espera para acceder al nuevo Bing. De hecho, es en GPT-4 que Bing AI se ha basado desde el principio. Información que Microsoft ha mantenido en secreto hasta el momento, contentándose con decir que la IA de Bing utilizó una nueva generación de IA de OpenAI.
Además, OpenAI ha confirmado la llegada del modelo GPT-4 a ChatGPT en los próximos días. Sin embargo, inicialmente, solo los usuarios pagos de ChatGPT Plus podrán acceder a él. La interfaz de ChatGPT también evolucionará para permitir la consulta de la IA a partir de imágenes. Pero no ahora. OpenAI indica que el análisis de imágenes aún es experimental y debe probarse más (el entendimiento debe enriquecerse con salvaguardas dedicadas) por parte de sus investigadores antes de ponerlo a disposición de todos.
Un enfoque multimodal que lo cambia todo
Si GPT-3 y ChatGPT asombraron al mundo con su capacidad para comprender preguntas, GPT-4 debería causar el mismo asombro con su capacidad para analizar y comprender imágenes. El siguiente ejemplo es bastante revelador.
La IA no solo es capaz de comprender una imagen compuesta (compuesta por varias fotos), sino que también es capaz de comprender la sutileza de la imagen y el humor que transmite: así GPT-4 reconoce toda la ironía de esta selección de imágenes. presentando un teléfono inteligente equipado con un puerto VGA ancestral!
Además, una de las primeras aplicaciones en explotar el potencial de GPT-4 no es otra que «Be My eyes», una aplicación para personas con discapacidad visual que les permite usar su teléfono inteligente (y su cámara) para describir el mundo. que los rodea. La aplicación se enriquecerá con un nuevo modo «Voluntario virtual» basado en GPT-4. Los creadores del software explican que » los usuarios pueden enviar imágenes a través de la aplicación a Virtual Volunteer con inteligencia artificial que responderá cualquier pregunta sobre esa imagen y brindará asistencia visual instantánea para una amplia variedad de tareas. Por ejemplo, si un usuario envía una foto del interior de su frigorífico, la IA no solo podrá identificar correctamente lo que hay dentro, sino también extrapolar y analizar qué se puede preparar con estos ingredientes. La herramienta también puede ofrecer una serie de recetas para estos ingredientes y enviar una guía paso a paso sobre cómo prepararlos. ».
El video a continuación brinda más información sobre el potencial de esta tecnología.
Sé mis ojos Voluntario virtual
Un GPT-4 casi tan divertido como el GPT-3…
No todo es perfecto, por supuesto. Como reconoce el cofundador de OpenAI, Sam Altman, “ Las capacidades multimodales de GPT-4 son más impresionantes a primera vista que después de un tiempo de uso porque GPT-4 realmente no escapa a las fallas y críticas expresadas sobre la generación anterior. Normalmente en el vídeo de Visual Volunteer oímos muy bien a la IA explicando que las máquinas de gimnasio libres son aquellas en las que no hay nadie. ¡Eso es información!
OpenAI de ninguna manera oculta las limitaciones de GPT-4. El editor reconoce que, como en iteraciones anteriores, la IA puede » alucinar », cometer errores de razonamiento, sufre de prejuicio inducida por los documentos no certificados utilizados para su aprendizaje o inventar hechos con un aplomo asombroso. En un ejemplo mostrado por OpenAI, GPT-4 revela que Elvis Presley es hijo de un actor. Todo un invento.
Además, algunas limitaciones de ChatGPT todavía están presentes en GPT-4. Entonces » GPT-4 generalmente desconoce los eventos que ocurrieron después de septiembre de 2021 y no aprende de su experiencia”, dice OpenAI. “A veces puede cometer simples errores de razonamiento que no parecen coincidir con sus habilidades en tantas otras áreas, o demostrar ser demasiado crédulo al aceptar tergiversaciones obvias del usuario. Y, a veces, la IA puede fallar en problemas difíciles de la misma manera que lo hacen los humanos, como introducir vulnerabilidades de seguridad en el código que produce. »
De cualquier manera, GPT-4 marca un nuevo hito en la progresión de las IA y la ayuda que brindan a los humanos a diario. A pesar de las fallas mencionadas anteriormente, GPT-4 es, en comparación con el ChatGPT actual, un 82 % menos inclinado a responder a contenido «prohibido» y produce respuestas fácticas correctas con mayor frecuencia (40 % de mejora).
Queda por ver cómo Microsoft explotará todo este potencial en Microsoft 365: deberíamos tener respuestas mañana, fecha de su conferencia sobre IA en el trabajo.
Lea también:
Microsoft anuncia nueva conferencia de IA para el 16 de marzo
Einstein GPT: Salesforce responde a Microsoft
Microsoft presenta IA generativa en el corazón de Dynamics 365
Microsoft lanza Windows 11 «Momento 2» e integra AI Bing!
Microsoft presenta el nuevo Bing impulsado por IA… ¡Y eso lo cambia todo!
[



