Para entrenar IA como ChatGPT o la nueva IA de Bing, necesita enormes capacidades informáticas que solo las supercomputadoras más grandes del planeta pueden proporcionar. Máquinas que no están al alcance de todas las empresas, pero IBM hace saber que tiene una.
En las últimas semanas, se ha derramado mucha tinta sobre ChatGPT y la integración de tales IA conversacionales en el corazón de los motores de búsqueda de Bing (con Bing AI) y Google (Bard). Con su impresionante capacidad para comprender las preguntas formuladas por los humanos y generar respuestas elaboradas, han dado un gran paso adelante en la informática y las interacciones entre humanos y computadoras.
Pero estas IA se basan en modelos lingüísticos masivos que incluyen cientos de miles de millones de parámetros y cuyo aprendizaje les exige absorber zetabytes de documentos. En otras palabras, aprender estas IA requiere capacidades informáticas gigantescas y, por lo tanto, monopoliza algunas de las supercomputadoras HPC más poderosas del planeta. Por lo tanto, OpenAI (para el modelo GPT 3 en el que se basa ChatGPT) se basó en un HPC creado por Microsoft en Azure que se encuentra entre los 15 HPC más potentes del mundo.
Floraciónel modelo lingüístico francés del proyecto gran ciencia iniciado por la startup Hugging Face y apoyado por el CNRS, ocupó la supercomputadora jean zay Durante muchos meses.
Como sabemos, la nueva compañía de IBM (reducida de la división que se ha convertido en Kyndryl) se construyó sobre la nube híbrida y la IA, incluso si la compañía ha hablado mucho más sobre la nube híbrida que sobre la IA en los últimos meses. Pero mientras todos tienen ojos solo para el progreso realizado recientemente con ChatGPT y demás, IBM quiere recordar los buenos recuerdos de todos y levantar el velo sobre VELA, son su propia y primera supercomputadora especialmente optimizada para entrenar grandes modelos de IA. Utilizado exclusivamente por IBM Research, se habría activado en mayo de 2022 y desde entonces ha sido la herramienta elegida por todos sus investigadores de IA.
La máquina, que está alojada e integrada en la nube de IBM, funciona con 360 nodos, cada uno equipado con dos procesadores Xeon “Cascade Lake” y 8 GPU NVidia A100, 1,5 TB de RAM y 4 SSD NVMe 3.2. A todos. Toda la arquitectura se ha optimizado para el acceso desde una nube, pero también para el uso de máquinas virtuales en lugar de Bare Metal (como se practica a menudo en IA). Aparentemente, los ingenieros de IBM han adaptado el hipervisor subyacente para permitir que las máquinas virtuales aprovechen al máximo las capacidades de los nodos (en términos de memoria y GPU en particular). Por lo tanto, la sobrecarga de la virtualización tendría un impacto en el rendimiento de menos del 5% al tiempo que ofrece una flexibilidad que Bare Metal no permite.
Cabe señalar de paso que IBM prefirió optar por una arquitectura Intel Xeon en detrimento de su propio Power 10.
En su documento de presentación, IBM explica que » este trabajo se realizó con el objetivo de proporcionar rendimiento y flexibilidad para cargas de trabajo de IA a gran escala, pero la infraestructura se diseñó para poder implementarse en cualquiera de nuestros centros de datos globales, a cualquier escala. Y si bien este trabajo se realizó en el contexto de nuestra nube pública, la arquitectura también podría adoptarse para diseñar sistemas de IA locales. »
En otras palabras, IBM parece querer eventualmente ofrecer acceso a Vela a equipos fuera de IBM e incluso implementar máquinas similares en otros centros de datos de todo el mundo.
Lea también:
Microsoft presenta el nuevo Bing impulsado por IA… ¡Y eso lo cambia todo!
Microsoft ChatGPT vs Google Bard, la guerra de la IA está en marcha
IBM despedirá a 3.900 personas en todo el mundo
IBM acusa a Micro Focus de infracción de derechos de autor de mainframe
[

