Meta continúa perfeccionando su LLM “LLama 3”, la referencia para los modelos llamados “abiertos” con iteraciones que se suceden a alta velocidad. La versión “3.3” mejora significativamente las capacidades de razonamiento del modelo.
Los principales actores de la IA parecen tener grandes dificultades para seguir ampliando sus modelos de gran tamaño. Así, mientras esperan encontrar la chispa tecnológica que frene el techo alcanzado, buscan perfeccionar los algoritmos existentes para mejorar las capacidades de razonamiento de los modelos. Lo vimos con Anthropic y la última versión de su “Claude 3.5 Sonnet”, con Google y el anuncio de “Gemini 2.0” y por supuesto con Open y sus nuevos modelos “o1”. Y Microsoft demostró con Phi-4 que las capacidades de razonamiento también podrían aplicarse a los SLM, pequeños modelos de IA.
Meta parece ir por el mismo camino con su familia de modelos “Llama”. El editor acaba de formalizar “Llama 3.3 70B Instruct”, un modelo de lenguaje multilingüe que destaca por su arquitectura “transform” optimizada, su capacidad de personalización por parte de las empresas y su ventana de contexto ampliada a 128.000 tokens.
Llama 3.3 70B sigue siendo un modelo de solo texto y admite inglés, alemán, francés, italiano, portugués, español, hindi y tailandés.
La arquitectura del modelo, que incluye 70 mil millones de parámetros, integra una importante innovación técnica con Grouped-Query Attention (GQA). Según Meta, este enfoque mejora significativamente la eficiencia computacional y la escalabilidad del sistema.
El rendimiento de Llama 3.3 muestra una mejora notable con respecto a iteraciones anteriores. En particular, el modelo logra una precisión del 50,5 % en el punto de referencia GPQA para el razonamiento y destaca en la generación de código con una puntuación del 88,4 % en la prueba HumanEval.
Meta prestó especial atención a la seguridad en el desarrollo de Llama 3.3, implementando sólidas estrategias de denegación para solicitudes potencialmente peligrosas. El modelo está disponible bajo la licencia comunitaria Llama 3.3, con puntos de control alojados en Hugging Face, lo que permite a los desarrolladores aprovechar compilaciones cuantificadas para optimizar los recursos de hardware.
En términos de buenas iniciativas, Meta demuestra una cierta transparencia «sostenible» al especificar que el modelo fue entrenado en uno de sus clústeres internos a partir de un conjunto de datos compuesto por 15 billones de tokens y requirió 7 millones de horas de cálculo de GPU en NVidia H100-80GB. Las tarjetas GPU y generaron 2.040 toneladas de emisiones de CO2 a pesar del uso de energía 100% renovable, compensaron las emisiones gracias a los esfuerzos paralelos de Meta para, en última instancia, permanecer neutral en carbono.
Sin embargo, recordamos que, incluso si Meta no está de acuerdo, su modelo “abierto” LLama 3.3 no se considera un modelo “de código abierto” según la definición oficial de OSI.
Llama 3.3 se implementará rápidamente en casi todas las plataformas de IA del mercado, pero los modelos ya están en Hugging Face: meta-llama/Llama-3.3-70B-Instruct · Hugging Face
Lea también:
Meta presenta Movie Gen, su modelo de IA de vídeo que compite con SORA de OpenAI
Cariño, ups, agrandé la LLama [MAJ]
OLMo 2: un nuevo modelo verdaderamente de código abierto mejor que LLama 3.1
Con LLama 3, Meta redefine los estándares de IA de código abierto
Meta anuncia sus gafas AR holográficas “Orion” y hace que la realidad virtual sea un poco más accesible.
[


