Aplicaciones

Bitnet b1.58, le llm «1 bit» de Microsoft Research

Cuando los pesos de las neuronas caen a 1 bit, la IA de repente se vuelve ultra ligera, rápida y compatible con CPU … todo esto sin sacrificar su poder de mecanografía en tareas complejas y su relevancia como los investigadores de la investigación de Microsoft acaban de demostrar.

Históricamente, y particularmente desde que Google imaginó el «tensor» y el marco de «tensorflow», se adoptaron representaciones en coma flotante (FP32) para cálculos complejos en el corazón de las redes neuronales y la representación de los pesos de los modelos porque ofrecían la máxima flexibilidad y precisión. Ajustados sobre los ciclos de aprendizaje (lo que se llaman «épocas»), los pesos determinan la capacidad de un modelo ML/AI para hacer predicciones específicas. Esta representación digital (que codifica la fuerza de conexión entre las neuronas dentro de una red de neuronas) influye en un lado en la precisión del modelo, pero también determina el lugar que el modelo ocupará en la memoria, la energía necesaria para los cálculos y la complejidad de los circuitos para llevar a cabo los cálculos.

Reducir la precisión del peso significa reducir la huella de la memoria

Además, los investigadores rápidamente buscaron reducir la precisión de estas representaciones digitales para reducir el tamaño de los modelos y su consumo de recursos y energía. Muy rápidamente, comenzaron a usar representaciones mixtas FP32/FP16. La llegada de FP16 (16 bits) dividido por dos la impronta de memoria y doparon el flujo de las GPU sin comprometer la capacitación, gracias a una mezcla FP16/FP32 manejada directamente en los núcleos tensores de Nvidia o el AMX de Intel.

Luego se dieron cuenta de que, en particular para las inferencias, las representaciones de FP8 podrían resultar suficientes. Las GPU Hopper, Blackwell y Gaudi 2 favorecieron notablemente los cálculos de 8 bits. Al reducir cada coeficiente de ocho bits, FP8 ahorra hasta un 75 % de ancho de banda en comparación con la pareja FP16/FP32 al tiempo que preserva la esencial de precisión para la inferencia y, en algunos casos, para el aprendizaje.

El hecho es que los comunicados flotantes siguen siendo del 50 al 180% más caros en términos de potencia de CPU/GPU que los cálculos con enteros. De ahí la llegada del principio de cuantificación int8 que se ha convertido en hoy (y aún más desde el asunto de Deepseek) la referencia para la inferencia de producción. El hecho es que esta cuantificación llevada a cabo para la inferencia contribuye a degradar la calidad de los modelos, especialmente en las tareas particularmente sensibles al redondeo (como la reflexión sobre los problemas matemáticos, la generación de código, los lenguajes no latinos). De hecho, las rondas se extienden de una token a otra, rompen la lógica interna de los pasos de cálculo y terminan haciendo que la respuesta sea incoherente.

¿Hallazgo de Microsoft? Aprendizaje «trit»

En lugar de priorizar una cuantificación posterior al aprendizaje (por lo tanto, un posteriori), los investigadores de Microsoft Research imaginaron un LLM «nativo» entrenado desde el principio en … 1 bit! En realidad, usan un «clasificador», una representación ternaria donde cada peso puede tomar 3 estados: -1, 0, +1.

Así nació el modelo Bitnet B1.58 2B4T, publicado en código abierto y haciendo accesible a través de la cara abrazada. En este modelo de 2 mil millones de parámetros, cada byte utilizado contiene 4 «tipos».
Resultado: el modelo completo se mantiene en 0,4 irSeis veces menos que un modelo INT8 clásico y veinte veces menos que un tamaño equivalente FP16 (2 mil millones de parámetros).

Por lo tanto, el modelo se convierte en ejecutable directamente desde cualquier CPU.

Detrás de esta promesa de ubicuidad esconde un rediseño radical y ultra técnico de las capas lineales de la transformación: los clásicos «atorch.nn.linear» dan paso a bitlinear, codificando cada peso en tres estados (-1, 0, +1) a través de la cuantificación «absje». Junto con las activaciones de INT8 y la normalización de SUBLN, la receta comprime el modelo completo a 0.4 GB mientras divide el consumo de energía en seis y dos latencias de decodificación en comparación con modelos de tamaño equivalente (29 ms por token en CPU contra 41 a 124 ms para la competencia).
El equipo primero pretrató a la red en cuatro mil millones de tokens que mezclan web, código y matemáticas, antes de entrar en un buen ajuste supervisado, luego una optimización de preferencias en vivo para que se ajuste a las expectativas de conversación y de seguridad. De hecho notable, la fase SFT ha aprovechado una tasa de aprendizaje más agresiva que en los modelos FP16, aprovechando la estabilidad naturalmente mayor de las representaciones ternarias.

El modelo de 1 bits al banco

Bitnet, de quince puntos de referencia que cubren la comprensión, el razonamiento, las matemáticas, el código y el diálogo, Bitnet se mantiene al revés, o incluso excede a los líderes de peso abierto en plena precisión: por lo tanto, está por delante de LLAMA 3.2-1B en Arc-Challenge, vence a GEMMA-3-1B en Boolq y Outpernecss Qwen Score 2.5-1.5B. En frente de las versiones INT4 de este mismo QWen, el enfoque nativo de 1 bit todavía gana en la memoria y encuentra un nivel de rendimiento equivalente, sin la degradación habitual de las cuantificaciones posteriores.

En términos de explotación, Microsoft ofrece dos ladrillos clave: un núcleo de coda especializado para GPU (aún limitado por la ausencia de instrucciones dedicadas) y bitnet.cppUna biblioteca C ++ que permite una inferencia «sin pérdidas» en la CPU multithread.

A corto plazo, los investigadores ven los modelos de 7 y 13 mil millones de parámetros, una ventana de contexto extendida y extensión a multilingüe y multimodal.

Al final, recordaremos especialmente que el enfoque de los investigadores de Microsoft demuestra que un modelo de «1 bit» puede competir con los mejores modelos LLM llenos de precisión mientras realiza una implementación en una CPU simple.
Esta investigación abre el camino a una IA mucho más frugal y mucho más alineada con las limitaciones de presupuesto y huellas de carbono de los CIO. Y esta es una excelente noticia. Queda por continuar la investigación para hacer que esta nueva forma de modelos sea más multimodal y universal.

Para obtener más información: [2504.12285] Bitnet B1.58 2B4T Informe técnico

Leer también:

Modelos pequeños cada vez más inteligentes y dotados de razonamiento

Operai también llega a los modelos «nano» con GPT 4.1

Google lanza Gemini 2.5 Flash, un modelo que razona a bajo costo …

Microsoft Magma: un modelo de IA para la era de los agentes y los robots

Phi-4, el nuevo modelo pequeño de Microsoft que razona como un gran

Termum: un modelo de código abierto para observar la tierra desde todos los ángulos

Operai lanza sus modelos «O3» y «O4-Mini», dotado de AIS para analizar las imágenes, pensar y programar

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *