Olvídate de los gigantes: deja paso a los modelos nítidos. IBM está lanzando toda una familia de modelos Granite 4.0, basados en una arquitectura mixta de Mamba y Transformer. Un desarrollo que marca un nuevo aumento en el poder de los LLM abiertos, pequeños y verdaderamente productivos. Entre el razonamiento de contexto prolongado y la ejecución de múltiples agentes, IBM está trazando un camino creíble hacia una IA industrial, personalizable, auditable y económica.
Los modelos pequeños son las grandes estrellas del año 2025. No solo permiten realizar una amplia variedad de escenarios de IA en el Edge que hasta ahora han sido demasiado complejos de realizar debido a la latencia o restricciones regulatorias, sino que también son mucho más fáciles de “sintonizar” o reentrenar parcialmente con datos específicos de la empresa para aumentar la relevancia contextualizada de las respuestas y limitar las alucinaciones. Sobre todo porque los modelos “pequeños” no significan “menos capaces”, ya que ahora a veces son capaces de razonamiento avanzado e incluso capacidades multimedia. Además, también evolucionan más rápido que los modelos de frontera.
Entre los modelos pequeños populares, la familia Granite de IBM, publicada en formato abierto, ha atraído mucha atención por parte de los investigadores de IA en los últimos meses. Y esperábamos a la nueva generación con cierta impaciencia.
La espera ha terminado. E IBM está cambiando de escala con Granite 4.0, su nueva generación de modelos de “peso abierto” publicados bajo la licencia Apache 2.0 y diseñados principalmente para la ejecución en producción: menos memoria, más sesiones simultáneas, ventanas de contexto largas y un marco de confianza auditado.
La gama consta de cuatro modelos: Granite-4.0-H-Small (32 mil millones de parámetros, 9 mil millones activos), Granite-4.0-H-Tiny (7 mil millones, 1 mil millones activos), Granite-4.0-H-Micro (3 mil millones, híbrido denso) y Granite-4.0-Micro (3 mil millones, transformador “clásico”). Todos ellos apuntan a una inferencia frugal en GPU que son mucho menos costosas que las configuraciones LLM habituales.
Una arquitectura híbrida Mamba-Transformer
En la misma lógica que sigue Mistral AI, IBM está tratando de avanzar en el núcleo de los modelos explorando vías distintas a los Transformers (la famosa T en GPT). Para Granite 4.0, IBM siguió un enfoque híbrido original que combina principalmente capas Mamba-2de modelos de “espacio de estados”, con una pequeña fracción de transformador de bloques.
Para qué ? Esencialmente porque la autoatención de los Transformers ve aumentar sus necesidades de cálculo y memoria como el cuadrado de la longitud del contexto, lo que hace que la VRAM y la latencia exploten cuando alargamos las ventanas o cuando multiplicamos las sesiones. Por el contrario, Mamba-2 procesa la secuencia de forma secuencial con una complejidad lineal y una memoria que prácticamente no depende del tamaño del contexto; el orden es implícito, lo que permite a IBM eliminar por completo las codificaciones posicionales. Y esto nos permite ofrecer “modelos pequeños” que no consumen mucha memoria.
En Granito 4.0, los dos enfoques se intercalan en una proporción de aproximadamente 9 a 1 : Los bloques Mamba capturan eficazmente la dinámica global en secuencias largas, mientras que los bloques Transformer refinan las interacciones locales más matizadas. Resultado: se pueden servir ventanas muy largas con mucha menos memoria y menor latencia, con IBM indicando entrenamiento en muestras de hasta 512k tokens y rendimiento validado de hasta 128k, lo que resulta en ganancias de RAM de más del 70% en contexto largo y cargas multisesión.
Como resultado, una Raspberry Pi 5 con 8 GB de RAM puede deducir el modelo Granite-4.0-H-Micro sin dificultad. Para modelos más desarrollados, no es necesario instalar clusters H100 o superiores. Las tarjetas GPU RTX son suficientes para iniciar POC y, al mismo tiempo, tienen espacio para escalar.
Prioridades “agencias”
En Granite 4.0, “agentico” significa que un modelo no solo predice texto: comprende una instrucción precisa, elige los pasos útiles, llama a herramientas externas y depende de fuentes para responder de manera verificable. Capacidades agentes forjadas en 3 pilares:
El primer pilar es siguiendo instrucciones. En concreto, el modelo respeta las restricciones de formato, tono, longitud o esquema de salida (por ejemplo, un JSON conforme a un contrato). Para un CIO, es la diferencia entre una respuesta que «suena bien» y una producción que puede ser utilizada por un flujo de trabajo de automatización: un ticket de ServiceNow completado correctamente, un resumen estandarizado, un campo calculado sin ambigüedades.
Segundo pilar, la convocatoria de herramientas (“llamada a funciones”) le permite exponer un catálogo de funciones al modelo (consultar un ERP, crear una solicitud de compra, iniciar una búsqueda segura, calcular un KPI, llamar a una API) con argumentos escritos. El modelo debe decidir si utilizar una herramienta, cuál y con qué parámetros, y luego integrar el resultado en su respuesta. El resultado con Granite 4.0 es menos bucles de recuperación, transiciones limpias entre el lenguaje natural y los sistemas empresariales, y rastros auditables de quién llamó qué, cuándo y con qué datos.
Finalmente, el Tercer Pilar es la apariencia de un funcionamiento RAG en múltiples vueltas. El modelo aprende a formular una solicitud documental eficaz, a citar sus fuentes, a mantener el hilo de la conversación a lo largo de varios intercambios y a ajustar sus búsquedas si los documentos iniciales no son suficientes. Combinado con las ventanas de contexto muy largas de Granite 4.0, esto hace posible obtener asistentes de IA que “recuerdan” un archivo, justifican cada afirmación con una referencia y reducen mecánicamente las alucinaciones.
En última instancia, todo esto también significa menos VRAM para atender a más sesiones, menos fallas silenciosas y respuestas que pasan de ser una ayuda única a ser un componente confiable de un proceso de negocio.
En comparación con Qwen 3, Llama o modelos propietarios muy grandes, Granite 4.0 depende menos del «conocimiento enciclopédico» bruto que de la ejecución confiable de tareas comerciales (instrucciones, herramientas, RAG) al mejor costo por tarea. Los comentarios iniciales y las mediciones públicas muestran que algunos competidores mantienen la ventaja en las pruebas de conocimientos generales, multilingüe, matemáticas y programación, mientras que Granite gana en casos en el corazón de los flujos de trabajo agentes.
Datos, formación y transparencia
La familia Granite 4.0 está previamente entrenada en un corpus de aproximadamente 22,000 mil millones de tokens, combinando conjuntos de datos abiertos (DataComp-LM, GneissWeb, TxT360, Wikipedia) y datos orientados a usos comerciales, antes de la capacitación posterior que cubre lenguaje, código, matemáticas, multilingüe, seguridad, llamadas de herramientas y RAG.
Por el lado de la gobernanza, Granite se presenta como la primera familia de modelos abiertos certificados ISO/IEC 42001:2023 para el sistema de gestión de IA. Todos los puntos de control están firmados criptográficamente, un programa de recompensas por errores con HackerOne ofrece hasta 100.000 dólares e IBM ofrece una compensación «sin límite» en watsonx.ai por reclamaciones de propiedad intelectual relacionadas con el contenido generado.
Implementación y hoja de ruta
Los modelos están disponibles inmediatamente en watsonx.ai y a través de una gran red de proveedores o plataformas modelo como servicio: Hugging Face, Docker Hub, Kaggle, LM Studio, NVIDIA NIM, Replicate, Ollama y Dell hubs; La llegada a AWS SageMaker JumpStart y Azure AI Foundry también se anuncia como inminente. IBM dice que ha realizado varias optimizaciones para vLLM y Transformers HF (con trabajo en marcha en llama.cpp y MLX) y ha garantizado un amplio soporte de hardware, incluido el soporte para AMD Instinct MI300X y Qualcomm Hexagon NPU para acelerar la inferencia en el dispositivo.
IBM ya está planeando variantes «Thinking» optimizadas para razonamientos complejos para el otoño, así como tamaños «Medio» y «Nano» para ampliar el espectro de implementaciones. Sigue existiendo un desafío en el ecosistema: para trasladar los usos más allá de Transformers, se requerirán tiempos de ejecución “reforzados” tan fluidos por parte de NVIDIA como los de AMD, planos de costo por tarea publicados e integraciones profundas con los marcos de orquestación existentes. Mientras tanto, Granite 4.0 ofrece un camino pragmático para reducir el costo de la inferencia sin sacrificar la calidad donde más importa: en los sistemas gobernados y con herramientas de los centros de datos empresariales.
Lea también:
Pequeños modelos cada vez más inteligentes y capaces de razonar
El pequeño Granite 3.1 de IBM compite con modelos gigantes de IA
Con Phi-3, Microsoft mejora aún más sus modelos Gen AI de bolsillo
Copilot+ PC: Microsoft Mu, el micromodelo de IA que personaliza Windows 11
Microsoft lanza 2 modelos internos de IA y muestra su independencia de OpenAI
[

