Cloud

Microsoft presenta Maia-200, su nuevo acelerador interno de IA

Azure ocupa el segundo lugar. Después de lanzar recientemente su CPU interna de segunda generación «Cobalt 200», Microsoft presentó esta semana la segunda generación de su propio acelerador de inferencia de IA: el Maia 200. Y cuidado, es alucinante…

En la batalla por la supremacía de la infraestructura de IA, los hiperescaladores se han dado cuenta de que ya no pueden depender exclusivamente de Intel, AMD y Nvidia. Para liberarse de los márgenes y las limitaciones de suministro de estos gigantes de los semiconductores, a los gigantes de la Web les resulta rentable desarrollar sus propios chips. Una forma de diferenciar sus ofertas, optimizar sus infraestructuras y presionar a sus proveedores tradicionales.

Google abrió el camino en 2015 con sus TPU, cuya séptima generación (Ironwood), presentada a finales de 2025, muestra 4,6 PFLOPS en el FP8 y ahora impulsa más del 75% de los cálculos del modelo Gemini. Le siguió Amazon con la familia Trainium, cuya tercera generación logró 2,52 PFLOPS en el FP8 gracias al proceso de 3 nm de TSMC. En la misma línea, AWS fue la primera en fabricar sus propias CPU con su Graviton antes de ser imitada por Google y su CPU Axion.
Esta estrategia de integración vertical permitiría a los gigantes de la nube reducir su coste total de propiedad entre un 40 y un 65 % en comparación con las soluciones genéricas del mercado.

Azure fue el último en permanecer en este terreno. El hiperescalador presentó su primera generación de CPU (Cobalt-100) y acelerador de IA (Maia-100) en noviembre de 2023. Pero sus procesadores no estuvieron realmente disponibles para los clientes hasta octubre de 2024, ya que Microsoft priorizó sus necesidades internas.
En noviembre de 2025, Microsoft formalizó la llegada de su segunda CPU, la Cobalt 200, un potente chip ARM de 132 núcleos.

Esta semana, la editorial anuncia la llegada de su segunda generación de acelerador de IA: el Maia-200.

Un acelerador de IA verdaderamente poderoso

Presentado como el acelerador patentado más eficiente jamás implementado por un hiperescalador, está grabado en 3 nm en TSMC e incorpora más de 140 mil millones de transistores.
El nuevo silicio interno se distingue por una arquitectura completamente rediseñada para la inferencia a gran escala, con una ambición muy explícita”, mejorar la economía de la generación de tokens «. La batalla por la IA en la nube ya no se limita a batir récords, sino a ofrecer baja latencia y alto rendimiento, como era de esperar, al mejor costo y eficiencia energética, en centros de datos que ya están bajo estrés.

Los números hablan por sí solos: el Maia 200 ofrece más de 10 PFLOPS con precisión de 4 bits (FP4) y más de 5 PFLOPS con precisión de 8 bits (FP8), todo dentro de una envolvente térmica de 750 vatios. Microsoft afirma que el rendimiento del FP4 es tres veces mejor que el Trainium 3 de Amazon y que el poder del FP8 supera al IronWood TPU v7 de Google. El subsistema de memoria ha recibido especial atención, con 216 GB de HBM3e que ofrecen un ancho de banda de 7 TB/s, complementados con 272 MB de SRAM integrada para minimizar los viajes de ida y vuelta a la memoria externa. Un esfuerzo en la memoria que puede explicarse por el deseo de mantener las unidades de cálculo «activadas» para mejorar el rendimiento de los tokens, donde la inferencia rápidamente se vuelve más limitada por el flujo de datos que por la potencia de cálculo.

on chip innovation newon chip innovation new

La interconexión de redes constituye otra importante área de innovación. Cada chip integra un controlador de red (NIC) capaz de gestionar 2,8 TB/s de forma bidireccional, lo que permite conectar hasta 6.144 aceleradores dentro de un mismo dominio informático sin recurrir a conmutadores propietarios. Esta arquitectura de dos niveles, que combina enlaces directos entre grupos de cuatro chips y una red conmutada Ethernet estándar, tiene como objetivo optimizar la relación rendimiento-coste para cargas de trabajo de inferencia distribuida.

Maia scale up white 2Maia scale up white 2

Después de haber mantenido la discreción durante mucho tiempo sobre su silicio, Microsoft ahora se enfrenta a enfrentamientos directos. También es un mensaje contundente enviado a Nvidia y AMD: “no necesitamos tanto sus aceleradores, nosotros también podemos ser eficientes”.
Desde el punto de vista operativo, los primeros sistemas Maia 200 ya están implementados en el centro de datos de Microsoft ubicado cerca de Des Moines, Iowa. Pronto le seguirá la región US West 3, cerca de Phoenix, Arizona. Estas infraestructuras se benefician de un sistema de refrigeración líquida de segunda generación, diseñado para racks de alta densidad.

El despliegue ya ha comenzado masivamente

Diseñados para funcionar en arquitecturas híbridas que combinan GPU de Nvidia y Maia-200, los primeros sistemas con el nuevo acelerador ya están impulsando el trabajo del equipo de Superinteligencia de Microsoft, acelerando Microsoft Foundry y brindando soporte a Copilot, e incluso son compatibles con los últimos modelos GPT-5.2 de OpenAI en la infraestructura heterogénea de Azure.

Maia200 Spread blackMaia200 Spread black

Además, Microsoft parece esta vez más decidido a abrir sus aceleradores Maia-200 a sus clientes, lo que no fue realmente el caso de la primera generación. Para los desarrolladores, el editor ofrece una vista previa de un kit de desarrollo (SDK) que incluye un compilador Triton, integración con PyTorch, bibliotecas de kernel optimizadas y acceso al lenguaje de programación de bajo nivel NPL. El objetivo declarado es permitir la migración fluida de modelos entre diferentes arquitecturas de hardware.

maia stack newmaia stack new

En resumen, la IA sigue siendo la principal prioridad para Microsoft y Azure, y este chip Maia-200 parece estar en camino de ser implementado de forma masiva y global en los centros de datos del grupo.

Lea también:

Cobalt‑200: Microsoft anuncia su segundo procesador interno, con 132 núcleos Arm

AWS Re:Invent 2025: Amazon presenta Trainium3 y ya anuncia Trainium4

Google formaliza la disponibilidad en su nube de su TPU IronWood, maestro de la inferencia a gran escala

Google lanza sus procesadores Axion ya en disponibilidad general

Qualcomm quiere su lugar en los centros de datos de IA

[

Related posts
Cloud

¡Cloud First se vuelve más selectivo!

¿Qué hubiera pasado si “Cloud First” hubiera llegado a su fin? Si bien casi una cuarta parte…
Read more
Cloud

Azure Logic Apps Automation quiere alinear a los agentes de IA

Con Azure Logic Apps Automation, Microsoft quiere convertir la automatización empresarial en un…
Read more
Cloud

Tsuga confía en BYOC para reinventar la observabilidad

En un momento en el que los volúmenes de registros, métricas y rastreos se están disparando, la…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *