Con IronWood, Google Cloud marca un avance tecnológico y estratégico en la arquitectura de los aceleradores de IA. Diseñado para inferencias a muy gran escala, este TPU de séptima generación combina potencia informática, eficiencia energética e integración de software dentro de la hipercomputadora AI. Un avance que redefine el rendimiento de la nube de inferencia y ejerce una fuerte presión sobre la competencia.
Durante más de una década, las Unidades de Procesamiento Tensorial (TPU) de Google han impulsado las cargas de trabajo de capacitación y servicio de sus modelos emblemáticos de IA, antes de ofrecerse a los clientes a través de Google Cloud y Gemini. Están en el centro de los avances tecnológicos de Google AI y Google Deepmind, como Transformers. Los TPU se han utilizado para entrenar y hoy en día proporcionan inferencias para los modelos Gemini, Veo, Imagen e incluso Claude de Anthropic.
Y ahora, Google Cloud pisa el acelerador. El hiperescalador anuncia la disponibilidad de su última generación de TPU, “IronWood”, presentada en mayo pasado en Google Cloud NEXT 2025 y hasta ahora reservada para uso interno de Deepmind y Google.
IronWood, un TPU diseñado para la era de la inferencia
IronWood es la séptima generación de TPU y la primera diseñada explícitamente para inferencias a muy gran escala. Cada chip alcanza un pico de 4.614 TFLOPS en el 8PM y se embarca 192 GB de RAM HBM3e con un ancho de banda de memoria de 7,37 TB/s.
Sobre todo, Google anuncia una duplicación del “rendimiento por vatio” respecto a Trillium (TPU v6e) y casi 30 veces más eficiencia energética respecto al primer Cloud TPU de 2018.
En otras palabras, IronWood no sólo es más eficiente y ahorra energía que los TPU anteriores, sino que también es terriblemente más eficiente, como se resume en el siguiente gráfico:
Por lo tanto, todo el diseño de IronWood tiene como objetivo minimizar el movimiento de datos y la latencia dentro del chip, al tiempo que admite comunicaciones sincrónicas a escala de un clúster completo para garantizar una inferencia a gran escala de «modelos pensantes» como Gemini 2.5 Pro. “ Ironwood es nuestro TPU más potente, capaz y eficiente, creado para modelos que piensan e infieren a escala. » explica Google.
Los IronWood TPU Pods traspasan los límites
Pero en Google, el chip TPU es sólo una parte de la magia. Nunca se utiliza solo sino dentro de lo que los ingenieros de Google Cloud llaman un “TPU POD”. Es un bastidor que alberga un enorme grupo de aceleradores de TPU. ¡Y cada nueva generación de TPU da origen a una nueva generación de Pods!
Así, un pod Ironwood ensambla hasta 9.216 chips IronWood (existe una versión mini-POD de 256 chips) en un dominio informático compartido con 1,77 PB de RAM HBM3e basado en una interconexión «interna» llamada Inter-Chip Interconnect (ICI) que ofrece un ancho de banda de 9,6 Tb/s agregados a nivel de pod. La arquitectura toroidal 3D conecta chips a través de ICI para formar un «gran sistema» donde el rendimiento entre chips y la memoria de vista casi compartida limitan los cuellos de botella.
Un conjunto de este tipo da como resultado un rendimiento de inferencia nunca antes visto. Un solo IronWood Pod proporciona un rendimiento de 42,5 ExaFLOPS y el 8PM.
A modo de comparación, el rack NVL72 GB300 de Nvidia no supera los 0,36 ExaFLOPS.
Hipercomputadora AI: ensamblaje más allá de las cápsulas
También se pretende que Ironwood se convierta pronto en la potencia de la hipercomputadora AI, la plataforma unificada de Google que agrega computación, almacenamiento, redes y software bajo una única capa de administración, y que puede combinar pods en grupos de cientos de miles de TPU. Esta plataforma es mucho más que un gigagrupo de Pods y TPU. Es una plataforma completa donde el hardware y el software se diseñan juntos. Se basa, por un lado, en los IronWood Pods pero también en las GPU de Nvidia y, por otro lado, en una arquitectura de software compuesta por múltiples bloques complementarios. El software Caminos permite distribuir los cálculos en miles de chips al mismo tiempo. la herramienta Texto máximo ayuda a ajustar los modelos de lenguaje (ajuste fino) o entrenarlos mediante prueba y error (aprendizaje por refuerzo, RL). motor lz vllm está especializado aquí para ejecutar modelos de lenguaje grandes de manera óptima en IronWood Pods. Finalmente, el Puerta de enlace de inferencia de GKE optimiza la forma en que se procesan las solicitudes en este conjunto complejo que es una hipercomputadora de IA. Este último reduce el tiempo de espera antes de la primera respuesta (TTFT, tiempo hasta la primera ficha) en casi un 96% y reduce los costos de servicio en aproximadamente un 30%. En otras palabras, los usuarios obtienen respuestas más rápido y las empresas pagan menos por producirlas.
Según IDC, la adopción de una hipercomputadora con IA en IronWood ofrece un retorno de la inversión promedio en tres años del 353 %, un 28 % menos de gasto en TI y un 55 % más de eficiencia operativa para los clientes.
El valor de la hipercomputadora radica en la continuidad de un extremo a otro: las CPU Axion (Armv9) organizan la ingestión y las API, las GPU Nvidia completan los cálculos de entrenamiento de acuerdo con las necesidades del software y los pods de TPU garantizan una inferencia de «alto rendimiento», todo bajo una estructura óptica reconfigurable y una pila administrada para SLO sostenibles.
En última instancia, esta disponibilidad de IronWood ejerce una fuerte presión sobre la competencia (AWS con sus chips Inferencia2 y Azure con su Maia-100), pero también sobre el líder en chips AI, Nvidia. Google también envía una señal clara al mercado recordando que la inferencia a muy gran escala es el quid de la cuestión y que su nube está ahora súper armada en este ámbito. Los desafíos económicos y operativos son importantes. Reducir el costo por solicitud es ahora una preocupación importante para todos los CIO… y todas las nuevas empresas de IA. Anthropic también acaba de reservar el acceso a hasta 1 millón de TPU para satisfacer sus necesidades de inferencia de Claude AI.
<
Lea también:
Google Cloud Next'25: Ironwood TPU, el nuevo acelerador de IA de Google, es realmente sorprendente…
Gemini Enterprise y agentes de IA: Google Cloud sitúa la inteligencia autónoma en el centro del trabajo
Google Cloud lanza Multi-Cluster Orchestrator para la gestión de carga de Kubernetes en varias regiones
Inteligencia artificial en busca de aceleradores GPU y NPU
[


