Cloud

AWS presenta Trainium3 y anuncia Trainium4

AWS está fortaleciendo su nube para IA con la disponibilidad masiva de su Trainium3, un chip de 3 nm diseñado para IA a gran escala, y ya está preparando un Trainium4. Con el deseo no sólo de reducir sus propios costes de formación e inferencia en IA, sino también de ofrecer a los clientes soluciones capaces de competir con Nvidia en términos de “coste/rendimiento”.

AWS lanzó esta tarde su importante conferencia anual AWS Re:Invent con una gran cantidad de anuncios sobre IA, particularmente agentes. Volveremos mañana y el resto de la semana sobre los múltiples anuncios que el hiperescalador ha iniciado y seguirá haciendo durante los 4 días de su evento insignia. ¡Pero comenzamos esta tarde con el anuncio no de un nuevo chip sino de dos!

AWS anuncia la inminente llegada de su acelerador Trainium3 pero también ya levanta el velo sobre su sucesor, el Trainium4.

A la escala de los hiperescaladores, el cálculo es muy simple: cada punto porcentual ganado en el costo por token generado o por hora de capacitación se traduce en cientos de millones de dólares durante la vida útil de una generación de chip. Al desarrollar sus propios aceleradores, las nubes pueden optimizar toda la cadena –desde el diseño del chip hasta la capa de software– y capturar parte del valor que actualmente capturan Nvidia y, en menor medida, AMD.

Esta integración vertical permite diseñar chips adaptados a sus cargas de trabajo reales, a sus frameworks de software (Neuron en AWS, XLA/TPU en Google, etc.) y a su modelo económico: instancia EC2, servicio gestionado tipo Bedrock o ahora AI Factories on-prem. También ofrece una importante influencia de negociación frente a Nvidia, al tiempo que deja las GPU a la vanguardia para las cargas de trabajo más exigentes o para los clientes que valoran el ecosistema CUDA. AWS también ha anunciado nuevas máquinas P6e basadas en superchips Nvidia GB200/GB300 (que combinan CPU ARM y GPU Blackwell) y máquinas P6 basadas en GPU B200/B300.

AWS fue pionero en el enfoque de “chips caseros para mi nube”. Después de Graviton en la CPU general, la nube de Amazon ya lleva varios años introduciendo Inferentia para la inferencia y luego Trainium para el entrenamiento de modelos cada vez más masivos.
Estos chips “internos” ya equipan instancias EC2 especializadas (Trn1, Trn2, etc.) y, sobre todo, los backends de servicios gestionados como Amazon Bedrock. Al mismo tiempo, con el Proyecto Rainier, AWS puso en producción un clúster de casi 500.000 Trainium2 para Anthropic, anunciado como uno de los superordenadores de IA más grandes del mundo y cinco veces más grande que la infraestructura utilizada para la generación anterior de modelos Anthropic. AWS ahora indica que ha implementado más de un millón de procesadores Trainium y afirma venderlos “tan pronto como salgan de fábrica”.

Sobre todo porque estas patatas fritas caseras no están reservadas para uso doméstico. También buscan ofrecer a los clientes de AWS la mejor relación “precio-rendimiento” del mercado.

Con su nuevo Trainium3, AWS quiere ofrecer la mejor relación costo/rendimiento para entrenamiento e inferencia a gran escala, y las GPU de Nvidia obviamente permanecen disponibles para cargas en las que mantienen una ventaja o para equipos que han estandarizado su cadena de herramientas en ellas.

Trainium3: chip premier de 3 nm de AWS

Trainium 3 es el primer chip de IA de AWS grabado en 3 nm. Está en el corazón de los nuevos Amazon EC2 Trn3 UltraServers, que constituyen el componente básico de la generación actual de infraestructuras de IA en la nube (ver más abajo).

En comparación con Trainium2, AWS anuncia para Trainium3:

* hasta 4,4 veces más potencia informática,
* a eficiencia energética multiplicada por cuatro (x4),
* preso cuatro veces más ancho de banda de memoria,
* y Latencia de comunicación dividida por cuatro entre chips..

about amazon hero aws trainium 3about amazon hero aws trainium 3

Trainium para inferencia: uso ya masivo

Al contrario de lo que sugiere la marca, Trainium ya no es un chip limitado al entrenamiento. AWS insiste en que Trainium3 también está diseñado como un motor de inferencia líder y está empezando a detallar algunos casos de uso.

AWS explica que más de la mitad de la capacidad de inferencia de Amazon Bedrock, la plataforma de modelo básico gestionado de AWS (Model as a Service), ya se ejecuta en chips Trainium. Trainium3 fue diseñado desde el principio para ambos usos (entrenamiento E inferencia). Bedrock ya está atendiendo cargas de trabajo de producción en Trainium3, una señal de que el chip ya no es un prototipo sino un ladrillo que ya está ampliamente implementado.

Según AWS, clientes como Anthropic, Karakuri, Metagenomi, Neto.ai, Ricoh y Splashmusic han reducido sus costos de capacitación e inferencia hasta en un 50% al migrar a Trainium. El laboratorio Decart, especializado en vídeo generativo en tiempo real, por su parte, afirma que la inferencia de vídeo es cuatro veces más rápida que con las GPU convencionales, con un coste reducido a la mitad, lo que abre el camino a experiencias interactivas que todavía eran difíciles de financiar hace un año.

UltraServers Trn3: la respuesta de AWS a los superpods de GPU

Tener un potente acelerador de IA es bueno. Es mejor ponerlo a disposición de los clientes. Para ello, necesitas máquinas que estén equipadas con ello. EL Trainium3 UltraServidores No son servidores “simples” basados ​​en aceleradores: AWS habla de un sistema integrado verticalmente, desde el chip a la red, pasando por la pila de software.

Garman Keynote 1Garman Keynote 1

Cada » Trn3 UltraServidor » puede transportar hasta 144 chips Trainium 3, para alcanzar 362 PFLOPS FP8 en un único sistema integrado. AWS destaca las optimizaciones arquitectónicas (nuevos circuitos de interconexión, jerarquía de memoria revisada) y, sobre todo, un nuevo componente de red, el NeuronSwitch-v1, que duplica el ancho de banda interno, junto con un Neuron Fabric que reduce la latencia entre chips por debajo de los 10 microsegundos. Estos bloques luego se pueden agregar en EC2. UltraClusters 3.0 que llegan a 1 millón de chips Trainium3 interconectados, ¡diez veces más que la generación anterior!

En concreto, esto permite reducir los tiempos de entrenamiento de los modelos abiertos del tipo GPT-OSS hasta en un factor de tres, dividiendo al mismo tiempo el tiempo de respuesta de inferencia por cuatro en comparación con la generación anterior de Trainium2 UltraServers.

Suficiente para que sus equipos de TI acorten drásticamente los ciclos de experimentación en grandes modelos internos y absorban los picos de tráfico de IA (chatbots, agentes, búsqueda semántica, vídeo generativo) con un número reducido de servidores y, por tanto, un TCO más controlado.

En términos de posicionamiento, estos UltraServers juegan en la misma liga que los superpods de Nvidia (GB200/GB300 NVL72) o los pods de TPU de Google: potencia de fuego destinada a modelos de tokens multimillonarios, MoE y arquitecturas agentes que requieren intercambios permanentes de datos entre miles de trabajadores.

Por supuesto, AWS sigue siendo un gran cliente de Nvidia, pero quiere hacer de Trainium 3 «la» referencia en términos de precio-rendimiento en grandes sesiones de capacitación e inferencia masiva. Y el hiperescalador parece muy motivado para mejorar su competitividad.

Trainium4: una hoja de ruta ya alineada con la próxima generación

Si bien Trainium3 recién está entrando en disponibilidad general, AWS ya está optando por brindar visibilidad en Trainium4. El futuro chip se anuncia con al menos 6 veces más rendimiento en el FP4hasta 3 veces más rendimiento del 8PM, cuatro veces más ancho de banda de memoria y capacidad duplicada de HBM en comparación con Trainium3.

AWS también propone el objetivo de duplicar la eficiencia energética, algo que dista mucho de ser anecdótico en el caso de clusters de varios cientos de megavatios.

Sobre todo, Trainium4 estará estrechamente acoplado al ecosistema de Nvidia gracias a la integración de NVLink Fusion, que permite conectar GPU Nvidia, CPU Trainium4 y Graviton a muy alta velocidad dentro de los racks MGX comunes. Un enfoque sorprendente pero no necesariamente único. Después de todo, las «hipercomputadoras AI» de Google ya albergan una combinación de GPU Nvidia y TPU internas.

Una estrategia comprometida con el silicio

Visto desde un departamento de TI, el anuncio de Trainium3/Trainium4 no es sólo un tema de bancos. Marca un cambio: las grandes nubes ya no se contentan con comprar GPU, sino que están construyendo su propia hoja de ruta del silicio, sincronizada con sus hojas de ruta de servicios gestionados y con importantes contratos de “IA a escala” (Antrópico, Humanitario/HUMANO, grandes ministerios, operadores de telecomunicaciones, etc.).

Para AWS, Trainium3 UltraServers debería convertirse en la opción natural para cualquier cosa que se parezca a la capacitación del modelo básico o la inferencia intensiva, ya sea en Bedrock, en SageMaker o en entornos administrados como AI Factory. Al anunciar Trainium4, AWS también indica a sus clientes que no se detendrá ante una generación oportunista: la hoja de ruta es multigeneracional, con una integración cada vez mayor en las arquitecturas de Nvidia (NVLink) y una variación tanto en la nube pública como en las instalaciones.

Para los departamentos de TI, el desafío ahora es integrar este parámetro en sus estrategias de IA: elección de plataformas modelo, arbitraje entre GPU y ASIC interno, trayectoria de soberanía y localización de datos, y… dependencia a largo plazo de pilas cada vez más integradas, desde el chip hasta el servicio gestionado.

Lea también:

Acuerdo inesperado en tecnología: OpenAI conecta ChatGPT a las GPU de AWS

Google formaliza la disponibilidad en su nube de su TPU IronWood, maestro de la inferencia a gran escala

Cobalt‑200: Microsoft anuncia su segundo procesador interno, con 132 núcleos Arm

“Amazon Bedrock es un supermercado de modelos de IA disponibles sin servidor”

CloudWeek 2025: AWS se centra en la atención al cliente para democratizar la nube sostenible

[

Related posts
Cloud

¡Cloud First se vuelve más selectivo!

¿Qué hubiera pasado si “Cloud First” hubiera llegado a su fin? Si bien casi una cuarta parte…
Read more
Cloud

Azure Logic Apps Automation quiere alinear a los agentes de IA

Con Azure Logic Apps Automation, Microsoft quiere convertir la automatización empresarial en un…
Read more
Cloud

Tsuga confía en BYOC para reinventar la observabilidad

En un momento en el que los volúmenes de registros, métricas y rastreos se están disparando, la…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *