Con ocho variantes y una arquitectura híbrida diseñada para la optimización de los costos y el razonamiento, la familia de los modelos Qwen 3 en Alibaba reafirma la ambición tecnológica china frente a los gigantes de la IA occidental.
Desde 2023, la familia de los modelos abiertos de IA «Qwen» de Alibaba se ha establecido como la alternativa china más creíble a los modelos occidentales: Qwen 1 había sentado las bases para un enfoque de «peso abierto» y Qwen 2 había demostrado que realmente era necesario contar con la innovación china.
Esta semana, Alibaba ha presentado Qwen 3. Un desarrollo importante de sus modelos que ahora escucha no solo Shadow Deepseek R1 (mientras que Deepseek R2 parece tener que llegar en los próximos días), sino que también compite con los propietarios de Google y OpenAi por razonamiento de AIS.
La nueva generación está disponible en ocho variantes, de 0.6 a 235 mil millones de parámetros. Los seis modelos «densos» y dos modelos de mezcla de expertos (MOE) se publican bajo la licencia Apache 2.0 en abrazos y github. Lance Iron, QWEN3-235B-A22B (235 mil millones de parámetros pero 22 mil millones activados simultáneamente gracias al enfoque MOE), aún no se puede descargar, pero sirve como un escaparate; La versión más grande que realmente está disponible hoy es la muy universal QWEN3-32B.
Alibaba insiste en la noción de modelo «híbrido». Cada qwen3 se alterna a pedido entre un modo de «pensamiento», que desenrolla una cadena de razonamiento completa y un modo de «no pensamiento» para respuestas expeditas. » Hemos integrado fluidamente los modos de reflexión y no reflexión, ofreciendo a los usuarios la posibilidad de controlar el presupuesto de reflexión «Explica al equipo en su puesto oficial. La lógica del MOE, más económica en recursos, completa este fin de los costos de la inferencia.
Bajo el capó, la fase previa a la capacitación se ha más que duplicado: 36,000 mil millones de tokens, de 119 idiomas, enriquecidos por el código y las matemáticas orientadas al contenido sintético. La ventana de contexto se extiende a 32,000 tokens. Resultado: un denso QWEN3-8B ahora compite con el antiguo Qwen2.5-14b, y el MOE QWEN3-30B-A3B obtiene puntajes comparables a un denso de la misma generación diez veces más pesado.
En el lado de los puntos de referencia, QWEN3-235B-A22B es fácil de liderar a sus competidores de «peso abierto» como Deepseek V3 y Llama-4 en todos los puntos de referencia. Pero también compite con OpenAI O3 y Gemini 2.5 Pro incluso que las superan en ciertas pruebas como Codefoces. Y la versión «Qwen 32b» supera a OpenAI O3-Mini en LiveBench. Las pruebas internas también confirman habilidades sólidas de «llamadas de herramientas», una capacidad esencial para la orquestación de flujos de trabajo, la automatización de TI y la era de los agentes de IA.
« QWEN3 representa un paso significativo en nuestro viaje hacia la inteligencia artificial general (IAG) y la inteligencia artificial superinteligente (IAS). Al desarrollar tanto el aprendizaje previo y el fortalecimiento del aprendizaje (AR), hemos alcanzado niveles más altos de inteligencia »Considere los gerentes de proyecto en Alibaba antes de agregar ahora sus esfuerzos a la frugalidad de la IA, el razonamiento a largo plazo, el aumento en la ventana contextual, la expansión de los métodos. » Nuestra próxima iteración promete traer avances significativos al trabajo y la vida de cada uno Ya lo prometen.
Leer también:
Alibaba lanza dos nuevos modelos IA con razonamiento avanzado para competir
Después de Deepseek R1, Grok 3 nuevamente plantea la cuestión de la confianza en la IA
Deepseek R1, el modelo chino de código abierto IA que desata pasiones [MAJ]
Bitnet B1.58, LLM «1 bit» de Microsoft Research para una IA frugal
Meta revela Llama 4, nueva generación de IA multimodal
[


