Aplicaciones

QWEN3, Agentes GUI et WAN2.2-S2V

Desde el cálculo razonado de Qwen3 hasta los avatares animados de wan2.2-s2v, Alibaba multiplica los avances que confirman el giro del grupo hacia la inteligencia artificial. Y para ganar mejor, el grupo descansa toda su estrategia en una apertura de código abierto que lo sirve como una palanca para desafiar la supremacía estadounidense.

Llevada por una ola de innovaciones e inversiones masivas, Alibaba ahora está experimentando efervescencia real en torno a la inteligencia artificial, que se destaca como el motor central de su crecimiento. El grupo chino, percibido durante mucho tiempo como un gigante de comercio electrónico, ahora ve sus resultados financieros impulsados ​​por el deslumbrante boom en sus actividades relacionadas con la IA. Los ingresos de sus productos y servicios en esta área tienen una progresión de tres dígitos, mientras que su división en la nube, estrechamente vinculada a estas tecnologías, recientemente aumentó un 26 %, superando las expectativas de los analistas.

El CEO del grupo, Eddie Wu, recientemente recordó que elInteligencia artificial general (AG) Ahora era el objetivo principal de la compañía, su grupo invirtió masivamente en modelos de idiomas, servicios de inteligencia artificial y herramientas como la generación de videos de código abierto. El grupo ha formalizado una inversión masiva que planea dedicar más de 45 mil millones de euros a IA durante tres años.

Ya conocida por su serie LLM publicada en Open Source Qwen, Alibaba ha diversificado su I + D en IA y anunció estas varias innovaciones importantes que comienzan con nuevos modelos de razonamiento QWEN3, nuevas herramientas de agentes, una espectacular modelo de generación de videos WAN2.2-S2V e incluso estarían diseñando sus propios aceleradores de IA Maison para obtener NVIDIA y limitaciones americanas. Qué reposicionar al grupo como un jugador clave en infraestructura tecnológica e innovación de IA en China.

Qwen gana en el razonamiento

Qwen3 235B A22B Thinking 2507 qwen ai model reasoning benchmarks alibaba 1024x576 1Qwen3 235B A22B Thinking 2507 qwen ai model reasoning benchmarks alibaba 1024x576 1Si el mundo occidental considera fácilmente los modelos de meta de meta de código abierto de Meta como referencias, el mundo italiano asiático usa otra referencia: Qwen. Bajo este nombre, hay una familia completa de modelos de idiomas desarrollados en código abierto por Alibaba. Sacudido por el éxito e interés generado por Deepseek, Alibaba recientemente puso las bocados dobles para hacerse cargo del liderazgo con la generación QWEN 3.
Lanzado hace unos días, QWEN3-235B-A22B-Pensar 25507 es una nueva variante del modelo fronterizo de Alibaba con razonamiento avanzado. Este modelo, de 235 mil millones de parámetros, pero que activa solo unos 22 mil millones, ambos gracias a una mezcla de arquitectura de expertos, se distingue por su rendimiento lógico excepcional, matemáticas complejas, ciencias avanzadas y codificación. Obtuvo notablemente puntajes de 92.3 en AIME25 y 74.1 en LivecodeBench V6, superando así los estándares de los modelos de código abierto en estas áreas exigentes.

Una de sus principales ventajas radica en su capacidad para lidiar con grandes volúmenes de información, con una longitud de contexto nativo de 262,144 tokens. Disponible en abrazar la cara, el modelo se puede implementar a través de herramientas como SGLANG o VLLM, y está efectivamente integrado con la palabra de ramas QWEN-agent para explotar sus habilidades en la llamada de herramientas. Se alienta a los desarrolladores a formular instrucciones específicas, como «razonamiento paso a paso», para maximizar la calidad de las respuestas. Este lanzamiento marca un avance significativo en el mundo de los grandes modelos de código abierto y en la accesibilidad de la IA de razonamiento de alto nivel, compitiendo con los modelos patentados más eficientes.

Alibaba en la era de la agencia

infograp 1200x700 1 1024x597 1infograp 1200x700 1 1024x597 1El equipo Qwen de Alibaba también presentó otros dos avances importantes en la automatización de interfaces gráficas: GUI-OWN y Mobile-Agent-V3. Estos agentes inteligentes están diseñados para comprender, razonar e interactuar con entornos de chicos complejos, ya sea en dispositivos móviles o de escritorio. GUI-OWL se basa en el modelo QWEN2.5-VL, enriquecido por una capacitación intensiva en datos de interacción gráfica, y se integra en una única percepción de red neuronal, planificación y ejecución de acciones. Mobile-Agent-V3, por otro lado, coordina varios agentes especializados para administrar tareas largas y de varias etapas, con una capacidad de reflexión y memoria contextual.

Su método de aprendizaje se basa en un sistema que crea automáticamente sus propios datos. Los agentes prueban acciones en entornos virtuales, observan los resultados y aprenden de sus éxitos o sus errores. Este proceso se repite y refina permanentemente gracias a un análisis preciso de cada paso, lo que permite que los agentes se vuelvan cada vez más efectivos.

Según los investigadores chinos, el rendimiento de estos modelos supera los de las soluciones de código abierto y los propietarios existentes, en particular en la ubicación de los elementos de IU, la toma de decisiones y la ejecución de tareas complejas. Finalmente, su integración en sistemas reales se ve facilitada por la compatibilidad multiplataforma y la transparencia en el razonamiento, abriendo el camino a los agentes de la GUI (en la línea del uso de la computadora y Claude para Chrome) verdaderamente autónomo y versátil.

Wan2.2-s2v transforma una foto de avatar animado

Finalmente, esta semana, Alibaba también creó la sorpresa al revelar wan2.2-s2v (discurso a video), un modelo IA de código abierto diseñado para generar avatares humanos animados a partir de una imagen simple y un archivo de audio.

WAN2.2-S2V es parte de los modelos de generación de videos WAN2.2 de Alibaba. Su función principal es transformar las fotografías de retratos en avatares animados de la calidad del cine, capaz de hablar, cantar o adoptar comportamientos complejos. La tecnología se basa en una animación guiada por audio para sincronizar los movimientos de los labios y las expresiones faciales, al tiempo que integra instrucciones textuales (rápidas) para dirigir los movimientos globales del cuerpo y ciertos elementos del entorno.

https://www.youtube.com/watch?v=9nva0uro6u8<

A diferencia de las soluciones tradicionales de tipo de «cabeza parlante», este modelo combina el control de los movimientos globales por el texto y los micro-movimientos refinados por el audio. Este enfoque híbrido hace posible generar animaciones más naturales y expresivas, incluso en escenas que involucran a varios personajes. El sistema puede animar una amplia gama de avatares, desde figuras humanas realistas hasta dibujos animados o estilizados.

A nivel técnico, WAN2.2-S2V introduce un avance notable en el tratamiento de secuencias largas. El modelo comprime las imágenes anteriores de un video en una representación latente compacta, lo que reduce considerablemente la carga de cálculo. Esta optimización garantiza una mejor estabilidad y consistencia para la producción de videos a largo plazo, un gran desafío en el campo de la generación de contenido animado.

Para garantizar su rendimiento, el modelo se vio atraído por una gran base de datos audiovisual constituida específicamente por los equipos de investigación de Alibaba para escenarios de producción de cine y televisión. Gracias a un enfoque de entrenamiento de resolución múltiple, la herramienta ofrece una buena flexibilidad de producción, con resoluciones de salida de 480p o 720p y compatibilidad con varios formatos. La generación se puede hacer en modo de retrato para el contenido destinado a teléfonos inteligentes y redes sociales, pero también en modo paisajista para usos más tradicionales y profesionales.

En la continuación de su estrategia de código abierto, después de los lanzamientos de WAN2.1 y WAN2.2 a principios de este año, Alibaba Cloud hizo que WAN2.2-S2V sea accesible para abrazar las plataformas de cara y Github, así como en su propia comunidad de modelos. La serie WAN Model ya ha registrado más de 6.9 millones de descargas, testificando el interés de la comunidad en estas tecnologías.

¿Un chip casero?

Según múltiples fuentes estadounidenses y chinas, Alibaba también desarrolla un nuevo acelerador de IA para obtener autonomía tecnológica, competir con Nvidia y deshacerse de las restricciones estadounidenses que le prohíbe el acceso a las mejores pulgas de IA como Blackwell. Se recordará en aprobación que después del anuncio de las pulgas NVIDIA H20 destinadas al mercado chino bajo la aprobación del gobierno de Trump, Beijing pidió a sus compañías que dejaran de comprar pulgas estadounidenses por razones de seguridad.

Esta no es la primera vez que el grupo chino ha desarrollado sus propios procesadores como Yitian en Tecnología ARM y Xuantie en Tecnología RISC-V.
Pero el nuevo chip desarrollado por la I + D de Alibaba Cloud sería más versátil que sus modelos anteriores (Hanguang 800). Está diseñado para la inferencia en lugar de capacitar a los modelos de IA, y no debe venderse directamente: los clientes podrán alquilar energía de cálculo a través de la infraestructura en la nube del grupo.
Según la información que se filtró, el chip, al menos parcialmente, compatible con el ecosistema NVIDIA y las bibliotecas CUDA.

Deberíamos obtener más información con motivo de la principal conferencia Apsara 2025 (la gran reunión tecnológica anual organizada por Alibaba Cloud) en Hangzhou, del 24 al 26 de septiembre.

Leer también:

Con Qwen 3, Alibaba ha destronado a Meta y Deepseek en el universo de los modelos abiertos IA

Alibaba lanza dos nuevos modelos IA con razonamiento avanzado para competir

Meta -revela la película Gen, su modelo de video competitivo de Operai Sora

Google Gemini 2.5 Imagen flash: un nuevo modelo dotado para retocar

Sora, el modelo de Video IA de Operai Video está disponible en Francia y Europa

Google I/O '25: Veo 3, Imagen 4, Lyria 2 … ¡AI más creativo que nunca!

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *