Aplicaciones

Deepseek r1, el modelo IA que desata pasiones

Con Deepseek-R1, un modelo de razonamiento, China demuestra una vez más que una IA eficiente y de código abierto puede competir con los modelos de propietarios de Best Western, a un costo más bajo. Y ese es mucho debate todo el ecosistema ECA, especialmente en los Estados Unidos.

Deepseek es una empresa china especializada en inteligencia artificial (IA), fundada en 2023 por Liang Wenfeng, ex administrador de fondos de High-Flyer Hedest. Desde sus inicios, Deepseek se distinguió por su compromiso con el código abierto, haciendo que sus modelos sean accesibles para la comunidad mundial. Entre sus logros notables están Veloz de profundidadun modelo dedicado al código auto -compulsor, y Deepseek-v3Un modelo de lenguaje a gran escala con 671 mil millones de parámetros, que compiten con los modelos LLM más avanzados en el mercado a partir de LLAMA 3.1 405B.

El 20 de enero de 2025, Deepseek formalizó el lanzamiento de Deepseek-r1Un modelo diseñado para sobresalir en tareas que requieren inferencia lógica, resolución de problemas matemáticos y toma de decisiones de tiempo real. En otras palabras, Deepseek R1 es parte de la nueva tendencia de modelos de razonamiento como OpenAI O1 o Gemini 2.0 Thinking Experimental.

Deepseek r1, sin embargo, se distingue de los dos anteriores por su publicación en código abierto, pero también por una mayor capacidad para proporcionar explicaciones paso a paso, mejorando así la transparencia y la comprensión de sus procesos de toma de decisiones.

En el corazón de Deepseek R1

Técnicamente, Deepseek R1 implementa tecnologías ya experimentadas por otros y las combina con su propia salsa. Por lo tanto, el modelo usa Arquitectura de moe (Mezcla de expertos) combinando varios modelos especializados asociados con Una técnica de aprendizaje de fortalecimiento.

El modelo explica así 671 mil millones de parámetros 37 mil millones de los cuales se activan con cada pasaje (técnica MOE). Su base de entrenamiento incluida 14,800 mil millones de tokens. Su ventana de contexto es 128 000 tokens.
El modelo habría requerido 2.79 millones de horas de GPU NVIDIA H800 (Versión ardiente del H100) para su entrenamiento (en un clúster formado por 2048 GPU).

Según las pruebas de referencia, Deepseek-R1 supera los principales modelos de la industria, como el O1 de OpenAI, en varios puntos de referencia de las matemáticas y el razonamiento.

>> como 2024 : 79.8% (comparable a OpenAI-O1 con 79.2%)
>> MATH-500 : 97,3% (Openai-O1: 96,4%)
>> LivecodeBench : 65,9 (Openai-O1: 63,4)
>> CodeForces-R : 2029 (OpenAI-O1: 2061)
>> mmlu : 90,8% (Openai-O1: 91,8%)

¿Hasta el punto de ser realmente superior al uso en «O1»? No necesariamente. Estos modelos tienden cada vez más furiosamente a ser entrenados para brillar en puntos de referencia y no necesariamente ser tan relevantes fuera de estos contextos de comparación. Además, Openai O1 generalmente obtiene puntajes mucho mejores que DS R1 en las pruebas de expresión en inglés. Y en ciertos testimonios, en uso en particular en la codificación, «R1» estaría más cerca de un «GPT 3.5» que a un «OpenAi O1». Tampoco perderemos de vista, que «OpenAi O1» es significativamente inferior al modelo «OpenAI O3» por el momento no disponible, pero que ya ha sido evaluado en varios puntos de referencia por socios de la startup estadounidense.

Deepseek R1, agitador público n ° 1

El hecho es que Deepseek-R1 agita considerablemente el microcosmos de la IA y especialmente en una América que acaba de anunciar una inversión durante 4 años (que queda por hacer) de $ 500 mil millones.

Porque Deepseek-R1 sacude ciertas convicciones estadounidenses, comenzando con la que los Estados Unidos dominan la IA fuera del alcance de otros países. Las nuevas empresas chinas no solo pueden competir, sino también superar a sus homólogos occidentales. Es solo un descubrimiento para los estadounidenses. Con presupuestos mucho más bajos que OpenAi e incluso muy probablemente en Deepseek, nuestro joven Pousse Mistral ha sido el mismo durante 1 año, con también modelos de código abierto.

Luego, porque Deepseek dice que el desarrollo de «R1» fue infinitamente menos costoso que el de OpenAi O1 o Gemini 2.0 TE. Y que su inferencia parece mucho menos costosa. Los precios que se muestran por Deepseek en su propia plataforma ilustran toda la diferencia con OpenAi O1:
* Tokens de entrada (golpear caché) : $ 0.14 por millón de tokens.
* Tokens de entrada (Miss Cache) : $ 0.55 por millón de tokens contra $ 15 por millón de fichas para «OpenAi O1»
* Tokens de salida : $ 2.19 por millón de tokens contra $ 60 por millón de tokens para «OpenAi O1».
En otras palabras, Deepseek R1 sería 50 veces menos costoso de inferir que OpenAi O1.

Finalmente, la liberación de R1 plantea además de las preguntas sobre la efectividad de los controles de exportación tecnológicos impuestos por los Estados Unidos, ya que Deepseek ha logrado desarrollar un modelo poderoso a pesar de los recursos materiales limitados y la dificultad del acceso (en teoría) a los últimos aceleradores .

El surgimiento del código abierto

Al final, sin embargo, probablemente no es ninguno de estos puntos los que merecen la atención de los CIO y los gerentes de negocios. El último punto crucial más interesante se refiere al enfoque de código abierto adoptado por Deepseek. Yann Lecun, científico jefe de IA en Meta, dijo en particular: » El éxito de Deepseek, que se ha beneficiado enormemente de la investigación abierta y el código abierto (nota del editor: en particular Langchain y Llama), es una prueba de la superioridad de los modelos de código abierto sobre los modelos patentados. Hoy, todos pueden aprovechar su trabajo. »

Publicado bajo la licencia MIT muy permisiva, «Deepseek R1», a diferencia de Meta Llama, está más cerca de la definición de OSI de un modelo de código abierto sin adherirse completamente a él. Sigue siendo una cierta vaguedad en torno a los datos de entrenamiento y Deepseek no ha publicado todos los códigos de fuentes de las herramientas utilizadas para su entrenamiento y estabilización. Además, Hugging Face acaba de formalizar un proyecto de «Open-R1» destinado a compensar estos huecos recreando las herramientas que faltan para obtener un estado oficial de «OSI de código abierto».

El hecho es que el éxito de Deepseek podría tener repercusiones económicas inesperadas. Las acciones de las grandes compañías tecnológicas han experimentado reducciones significativas después del anuncio, lo que refleja las preocupaciones de los inversores sobre la solidez de la posición de los Estados Unidos en términos de IA y la relevancia de la inversión récord anunciada con grandes trompetas de refuerzos. El Financial Times informó notablemente que » Las acciones de Nvidia y Microsoft cayeron 6.5% y 3.5% respectivamente ».
Según Deepseek, el entrenamiento de sus modelos solo costaría $ 5.6 millones Donde los líderes estadounidenses generalmente admiten que sus últimos modelos fronterizos cuestan más de $ 100 millones en capacitación.
MIT Technology Review considera que Veterano Adopte enfoques más óptimos en la gestión y preparación de recursos. Se recordará que estos enfoques más óptimos y esta preocupación por «gastar bien» están precisamente en el corazón del enfoque Mistral AI. La startup francesa es reconocida internacionalmente por su capacidad para optimizar los procesos que le permiten continuar luchando en el campo de los grandes modelos fronterizos. Deepseek tendría un enfoque aún más exitoso y óptimo.

Por un lado, los observadores, como el periodista Holger Zschaepitz, creen que Deepseek R1 debería cuestionar más a las empresas estadounidenses y cuestionar inversiones masivas en la infraestructura de los Estados Unidos.

En contraste, Otros creen que los costos que muestran la compañía china son «falsificados» Como Neal Khosla, CEO de Curai. Muchas personas también creen que Deepseek realmente no dice toda la verdad: R1 deriva de Deepseek S3 y muchos expertos cuestionan la viabilidad de un entrenamiento S3 de Deepseek en un pequeño grupo de 2048 GPU (incluso si todos reconocen que Deepseek ha desarrollado todo tipo de ingenioso Optimizaciones descritas en los documentos técnicos del editor).

Al final, recordaremos que el lanzamiento de Deepseek-R1 todavía marca una etapa en el paisaje de IA, que ilustra el surgimiento de las nuevas empresas chinas. Esto no dejará de cuestionar las estrategias actuales de desarrollo y regulación de la IA. También subraya la importancia del código abierto en la promoción de la innovación y hacer preguntas cruciales sobre el equilibrio entre la colaboración abierta y la seguridad tecnológica. Ahora estamos esperando ver lo que un jugador europeo como Mistral Ai puede ofrecer en la competencia …

[Article publié le 27 Janvier, MAJ le 28 Janvier pour introduire les tarifs DeepSeek, le projet OpenR1 et clarifier certains points]

Leer también:

Mistral AI lanza su primer modelo multimodal y servicios gratuitos para seducir a los desarrolladores

Mutimodalidad, lienzo, análisis de documentos, agentes de IA … el gato se está retirando

Llama y Mixtral no son una IA de código abierto real de acuerdo con el OSI

Olmo 2: un nuevo modelo de código abierto mejor que Llama 3.1

Mistral lanza la segunda generación de su gran LLM: Mistral grande 2

Open Source, un elemento clave para el futuro de la IA

Los modelos de código abierto suben un engranaje

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *