Aplicaciones

IBM lanza su familia de modelos “pequeños” Granite 3.0

Ante el auge de modelos de IA compactos y potentes, IBM presenta Granite 3.0, una familia de modelos diseñados para adaptarse a las necesidades de las empresas modernas. Al combinar capacitación previa multilingüe, ajuste avanzado y arquitecturas MoE, esta nueva oferta de código abierto bien podría darles a Meta y Mistral AI una buena oportunidad.

Ya hemos tenido la oportunidad de decirlo, el año 2024 marca un punto de inflexión probablemente decisivo en el mundo de la inteligencia artificial con la aparición de pequeños modelos LLM de IA, eficientes, altamente personalizables y de fácil ejecución local que están revolucionando la forma en que las empresas abordan la tecnología. . Iniciada con Mistral 7B de Mistral AI, esta tendencia no ha hecho más que crecer con modelos como Google Gemma, Microsoft Phi 3.0, LLama 3.2 y recientemente el lanzamiento de Ministral 3B y 8B. IBM se suma a este esfuerzo y a esta nueva ola de IA con sus modelos Granito 3.0.

Durante su evento anual TechXchange esta semana, IBM presentó lo que el editor describe como su familia de modelos de IA más avanzada hasta la fecha: Granito 3.0. Publicado bajo la licencia muy permisiva. apache 2.0por lo tanto, eclipsan directamente otros modelos de código abierto cada vez más populares entre las empresas, empezando por los de Meta y Mistral AI. Debido a su tamaño compacto, estos modelos son adecuados para la ejecución local en los centros de datos de la empresa para una mejor confidencialidad de los intercambios.

La familia Granite 3.0 en realidad incluye una gran cantidad de modelos:

* Modelos de lenguaje Granite 3.0 “2B Base” y “8B Base” son los modelos básicos preentrenados a partir de 12 billones de tokens en 12 lenguajes humanos diferentes y 116 lenguajes informáticos diferentes y que se basan en una nueva técnica de aprendizaje de dos fases. Los modelos tienen una ventana emergente de 64.000 tokens que se espera que se amplíe a 128.000 para finales de año.

* Modelos de lenguaje de ajuste fino de Granite 3.0 “2B Instruct” y “8B Instruct” Son modelos que se pueden “afinar” fácilmente, particularmente mediante la técnica InstructLab de IBM y RedHat. Estas plantillas compactas y versátiles están diseñadas para ajustarse a los datos comerciales e integrarse fácilmente en diversos entornos y flujos de trabajo comerciales. Proporcionan un rendimiento sólido para tareas como generación aumentada de búsqueda (RAG), clasificación, resumen, extracción de entidades y uso de herramientas.

* Modelos de lenguaje de seguridad mejorados “Granite Guardian 3.0” derivan de los anteriores y están diseñados para detectar riesgos en indicaciones y respuestas. La detección de riesgos se lleva a cabo de acuerdo con varias dimensiones clave enumeradas en IBM AI Risk Atlas. Estos modelos se entrenan con datos únicos, incluidas anotaciones humanas de personas de diversos orígenes socioeconómicos, así como datos sintéticos de pruebas internas.

* Granite 3.0 Mezcla de expertos modelos 3B-A800M y 1B-A400M (disponibles en versiones Base e Instruct) son modelos con arquitectura MoE para ofrecer un mejor equilibrio entre rendimiento y costes. Estos modelos más ligeros y compactos se pueden implementar para aplicaciones que requieren baja latencia, así como para implementaciones de CPU (es decir, para inferencias sin aceleración de GPU o NPU). Según IBM, superan a los modelos LLama Guard de Meta.

* Modelos “Granite 3.0 Time Series” están diseñados específicamente para aplicaciones que requieren pronósticos precisos basados ​​en datos de series de tiempo.

Todos estos modelos ya están disponibles en el portal HuggingFace pero también en la plataforma Watsonx de IBM. Pronto estarán disponibles en forma de microservicios NIM a través de la plataforma NVidia, así como en Vertex AI Model Garden (Google Cloud).

Lea también:

Mistral lanza nuevos modelos “mini” de IA

GPT-4o mini y Mistral NeMo: los modelos pequeños son esenciales

Mistral Large 2, Meta LLama 3.1: Los LLM “Frontier” se resisten

Mistral AI lanza su primer modelo multimodal y servicios gratuitos para atraer desarrolladores

Cariño, encogí GPT-4o…

Con Phi-3, Microsoft mejora aún más sus modelos Gen AI de bolsillo

Microsoft MAYO: No sólo existe OpenAI en la vida…

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *