Los SLM, o modelos de lenguaje pequeño, especializados en un idioma o dominio y capacitados con conjuntos de datos altamente cualitativos a menudo resultan más relevantes que los LLM cuando su uso se limita a su experiencia. Después de su prometedor Phi-2, Microsoft ya está lanzando sus modelos Phi-3, lo suficientemente compactos como para ejecutarse localmente en teléfonos inteligentes.
El año 2024 estará marcado por dos fuertes tendencias en la IA generativa. Por un lado, la búsqueda de I+D y desarrollo en torno a modelos muy grandes como LLM a varios cientos de miles de millones o incluso miles de miles de millones de parámetros, como lo demuestran los recientes lanzamientos de Gemini Pro 1.5, Claude 3, Mistral AI Large y Mixtral 8x22B e incluso Llama 3.
Por otro lado, los esfuerzos de investigación y desarrollo en torno a Modelos más pequeños pero más especializados. e igual de ágil siempre y cuando las preguntas se limiten a su área de especialización. Vimos esto con el lanzamiento de Mistral Small, Gemini Nano, Claude 3 Haiku, los modelos de código abierto Google Gemma e incluso los modelos Microsoft Phi-2.
Porque Microsoft no se contenta con confiar en sus asociaciones con OpenAI o Mistral AI. La editorial también desarrolla su propia IA no sólo con su entidad Investigación de Microsoft pero también con su nueva división “Microsoft AI” liderada por el ex cofundador de Deepmind e Inflection, Mustafa Suleyman.
En diciembre pasado, Microsoft anunció Phi-2, un modelo de lenguaje de 2.700 millones de parámetros que demostró capacidades excepcionales de razonamiento y comprensión del lenguaje y mostró un rendimiento que igualaba o superaba a modelos hasta 25 veces más grandes.
Esta semana, Microsoft reveló la nueva versión de estos modelos: fi-3. Los modelos están disponibles en tres versiones: un “ Mini » (3,8 mil millones de parámetros), una versión « Pequeño » de 7 mil millones de parámetros y una versión « Medio » de 14 mil millones de parámetros.
La versión Mini se entrenó en un corpus de 3.300 mil millones de tokens. Versiones pequeñas y medianas sobre un corpus de 4.800 mil millones de tokens.
Microsoft explica que en términos de capacidades LLM, aunque el modelo Phi-3-mini alcanza un nivel de comprensión del lenguaje y capacidad de razonamiento similar al de modelos mucho más grandes como GPT 3.5, sigue estando fundamentalmente limitado por su tamaño para ciertas tareas. El modelo simplemente no tiene la capacidad de almacenar un conocimiento fáctico extenso, lo que resulta, por ejemplo, en un bajo rendimiento en el punto de referencia TriviaQA. “ Sin embargo, creemos que esta debilidad se puede resolver agregando un motor de búsqueda. » y las técnicas RAG explican Microsoft.
El beneficio de un modelo compacto como Phi-3 Mini es poder integrarse localmente en dispositivos con energía limitada, como teléfonos inteligentes o dispositivos IOT.
Microsoft aún no ha revelado oficialmente los códigos fuente de Phi-3. Pero recuerde que las versiones anteriores (Phi-1, Phi-1.5 y Phi-2) se publicaron como código abierto, bajo la muy permisiva licencia MIT, y estuvieron disponibles en Github. Todo hace pensar que ocurrirá lo mismo con Phi-3.
Para saber mas : [2404.14219] Informe técnico de Phi-3: un modelo de lenguaje altamente capaz localmente en su teléfono (arxiv.org)
Lea también:
LightOn lanza una API para su plataforma de IA “Paradigm”
Con LLama 3, Meta redefine los estándares de IA de código abierto
Next'24: Gemini Pro 1.5 se vuelve accesible para los desarrolladores
Anthropic lanza Claude 3: ¿mejor que GPT-4 y Mistral AI?
[


