Aplicaciones

Muy bien muy buenos modelos

¡IBM y Microsoft tienen cada uno de su lado, anunciaron desarrollos importantes en sus pequeños modelos de granito y PHI que ganan inteligencia, capacidades multimodales y capacidad de razonamiento!

Además de sus diversas asociaciones con startups de IA que producen modelos fronterizos, IBM y Microsoft siguen siendo muy activos en el campo de I + D en torno a los modelos «pequeños», más fácil de inferir en los centros de datos de negocios y más fácil de personalizar para las empresas para alinearlos con sus propias necesidades comerciales.

Y durante el año 2024, las dos compañías han demostrado en gran medida que en términos de modelos generativos de IA, «pequeño» no significaba «menos útil», por el contrario.

Y 2025 también debe demostrar que estos modelos son cada vez más inteligentes y capaces de enfrentar problemas complejos. IBM acaba de anunciar Granite 3.2 y Microsoft las nuevas variaciones PHI-4.

IBM Lance Granite 3.2

IBM acaba de presentar la nueva generación de su familia de modelos de inteligencia artificial de granito. Esta versión 3.2 proporciona mejoras significativas en asuntos de razonamiento, visión y eficiencia, todo en modelos más compactos diseñados específicamente para satisfacer las necesidades de las empresas.

Según los puntos de referencia del editor, los modelos Granito 3.2 instruye 8b en Granito 3.2 instruye 2B Supera significativamente a sus predecesores gracias a la integración de las capacidades experimentales del razonamiento por cadena de pensamiento (cadena de pensamiento). A diferencia de otras compañías que ofrecen modelos de razonamiento distintos, IBM ha elegido antrópico con su soneto Claude 3.7 y como OpenAI con su futuro GPT-5 para integrar esta funcionalidad directamente en sus modelos de instrucciones, con la posibilidad de activarlo o desactivarlo según las necesidades. Por lo tanto, estos nuevos modelos de IBM son más efectivos que las versiones anteriores para tareas que requieren una comprensión profunda y una ejecución precisa de las instrucciones.

El enfoque de IBM se basa en particular en una técnica llamada «escala de inferencia», que permite que el modelo evalúe y mejore su propio proceso de razonamiento. Este método permitió a Granite 3.2 superar los modelos, que son mucho más grandes, como el soneto GPT-4O y Claude 3.5 en ciertos puntos de referencia matemáticos como Math500 y AIM2024.

Y el granito también está ahora en el análisis de imágenes. Con Granite Vision 3.2 2BIBM presenta un modelo ligero pero eficiente en el idioma de visión (VLM), especialmente diseñado para comprender documentos. Este modelo ya afirma competir con soluciones mucho más grandes en puntos de referencia corporativos como Docvqa y Chartqa. Para su capacitación, IBM ha creado un conjunto de datos específico llamado DOCFM, basado en documentos corporativos, imágenes, gráficos y diagramas.

Granite 3.2Granite 3.2

Al mismo tiempo, IBM continúa desarrollando sus modelos de seguridad y comprensión relacionados de la serie temporal iniciada con motivo de la Generación 3 de modelos de granito.
La nueva versión de Granite Guardian 3.2Disponible en dos variantes (5B y 3B-A800m), ofrece características protectoras similares a 3.1 edición, pero con una impronta reducida y un tiempo de inferencia más corto. Una nueva funcionalidad de «confianza verbalizada» ahora permite evaluar los riesgos potenciales de una manera más matizada.
Los modelos de series temporales (TTM) de Granite 3.2 ahora admiten pronósticos semanales y diarios, además de las resoluciones ya disponibles. Con menos de 10 millones de parámetros, estos modelos «pequeños» superan a los competidores, como el TimesFM-2.0 de Google (500 m de parámetros) y la base cronos-pera de Amazon (parámetros de 205 m) en pronósticos puntuales.

Todos los modelos Granite 3.2 están disponibles bajo la licencia Apache 2.0 en Hugging Face, Watsonx.ai, Ollama y LM Studio. También deben integrarse pronto en Rhel Ai 1.5.

Microsoft completa su rango PHI-4

Microsoft ya había demostrado su deseo de enriquecer sus pequeños modelos SLM con capacidad de razonamiento al lanzar las primeras versiones de su generación «Phi-4» en diciembre pasado. El editor acaba de enriquecer la gama PHI-4 con dos modelos nuevos: Instructo Phi-4-Multimodal y Instructo PHI-4-MINI. Estas soluciones compactas pero potentes tienen como objetivo ofrecer capacidades de IA avanzadas al tiempo que mantienen una eficiencia óptima para los desarrolladores.

El modelo Phi-4-multimodalCon sus 5.6 mil millones de parámetros, marca la primera incursión de Microsoft en el campo de los modelos de lenguaje multimodal. Ofrece un tratamiento unificado de entradas vocales, visuales y textuales simultáneamente, eliminando así la necesidad de tuberías complejas o modelos distintos para diferentes métodos.

Y el modelo es una precisión sorprendente a pesar de su pequeño tamaño. Acaba de tomar la delantera en el ranking de Huggingface OpenAsr y supera lo muy impresionante hasta ahora Whisperv3 d'Artai ¡En reconocimiento como en la traducción vocal!
¡Mejor aún, según los puntos de referencia realizados por los investigadores de Microsoft, Phi-4-Multimodal mantendría la comparación con el modelo tardío Gemini-2.0-Flash en la comprensión de los documentos y el razonamiento visual! Asombroso.

PHI 4 MUTIMODAL BENCHMARKSPHI 4 MUTIMODAL BENCHMARKS

Por su parte Ph-4 min es un modelo de 3,8 mil millones de parámetros solo centrados en el texto (LLM PUR) pero que promete mucho a pesar de su tamaño reducido. Por lo tanto, su ventana contextual se extiende a 128,000 tokens y el modelo ofrece un excelente rendimiento en razonamiento, matemáticas, codificación y monitoreo de instrucciones. Incorpora funciones para llamar a las funciones que permiten la integración con herramientas externas y API para fines de agencia.F4F4Publicado en código abierto bajo la licencia MIT muy permisiva, estos dos modelos ahora están disponibles para desarrolladores a través de Azure Ai Foundry, Huggingface y el catálogo de API Nvidia. Microsoft subraya que estos modelos han sido pruebas de seguridad rigurosas antes de su lanzamiento. Además, el editor ya anuncia que la tecnología PHI-4-Multimodal muy pronto animará el Copilot de PC+ para ofrecer estas capacidades a los tratamientos de IA en la ejecución local directamente en el dispositivo, mejorando así la confidencialidad y la velocidad de los cambios futuros en la función de recuerdo de Word, Outlook y Windows.

Leer también:

El pequeño granito 3.1 de IBM compite con los modelos gigantes de la IA

Phi-4, el nuevo modelo pequeño de Microsoft que razona como un gran

Microsoft Magma: un modelo de IA para la era de los agentes y los robots

IBM fortalece su oferta «Watsonx» IA con la adquisición de DataStax

«IBM es una patente al día, por noche, durante décadas …»

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *