Aplicaciones

Mistral Ai se coloca en el audio y lanza Voxtral en código abierto

Mistral AI diversifica sus líneas de investigación y sus modelos de IA. Con Voxtral, el joven Shoot afirma convertirse en la nueva referencia del reconocimiento de voz de código abierto, con dos modelos de 24 y 3 mil millones de parámetros cortados para la producción y el borde. ¿Qué ofrecen a los CIO y RSSI una alternativa soberana, eficiente y económica a los propietarios en términos de reconocimiento de voz y transcripción vocal?

En términos de reconocimiento vocal, análisis de la voz por IA y transcripción del habla en texto, los estadounidenses claramente lideran la danza. El modelo más famoso que sirve como referencia es el famoso Whisper V3 de Operai. Pero recientemente fue superado por los modos vocales de Gemini o GPT-4O.

Hasta ahora, el joven francés Mistral que tienes se había centrado principalmente en modelos textuales con o sin razonamiento. Ella anuncia su entrada al universo de la voz administrada por la IA generativa con sus nuevos mini modelos Voxtrales y Voxtral Small que afirman superar los modelos vocales de OpenAi y Géminis.

El anuncio tiene lugar mientras la startup está en el corazón de muchos rumores. Por un lado, algunas fuentes europeas creen que Mistral AI está preparando una nueva recaudación de fondos XXL con un monto anunciado en torno a los mil millones de euros. Por otro lado, según Bloomberg, Apple se habría acercado a la startup para adquirirla. Por lo tanto, Apple tendría puntos de vista sobre la IA distral y la perplejidad para obtener su retraso en el campo de los grandes modelos de IA.
Mientras tanto, la sesión joven continúa sus desarrollos y busca imponer su asistente «Le Cat» contra Gemini, Chatgpt, Claude y Grok.

Nuevas referencias «abiertas» para el reconocimiento de voz

Reconocido por su LLM en código abierto, modelos multimodales y su plataforma «soberana», Mistral AI extiende su campo de investigación y ofertas con Voxtral Su primera familia de modelos de audio. Además de eso, muchas profesiones están en busca de modelos exigibles de análisis vocal en infraestructura local o soberana para transcribir y analizar intercambios de voz, entrevistas, registros de centros de llamadas, etc., Mistral AI también necesitaba dichos modelos para finalmente ofrecer un modo vocal a su asistente «The Cat», una de las raras funcionalidades que aún faltan comparadas con comparación con los estadounidenses.

Con esta iniciativa, la compañía apunta directamente a los CIO en busca de soluciones vocales confiables, efectivas y asequibles, en un momento en que la voz se convierte en un canal de interacción privilegiado en las organizaciones.

Posicionado contra los gigantes estadounidenses del sector, Mistral destaca la accesibilidad y la apertura de Voxtral, que se destaca para una licencia Apache 2.0 y un precio transparente de $ 0.001 por minuto (de la API en la plataforma Mistral AI).

Dos modelos compatibles con inferencia local

Se ofrecen dos modelos: Voxtral pequeñocon 24 mil millones parámetros y Voxtral miniquien cuenta 3 mil millones.

Estos modelos permiten la transcripción y el análisis de secuencias de audio, al tiempo que ofrecen funciones avanzadas, como la generación de resúmenes, detección de lenguaje automático, cuestionamiento sobre contenido de audio, interrogación vocal, etc.
Los modelos apoyan inglés, francés, español, portugués, hindi, alemán, holandés e italiano. Voxtral domina todos los modelos competidores, particularmente en francés.

v plot 2v plot 2

Una tercera variante, más refinada, llamada Voxtral mini transcribeSe enfoca solo en la transcripción y reclama un mejor rendimiento que Whisper Large-V3 a un costo más bajo a la mitad.

En general, según la IA Mistral, los modelos Voxtral superan a Whisper V3 de OpenAi en varios criterios de reconocimiento y es competitivo contra Gemini y GPT -4O Mini, incluso en el multilingüe.

triangle voxtral blogtriangle voxtral blog

Del lado de las limitaciones, Tenga en cuenta que la ventana contextual de 32,000 tokens limita el tamaño de los archivos de audio proporcionados a 40 minutos de grabacióne incluso 30 minutos Para uso de «transcripción».

El gato pronto te escucha

Más allá de los aspectos técnicos, las promesas Mistral de llegar a las extensiones, como el reconocimiento de los oradores, la detección de emociones, la segmentación de audio o la buena gestión de los marcadores no verbales.

Sobre todo, Voxtral pronto apoyará a «The Cat» y permitirá la cuestión vocal del asistente de IA de AI Mistral.

Con este lanzamiento, Mistral confirma su deseo de hacer que la inteligencia vocal sea accesible en la producción, al tiempo que impone un abierto estándar en un mercado dominado en gran medida por soluciones patentadas. El verdadero desafío, para CIO y RSSI, será medir la capacidad de Voxtral para adaptarse a sus requisitos comerciales y a la complejidad de los entornos profesionales sin requerir una amplia experiencia en inteligencia artificial.

Leer también:

Mistral Calcula, la infraestructura IA que da soberanía de IA a las empresas

Mistral AI lanzó su primera IA de razonamiento con magistral

Código Mistral: el agente de la ayuda de desarrollo que combina productividad y seguridad

Agentes API: Mistral AI abre el camino hacia el agente operativo AI

Mistral lanza un nuevo modelo Medium 3 y el CAT en una versión comercial

Mistral pequeño 3.1: pequeño, multimodal, multilingüe, sombrea a los gigantes

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *