Aplicaciones

OpenAI mejora el modo vocal de ChatGPT y sus Audios API

Dominar la voz se convierte en un tema central en el desarrollo de AIS conversacionales y agentes IA eficientes e interactivos. Entre las transcripciones robustas, la personalización expresiva y la optimización de las interacciones en tiempo real, los deplayes de OpenAI implementan nuevos ladrillos fundamentales centrados en mejorar los intercambios entre el hombre y la máquina por voz.

OpenAi parece en una fase preparatoria a una serie completa de desarrollos importantes. Sabemos que el editor está trabajando activamente en su nueva generación de modelos híbridos que el futuro GPT-5 debe inaugurar, pero también en una plataforma de orquestación de agentes IA. En los últimos días, este trabajo preparatorio ha llevado a Openai a lanzar una serie completa de mejoras en torno a las interacciones vocales y la gestión de la voz por parte de AI.

OpenAI energiza las interacciones vocales de chatgpt

El verano pasado, Openai inauguró nuevas tecnologías Vocal IA para permitir interacciones más naturales con asistentes de IA. Estas tecnologías se han materializado por el «modo vocal avanzado» de ChatGPT y desde entonces han sido copiadas repetidamente por la competencia.

Y OpenAi continúa trabajando en este tema. En un video, Manuka Stratta, una investigadora dentro del equipo de Tonnai posterior al tren, muestra desarrollos importantes en el modo vocal de chatgpt. En particular, el usuario ahora puede permitir un descanso para pensar en medio de una oración sin ser interrumpido por ChatGPT. Y en las versiones pagas de ChatGPT, el asistente ahora es más directo, atractivo, conciso y creativo, con la posibilidad de seleccionar una de las nueve voces (o más exactamente una de las nueve personalidades) propuestas.

Un estudio reciente de OpenAI y MIT mostró que la interacción vocal desempeñó un papel clave en el impacto emocional de los usuarios y que las interacciones mejor controladas y más «humanas» podrían evitar reacciones psicológicas intensas en el usuario.

https://www.youtube.com/watch?v=mm4djpno8os<

Modelos vocales para agentes de IA más interactivos

Además del progreso realizado por ChatGPT en sus interacciones vocales con los humanos, OpenAi también trata sus API de audio, sabiendo que estos serán esenciales para futuros agentes de IA que tendrán que comprender o interactuar por habla.

Operai ya había afirmado en gran medida su dominio técnico del «discurso al texto», en otras palabras, análisis vocal y la transcripción del habla, con su susurro en el modelo de código abierto.

Con los nuevos modelos vocales (y las API para usarlos) «GPT-4-Transcribe» y «GPT-4O-Mini-Transcribe», OpenAi presenta alternativas más modernas a sus modelos Whisper. Los nuevos modelos prometen una transcripción vocal significativamente mejorada, incluso en entornos ruidosos o con acentos diversificados. Jeff Harris, Gerente de Producto de Operai, incluso asegura que estos modelos » reducir considerablemente el riesgo de alucinación », Donde Whisper tendió a inventar contenido cuando encontró dificultades de audio.

Paralelamente, OpenAi también mejora la síntesis vocal para hacer que la comunicación de máquinas de hombre sea mucho más fluida y natural, en particular para los agentes dedicados a la venta o soporte técnico. El modelo «GPT-4-Mini-Tot» permite a los desarrolladores influir en el tono y el estilo vocal de los agentes de IA. De ahora en adelante, las instrucciones precisas, como «habla como un científico loco» o «adopta una voz tranquila y educativa como un maestro» simplemente personalizará la expresión vocal de la IA y, por lo tanto, en última instancia la experiencia del usuario. Jeff Harris destaca la importancia de esta novedad: » En muchas situaciones, una voz monótona no es suficiente. Creemos que los desarrolladores y usuarios quieren dominar no solo lo que se comunica, sino también cómo se transmite. »

A diferencia de Whisper, estos nuevos modelos de «audio» son de tamaño imponente y, por lo tanto, solo se ofrecerán a través de la nube a través de las API de la plataforma Operai y la plataforma Microsoft (servicio Azure OpenAI).

Leer también:

Con Alexa+, Amazon quiere competir con Chatgpt, Gemini y Copilot

Operai está lanzando nuevas herramientas para la creación de agentes de IA

Microsoft y Openai se alejan el uno del otro poco a poco

Operai lanza GPT 4.5, su último modelo clásico de LLM

Voice Engine d'Apenai imita tu voz en 15 segundos …

Microsoft tiene una IA que imita (también) fácilmente tu voz

Red Hat and IBM Research quiere pilotar la hermana en La Voix

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *