Aplicaciones

Chatbot Arena se convierte en una entidad autónoma y se abre en la búsqueda

Habiéndose convertido en una entidad autónoma de LMSYS y ahora una entidad comercial bajo el nombre de la inteligencia de Arena, la plataforma Lmarena (ex chatbot arena) extiende su espectro de evaluación a la investigación activa de la información web, revelando los sesgos y preferencias de los IA modernos con una función de «búsqueda».

Puntos de referencia … siempre han estado muy presentes en el universo de TI para distinguir procesadores, plataformas, bases de datos. Y se han vuelto centrales para el ecosistema EA tan efervescente. A menudo se usa erróneamente y a través de la comercialización de actores de IA, los puntos de referencia IA, además muy numerosos y muy variados, siguen siendo herramientas valiosas para comprender cómo cada modelo evoluciona de una iteración a la otra y cómo la IA generativa en su conjunto progresa con el tiempo y el camino aún queda por cubrir para superar a los humanos en todas las áreas.

En este mundo de puntos de referencia, Chatbot Arena Rápidamente se convirtió en un pilar de la prueba de los nuevos modelos que a menudo se publican allí más o menos anónimamente para ser probado a pequeña escala antes de formalizarse. Chatbot Arena es, sin duda, el proyecto más conocido del LMSYS Research Collective a quien también tenemos que Vicuna, S-Lora o Routellm.

Hacia una empresa lucrativa

Viniendo del LMSYS Research Collective (de UC-Berkeley), Lana Tomó su autonomía en septiembre de 2024 para permitir que Chatbot Arena continúe aumentando. Si el chatbot Arena sigue siendo el servicio principal de Lmarena, el campo cubierto por esta entidad ahora excede la comparación simple de la evaluación comparativa de los chatbots: desarrollo web, resolución de tareas complejas y ejercicios rojos enriquecidos en la matriz de evaluación. Sin cortar los puentes con LMSYS, el equipo tiene como objetivo » Avance la evaluación abierta de la IA y su accesibilidad «, Mientras mantiene la neutralidad metodológica.

Y Lmarena se ha convertido en una herramienta de referencia para grandes laboratorios de IA que la usan para evaluar y comparar sus modelos. Empresas como Openai, Google y Anthrope han establecido asociaciones con Lmarena para poner sus modelos insignia a disposición de la evaluación comunitaria.

Según Bloomberg, Lmarena continúa su evolución. Hasta ahora, principalmente financiado por donaciones y subsidios de Kaggle (la plataforma de ciencia de datos de Alphabet/Google), Andreessen Horowitz y juntos AI, la entidad ahora parece transformarse en una estructura comercial con la creación de Arena Intelligence Inc. Sin embargo, la nueva compañía quiere preservar su comunidad y un enfoque de código abierto, lo que hace su originalidad.

Buscar Arena y sus primeras lecciones

Y en su deseo de continuar su expansión, Lmarena anuncia la llegada de un nuevo servicio de evaluación comparativa: Arena de búsqueda. La idea es evaluar la relevancia de la IA que es capaz de enriquecer su conocimiento mediante la investigación web en lugar de confiar en el único conocimiento de su aprendizaje. En otras palabras, las preguntas en el «arena de búsqueda» deben relacionarse con eventos recientes y casos de uso que impongan investigación a través de la web.

Los primeros resultados de Lmarena destacan los modelos Gemini-2.5-Curreunding y perplexity-sonar-sonar-to-High. La clasificación se basa en criterios como la longitud de las respuestas, el número de citas y la fuente de citas. Siga Gemini-2.0-Flash-Grounding y GPT-4-Search de OpenAI.

Sin embargo, esta clasificación es menos interesante que las primeras observaciones que surgen de las primeras comparaciones. Arrojan luz sobre el funcionamiento mismo de estos modelos basados ​​en la investigación web:

* Todos estos modelos dan preferencia a algunas fuentes de referencia, como Wikipedia y los sitios de los dominios. Edu y .gov.
* Operai admite sus respuestas mucho en los sitios de noticias.
* Géminis parece en gran medida blogs y recursos de la comunidad.
* La perplejidad tiende a centrarse casi exclusivamente en el contenido estadounidense y cita muy voluntariamente (y tal vez incluso con demasiada frecuencia) YouTube.

Enseñanzas que no dejarán de interesar los experimentos DSIS, RSSI, desarrolladores y IA.

Leer también:

ARC-AGI-2: un nuevo punto de referencia para guiar a la IA para actuar

¡IBM está lanzando su nuevo mainframe, el Z17, construido para la era de AI!

La utilidad de los puntos de referencia ai para DSIS

Benchmark Frontiermath: un nuevo desafío para AI

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *