Aplicaciones

Un nuevo punto de referencia para guiar a la IA para actuar

Si bien con la llegada de modelos de razonamiento, los debates sobre la proximidad o no de los actos se relanzan, el referencia ARC-AGI-2 formalizado esta semana aclara el camino que queda por atravesar y demuestra las deficiencias de nuestra IA actual que los investigadores ahora buscarán llenar.

La base Premio Finalmente, acaba de presentar ARC-AGI-2, un punto de referencia en la gestación durante muchos meses y diseñado específicamente para evaluar el progreso de los actores de IA y su progreso hacia la inteligencia artificial general (AG).

ARC-AGI-2 finalmente sucede a ARC-AGI-1, un punto de referencia elaborado en 2019, tres años antes de la llegada de ChatGPT y en un momento en que hablamos mucho más de aprendizaje profundo que de LLM o IA generativa.

ARC-AGI-2 conserva un punto común con ARC-AGI-1: sea bastante fácil para los humanos pero difícil para la IA. Excepto que el punto de referencia Arc-Agi-2 coloca el bar ahora mucho más alto.

Consiste en 120 pruebas o tareas de evaluación (contra 100 anteriormente). Las antiguas tareas vulnerables a las técnicas de investigación de fuerza bruta (de lo contrario, multiplicando las horas y los recursos de los cálculos) se eliminaron del punto de referencia. La idea es asegurarse de que la IA sea lo suficientemente «inteligente» para resolver, sin pasar horas de cálculo, pruebas que simplemente resuelve la inteligencia humana. Y las nuevas tareas se han diseñado específicamente para desafiar los sistemas de razonamiento de IA de nueva generación.

Si algunas pruebas que componen este punto de referencia son triviales para cualquier humano, otras ya son más elaboradas hasta el punto que en promedio, los humanos solo hacen una puntuación del 60%. Sin embargo, cada prueba se calibró para que al menos dos humanos logren resolverla en dos intentos máximos.

Además, ARC-AGI-2 se está centrando en «Inteligencia adaptativa» Para evaluar tres capacidades humanas que la IA generativa actual todavía le resulta difícil dominar:
– Interpretación simbólica (capacidad para comprender y manipular símbolos o conceptos abstractos, así como las relaciones ocultas entre estos símbolos),
– razonamiento compositivo (capacidad para construir o deducir respuestas complejas combinando varias información simple)
– La aplicación contextual de las reglas (capacidad para adaptar las reglas generales a una situación específica, como por ejemplo, comprender que las reglas de un juego deben aplicarse de manera diferente dependiendo del contexto o el entorno, etc.)

Arc-agi-2, el punto de referencia de la IA que afirma actuarArc-agi-2, el punto de referencia de la IA que afirma actuar

Pero la diferencia más importante con ARC-AGI-1 es que esta versión 2 introduce una métrica de eficiencia (costo por tarea). En otras palabras, ya no es una pregunta para la IA de simplemente «pasar las pruebas» del punto de referencia ARC-AGI-2, sino de tener éxito con la máxima eficiencia y, por lo tanto, a un costo menor, tanto pecuniario como ecológico.

Una brecha impresionante entre humanos y máquinas

Y los resultados iniciales son sorprendentes: incluso los sistemas de IA más avanzados están luchando en este punto de referencia. Operai O3-Low (usando la cadena de pensamiento y la síntesis) solo alcanza el 4% de éxito, mientras que los principales modelos de lenguaje puro como GPT-4.5 muestran una puntuación de 0%.

Se recordará que la salida de ARC-AGI-2 se hizo más urgente e importante cuando, por primera vez, la divulgación del modelo OpenAI O3 demostró en ARC-AGI-1 que la IA había excedido la etapa de memorización y mimetismo para demostrar inteligencia de fluidos real.

Sin embargo, este mismo modelo OpenAI O3, considerado el modelo de razonamiento más avanzado actualmente, alcanza solo una puntuación deficiente del 4% en ARC-AGI-2 que ilustra el alcance del camino que queda por viajar.

Capture decran 2025 03 26 003809Capture decran 2025 03 26 003809

Y para motivar la I + D, en paralelo con el lanzamiento de The Benchmark, la Fundación del Premio ARC organiza la competencia » Premio Arco 2025 Con una dotación total de un millón de dólares. El Gran Premio de $ 700,000 se lanzará tan pronto como un equipo alcanzará el 85% de éxito en ARC-AGI-2 dentro de los límites de eficiencia establecidos por Kaggle. La competencia comienza esta semana y continuará hasta noviembre de 2025. A diferencia de la tabla de clasificación pública, las reglas de Kaggle restringen el uso de API de Internet y limitan los recursos de cálculo a alrededor de $ 50 por envío.

Al final, la ambición de los creadores de Benchmark es clara: hacer de Arc-Agui 2 la estrella polar que guiará la investigación hacia la edad, dirigiendo los esfuerzos a los sistemas de inteligencia generales, acelerando los descubrimientos algorítmicos y asegurando la eficiencia con las que se adquieren y desplegan estas capacidades.

Leer también:

Yann Lecun: «¿Actuar en unos años? ¡Está mal!»

De AG a Super-Intinteligence: OpenAi redefine sus ambiciones

Anthrope lanza el soneto Claude 3.7 con razonamiento integrado y código Claude

Modelos pequeños cada vez más inteligentes y dotados de razonamiento

Mistral pequeño 3.1: pequeño, multimodal, multilingüe, sombrea a los gigantes

Meta suelta en código abierto su nube de referencia: dcperf

[

Related posts
Aplicaciones

Se informa que Microsoft está preparando una revisión de Teams para julio

Después de mucho tiempo acumulando conversaciones, canales, reuniones, archivos, apps…
Read more
Aplicaciones

El nuevo Siri ya casi está aquí... pero no en la UE

Después de años de confundir un asistente inteligente con un temporizador parlante, Apple quiere…
Read more
Aplicaciones

LibreOffice saca la regla de madera... y duele

Presentado como una alternativa de oficina europea a Microsoft 365 y Google Docs, Euro-Office no ha…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *