Si bien con la llegada de modelos de razonamiento, los debates sobre la proximidad o no de los actos se relanzan, el referencia ARC-AGI-2 formalizado esta semana aclara el camino que queda por atravesar y demuestra las deficiencias de nuestra IA actual que los investigadores ahora buscarán llenar.
La base Premio Finalmente, acaba de presentar ARC-AGI-2, un punto de referencia en la gestación durante muchos meses y diseñado específicamente para evaluar el progreso de los actores de IA y su progreso hacia la inteligencia artificial general (AG).
ARC-AGI-2 finalmente sucede a ARC-AGI-1, un punto de referencia elaborado en 2019, tres años antes de la llegada de ChatGPT y en un momento en que hablamos mucho más de aprendizaje profundo que de LLM o IA generativa.
ARC-AGI-2 conserva un punto común con ARC-AGI-1: sea bastante fácil para los humanos pero difícil para la IA. Excepto que el punto de referencia Arc-Agi-2 coloca el bar ahora mucho más alto.
Consiste en 120 pruebas o tareas de evaluación (contra 100 anteriormente). Las antiguas tareas vulnerables a las técnicas de investigación de fuerza bruta (de lo contrario, multiplicando las horas y los recursos de los cálculos) se eliminaron del punto de referencia. La idea es asegurarse de que la IA sea lo suficientemente «inteligente» para resolver, sin pasar horas de cálculo, pruebas que simplemente resuelve la inteligencia humana. Y las nuevas tareas se han diseñado específicamente para desafiar los sistemas de razonamiento de IA de nueva generación.
Si algunas pruebas que componen este punto de referencia son triviales para cualquier humano, otras ya son más elaboradas hasta el punto que en promedio, los humanos solo hacen una puntuación del 60%. Sin embargo, cada prueba se calibró para que al menos dos humanos logren resolverla en dos intentos máximos.
Además, ARC-AGI-2 se está centrando en «Inteligencia adaptativa» Para evaluar tres capacidades humanas que la IA generativa actual todavía le resulta difícil dominar:
– Interpretación simbólica (capacidad para comprender y manipular símbolos o conceptos abstractos, así como las relaciones ocultas entre estos símbolos),
– razonamiento compositivo (capacidad para construir o deducir respuestas complejas combinando varias información simple)
– La aplicación contextual de las reglas (capacidad para adaptar las reglas generales a una situación específica, como por ejemplo, comprender que las reglas de un juego deben aplicarse de manera diferente dependiendo del contexto o el entorno, etc.)
Pero la diferencia más importante con ARC-AGI-1 es que esta versión 2 introduce una métrica de eficiencia (costo por tarea). En otras palabras, ya no es una pregunta para la IA de simplemente «pasar las pruebas» del punto de referencia ARC-AGI-2, sino de tener éxito con la máxima eficiencia y, por lo tanto, a un costo menor, tanto pecuniario como ecológico.
Una brecha impresionante entre humanos y máquinas
Y los resultados iniciales son sorprendentes: incluso los sistemas de IA más avanzados están luchando en este punto de referencia. Operai O3-Low (usando la cadena de pensamiento y la síntesis) solo alcanza el 4% de éxito, mientras que los principales modelos de lenguaje puro como GPT-4.5 muestran una puntuación de 0%.
Se recordará que la salida de ARC-AGI-2 se hizo más urgente e importante cuando, por primera vez, la divulgación del modelo OpenAI O3 demostró en ARC-AGI-1 que la IA había excedido la etapa de memorización y mimetismo para demostrar inteligencia de fluidos real.
Sin embargo, este mismo modelo OpenAI O3, considerado el modelo de razonamiento más avanzado actualmente, alcanza solo una puntuación deficiente del 4% en ARC-AGI-2 que ilustra el alcance del camino que queda por viajar.
Y para motivar la I + D, en paralelo con el lanzamiento de The Benchmark, la Fundación del Premio ARC organiza la competencia » Premio Arco 2025 Con una dotación total de un millón de dólares. El Gran Premio de $ 700,000 se lanzará tan pronto como un equipo alcanzará el 85% de éxito en ARC-AGI-2 dentro de los límites de eficiencia establecidos por Kaggle. La competencia comienza esta semana y continuará hasta noviembre de 2025. A diferencia de la tabla de clasificación pública, las reglas de Kaggle restringen el uso de API de Internet y limitan los recursos de cálculo a alrededor de $ 50 por envío.
Al final, la ambición de los creadores de Benchmark es clara: hacer de Arc-Agui 2 la estrella polar que guiará la investigación hacia la edad, dirigiendo los esfuerzos a los sistemas de inteligencia generales, acelerando los descubrimientos algorítmicos y asegurando la eficiencia con las que se adquieren y desplegan estas capacidades.
Leer también:
Yann Lecun: «¿Actuar en unos años? ¡Está mal!»
De AG a Super-Intinteligence: OpenAi redefine sus ambiciones
Anthrope lanza el soneto Claude 3.7 con razonamiento integrado y código Claude
Modelos pequeños cada vez más inteligentes y dotados de razonamiento
Mistral pequeño 3.1: pequeño, multimodal, multilingüe, sombrea a los gigantes
Meta suelta en código abierto su nube de referencia: dcperf
[



