Ir al contenido principal

ARC-AGI-3: el nuevo benchmark de razonamiento interactivo

Cómo funciona ARC-AGI-3, cómo puntúa a los agentes de IA según su eficiencia en acciones y por qué todos los modelos de frontera probados en el lanzamiento quedaron por debajo del 1% mientras que las personas lo resolvieron todo.
Actualizado 23 sept 2026  · 13 min leer

Explora con IA

ChatGPTClaudePerplexity

La mayoría de benchmarks de IA siguen la misma fórmula: plantea una pregunta al modelo, obtén una respuesta y comprueba si es correcta. Durante años, este enfoque fue suficiente. Pero a medida que los modelos de frontera empezaron a superar el 90% en casi todas las evaluaciones importantes, surgió un problema conocido: los benchmarks dejaron de diferenciar con precisión entre modelos.

ARC-AGI-3 propone algo distinto. En lugar de presentar puzles estáticos con pares claros de entrada-salida, sitúa a agentes de IA en entornos interactivos sin instrucciones, sin objetivos declarados y sin reglas explícitas. El agente tiene que descubrirlo todo por sí mismo mediante prueba y observación, igual que haría una persona al enfrentarse a un juego que nunca ha visto.

Lanzado el 25 de marzo de 2026 por la ARC Prize Foundation, ARC-AGI-3 ofreció un dato llamativo desde el primer día: todos los modelos de frontera puntuaron por debajo del 1%, mientras que las personas resolvieron todos los entornos del benchmark.

Qué es ARC-AGI-3

ARC-AGI-3 es un benchmark de razonamiento interactivo creado por la ARC Prize Foundation, cofundada por el investigador en IA François Chollet (creador de Keras) y Mike Knoop (cofundador de Zapier). El benchmark se articula alrededor de un principio clave según el equipo de ARC Prize: la verdadera inteligencia no trata de cuánto sabe un sistema, sino de cuán eficazmente puede aprender algo completamente nuevo.

Mientras que las evaluaciones anteriores de IA miden conocimiento cristalizado (recuperar hechos memorizados, aplicar heurísticas aprendidas), ARC-AGI-3 apunta a la inteligencia fluida: la capacidad de razonar ante problemas novedosos y adaptarse a situaciones nuevas en lugar de apoyarse en lo aprendido durante el entrenamiento. Mide si un agente de IA es capaz de explorar un entorno desconocido, deducir sus reglas, identificar qué significa "ganar" y luego actuar con eficiencia en base a ese entendimiento.

El benchmark incluye 135 entornos distribuidos entre conjuntos públicos, semiprivados y totalmente privados. Cada entorno es un escenario por turnos, similar a un juego, diseñado por un equipo interno. El agente no recibe ninguna pista. Simplemente observa el estado del mundo, realiza una acción, ve qué ocurre y repite.

Entorno interactivo de ARC-AGI-3 en juego. Vídeo del autor.

El artículo técnico describe el benchmark como una prueba de cuatro capacidades básicas: exploración, modelado, definición de objetivos y planificación.

Los conocimientos previos básicos

Para asegurarse de que el benchmark mide razonamiento y no memoria del conjunto de entrenamiento, los entornos de ARC-AGI-3 evitan el lenguaje, los números, las letras, los símbolos culturales o objetos del mundo real reconocibles. En su lugar, se basan únicamente en lo que el equipo de ARC Prize denomina "conocimientos previos de Core Knowledge": capacidades cognitivas básicas compartidas por todos los humanos.

Estos conocimientos incluyen la noción de objetos (entender que las cosas son entidades persistentes que pueden moverse o chocar), geometría y topología básicas (simetría, rotación, "dentro" frente a "fuera"), física básica (inercia, gravedad, rebote) y la noción de agente (reconocer cuándo algo en el entorno actúa con intención). Si un entorno exigiera saber que una llave abre una cerradura, estaría midiendo datos de entrenamiento, no razonamiento.

Cómo funciona ARC-AGI-3

El paso de una evaluación estática a entornos interactivos cambia lo que el benchmark puede medir realmente.

Qué ven y hacen los agentes

Cada entorno de ARC-AGI-3 presenta una cuadrícula de 64×64 donde cada celda muestra uno de 16 colores posibles. El agente recibe un estado visual (un "frame") como objeto JSON y envía una única acción por turno. El espacio de acciones es reducido: normalmente cinco comandos direccionales o de teclas, más una acción opcional de "clic" por coordenadas para seleccionar celdas concretas de la cuadrícula.

Los entornos son estrictamente por turnos. Nada cambia hasta que el agente actúa, lo que significa que el benchmark premia el razonamiento cuidadoso por encima de los reflejos rápidos. Importante: las operaciones internas como pasos de razonamiento, reintentos o llamadas a herramientas no cuentan como acciones. Solo se contabilizan las órdenes que realmente cambian el estado del entorno para la puntuación del agente.

Cómo encajan los niveles y los entornos

Cada entorno contiene varios niveles ordenados por dificultad creciente. El primer nivel actúa como tutorial, presentando las mecánicas básicas con mínima complejidad. En los niveles posteriores se añaden nuevas reglas e interacciones, así que el agente debe trasladar lo aprendido y aplicarlo en situaciones más complejas.

La dificultad en ARC-AGI-3 no proviene de la rareza ni de la escala, sino de la composición de múltiples mecánicas aprendidas a lo largo de los niveles. Un entorno con una sola mecánica sería demasiado fácil de forzar por ensayo y error. La verdadera prueba es combinar varias dinámicas aprendidas para resolver un problema que el agente nunca ha visto.

El benchmark se ejecuta sobre un motor propio basado en Python diseñado para alcanzar 1.000 FPS en modo headless. Los desarrolladores pueden empezar con pip install arc-agi y conectar con los entornos mediante el SDK o una API REST. También puedes jugar a los entornos públicos en tu navegador para hacerte una idea de cómo son estos juegos.

Cómo están rindiendo los modelos en ARC-AGI-3

Un aviso previo: estas puntuaciones reflejan el estado del ranking a finales de marzo de 2026 y casi con seguridad cambiarán a medida que se desarrollen nuevos enfoques.

En el lanzamiento, la ARC Prize Foundation probó varios modelos de frontera en el conjunto de evaluación semiprivado.

Puntuaciones en el lanzamiento (marzo de 2026): IA de frontera frente a referencia humana. Imagen del autor.

Para situarlo, estos mismos modelos dominan la mayoría de benchmarks de IA. ARC-AGI-1 está cerca de saturarse, con modelos líderes muy por encima del 90%. La caída a menos del 1% en ARC-AGI-3 sugiere que aquí se evalúan capacidades distintas de aquello en lo que los modelos actuales destacan.

El 0% de Grok-4.20 no significa que el modelo no hiciera acciones. Significa que superó el límite de acciones del benchmark en todos los niveles. Explicaré cómo funciona ese límite en la sección de puntuación.

Primeras señales de enfoques no basados en LLM

Los agentes con mejor puntuación durante el periodo de vista previa no eran modelos de lenguaje. En la competición preliminar (que usó 3 entornos públicos y 3 privados como conjunto oculto de evaluación), un sistema llamado StochasticGoose de Tufa Labs alcanzó un 12,58% usando un enfoque de aprendizaje por refuerzo con redes neuronales convolucionales.

Sin embargo, al evaluar StochasticGoose en el benchmark oficial completo en el lanzamiento, su puntuación cayó al 0,25%, aproximadamente al nivel de los LLM de frontera. Este resultado es revelador: un enfoque que funcionó bien en unos pocos entornos conocidos rindió mucho peor ante la variedad completa de entornos no vistos, lo que refuerza que ARC-AGI-3 depende sobre todo de la capacidad de adaptación general y no de la optimización específica por tarea.

Esto sugiere que el formato interactivo podría encajar mejor con arquitecturas distintas, ya que un modelo de lenguaje no puede razonar hasta una solución cuando la información necesaria solo aparece tras cada acción.

Puedes consultar las últimas puntuaciones en el ranking de ARC-AGI-3.

ARC-AGI-3 vs. ARC-AGI-1 y ARC-AGI-2

Estas cifras se entienden mejor sabiendo qué medían los ARC anteriores. ARC-AGI-1, lanzado por Chollet en 2019, introdujo la idea de medir inteligencia fluida con puzles visuales abstractos. El formato era estático: el modelo veía algunos ejemplos de cuadrículas con pares entrada-salida, infería la regla de transformación y producía una única salida. ARC-AGI-2, lanzado en marzo de 2025, mantuvo el formato estático pero con tareas más difíciles y composicionales.

ARC-AGI-1 ayudó a identificar la aparición de los grandes modelos de razonamiento como nueva categoría, con o3 de OpenAI como primera señal clara. ARC-AGI-2 siguió el ritmo al que escalaba esa capacidad de razonamiento. Pero el formato estático tenía una vulnerabilidad: el escalado del cómputo en tiempo de inferencia. Generando miles de soluciones candidatas en paralelo durante la inferencia, los laboratorios empujaron las puntuaciones de ARC-AGI-2 de un dígito a muy por encima del 50% en menos de un año.

Diagrama temporal que muestra la evolución desde los puzles estáticos de ARC-AGI-1 en 2019 hasta los entornos interactivos de ARC-AGI-3 en 2026

Evolución de los benchmarks ARC-AGI a lo largo del tiempo. Imagen del autor.

ARC-AGI-3 dificulta mucho la estrategia de muestreo por fuerza bruta porque, como comentaba antes, el entorno solo revela sus reglas después de que el agente actúe. No puedes generar 10.000 soluciones candidatas en una ventana de contexto cuando el problema cambia con cada acción.

Cómo se blinda ARC-AGI-3 frente a atajos

Más allá del formato interactivo, ARC-AGI-3 incorpora decisiones de diseño para contrarrestar la contaminación de datos y la generación sintética que afectaron a versiones anteriores. El cambio más notable es la inversión de la proporción del conjunto de datos. ARC-AGI-1 y ARC-AGI-2 tenían una relación de aproximadamente 10:1 entre tareas públicas y privadas, ofreciendo abundante material de entrenamiento. ARC-AGI-3 lo invierte: solo 25 entornos son públicos, mientras que la gran mayoría se reserva en conjuntos semiprivados y privados para evaluación.

El equipo de ARC Prize también señaló indicios de que algunos modelos de frontera podrían tener datos de ARC en su entrenamiento. Durante la evaluación de ARC-AGI-2, el razonamiento paso a paso de Gemini 3 hacía referencia a mapeos de colores específicos de ARC sin que se le pidiera, lo que sugiere saturación de datos de entrenamiento. Al reducir la superficie pública y pasar a entornos interactivos que no pueden memorizarse como patrones estáticos, ARC-AGI-3 busca dificultar mucho este tipo de atajo.

Qué pretende medir ARC-AGI-3

Estas decisiones de diseño se entienden mejor al ver qué intenta evaluar en realidad el benchmark. El objetivo es lo que el equipo de ARC Prize denomina "eficiencia en la adquisición de habilidades": cuán rápido y bien puede un agente de IA aprender algo que no ha visto nunca.

Diagrama que muestra las cuatro capacidades básicas que evalúa ARC-AGI-3: exploración, modelado, definición de objetivos y planificación

Cuatro capacidades básicas medidas por ARC-AGI-3. Imagen del autor.

Estas cuatro áreas se ponen a prueba de forma simultánea en cada entorno, sin instrucciones ni objetivos explícitos en ningún momento.

Un 100% en ARC-AGI-3 significaría que un agente de IA resuelve todos los entornos con la misma eficiencia que el segundo mejor tester humano. El equipo de ARC Prize deja claro que eso no equivale a AGI. Significa que se habría cerrado una brecha concreta entre el aprendizaje de la IA y el humano.

Cómo se puntúa ARC-AGI-3

La puntuación es donde ARC-AGI-3 más se aleja de benchmarks anteriores. No se limita a comprobar si el agente acaba tropezando con la solución. Mide con qué eficiencia llega hasta ella.

La fórmula de puntuación RHAE

La métrica se llama RHAE, de Relative Human Action Efficiency (eficiencia relativa de acciones respecto a humanos). La fórmula por nivel es:

Puntuación de nivel = min(1.0, (acciones_humano_base / acciones_IA))²

La clave es el término al cuadrado. No es una relación lineal. Duplicar el número de acciones no reduce a la mitad la puntuación; la reduce a una cuarta parte. Multiplicarla por diez la deja casi en cero. Este diseño de ley de potencias penaliza con fuerza los enfoques de fuerza bruta y premia a los agentes que realmente aprenden cómo funciona el entorno.

Diagrama que ilustra la puntuación RHAE con tres ejemplos que muestran cómo el número de acciones de la IA en relación con una referencia humana produce distintas puntuaciones

Fórmula RHAE con ejemplos prácticos. Imagen del autor.

La referencia humana se establece con la segunda mejor persona de entre 10 testers que intentaron cada entorno en su primer contacto. Usar la segunda mejor, y no la absoluta mejor, filtra golpes de suerte sin dejar de basarse en juego real.

También hay un corte duro: si un agente realiza más de 5 veces las acciones del humano de referencia en un nivel, se detiene y obtiene cero en ese nivel. Y las puntuaciones se topan en 1,0, así que descubrir un atajo no previsto que mejore la referencia humana no otorga puntos extra.

Dentro de cada entorno, los niveles posteriores pesan más. La puntuación usa una media ponderada donde el nivel 1 tiene peso 1, el nivel 2 peso 2, y así sucesivamente. Esto significa que los niveles tutoriales apenas afectan, mientras que los más difíciles, que exigen combinar varias mecánicas aprendidas, llevan más peso.

Dos rankings

ARC-AGI-3 mantiene dos rankings separados con reglas distintas. El ranking Official evalúa modelos de frontera usando sistemas API de propósito general que no han sido preparados específicamente para ARC-AGI-3. El ranking Community permite resultados autoinformados y admite arneses. Esta distinción importa porque, como comenté antes, los arneses hechos a mano pueden inflar de forma notable las puntuaciones en entornos conocidos pero fallar por completo en los no vistos. El ranking Official está diseñado para medir la capacidad real de adaptación de la IA, no el andamiaje del desarrollador.

ARC Prize 2026 y la competición de ARC-AGI-3

ARC-AGI-3 es la pieza central de la competición de este año, pero no es el único itinerario.

ARC Prize 2026 reparte más de 2 millones de dólares en premios entre tres itinerarios. El track de ARC-AGI-3 ofrece 850.000 dólares en total, con un Gran Premio de 700.000 dólares para el primer agente elegible que alcance el 100% en el conjunto de evaluación totalmente privado. Si nadie lo consigue este año, los fondos pasarán a 2027. Además del Gran Premio, hay un premio de 75.000 dólares a la mejor puntuación repartido entre los cinco primeros, y dos hitos intermedios (30 de junio y 30 de septiembre de 2026) que distribuyen 37.500 dólares entre los tres mejores equipos en esas fechas.

Resumen de la competición ARC Prize 2026 con tres itinerarios y su asignación de premios

Estructura de premios de la competición ARC Prize 2026. Imagen del autor.

Los otros dos itinerarios son un track de ARC-AGI-2 (700.000 dólares, y además será el último año que ARC-AGI-2 se use en una competición oficial de Kaggle) y un track de Paper Prize (450.000 dólares para trabajos de investigación).

La competición se celebra en Kaggle, pero con reglas distintas a una competición típica. Las propuestas se evalúan en un entorno aislado sin acceso a internet, lo que excluye llamadas a API de modelos alojados como GPT, Claude o Gemini. Todas las soluciones elegibles para premio deben publicarse con una licencia permisiva o de dominio público (CC0 o MIT-0) antes de recibir las puntuaciones de la evaluación privada. La competición se abrió el 25 de marzo de 2026, con fecha límite de envío el 2 de noviembre de 2026 y anuncio de resultados el 4 de diciembre de 2026.

Por qué importa ARC-AGI-3

Los benchmarks importan sobre todo cuando revelan una brecha que antes no parecía existir. En ese sentido, los dos primeros ARC se ganaron su lugar: ARC-AGI-1 sacó a la luz la aparición de grandes modelos de razonamiento, y ARC-AGI-2 midió hasta dónde podía llegar el escalado de cómputo en inferencia. ARC-AGI-3 señala un problema diferente.

Lo que hace relevante a este benchmark hoy es el contexto. A comienzos de 2026, muchos benchmarks de IA de uso extendido se acercan a la saturación. Los modelos de frontera superan el 90% en MMLU, HumanEval y GSM8K, entre otros, lo que limita cuánto pueden decirnos estas evaluaciones sobre las diferencias entre sistemas. ARC-AGI-3 evalúa una capacidad que los modelos actuales parecen no tener: aprender sobre la marcha en entornos desconocidos. La brecha entre puntuaciones de IA por debajo del 1% y un 100% de resolubilidad humana es lo bastante grande como para sugerir que no es simplemente una versión más difícil de la misma prueba, sino un desafío de otra naturaleza.

ARC Prize presenta ARC-AGI-3 como la prueba más importante de razonamiento interactivo, aunque conviene recordar que ese encuadre viene de la organización que lleva el benchmark. Si se sostiene dependerá de cómo responda la comunidad investigadora.

Limitaciones y preguntas abiertas

Ningún benchmark es perfecto y ARC-AGI-3 ha recibido críticas a tener en cuenta.

Una preocupación habitual es la propia fórmula de puntuación. La métrica de eficiencia al cuadrado penaliza con dureza la exploración, que bien podría ser un signo de inteligencia y no un fallo. Si un agente invierte 50 acciones en cartografiar con cuidado las condiciones límite antes de llegar a la solución, puntuará mucho peor que una persona que adivina la regla en 5 acciones. Parte de la comunidad argumenta que esto agranda artificialmente la brecha de rendimiento.

También está la cuestión de la referencia humana. Como expliqué en la sección de puntuación, el benchmark usa al segundo mejor tester humano y no a la media, lo que fija un listón alto. Incluso personas típicas puntuarían por debajo del 100% con este enfoque.

  • ¿Se transfiere el rendimiento en juegos abstractos? Sigue abierta la cuestión de si el éxito en juegos de cuadrícula interactivos predice algo sobre la inteligencia adaptativa en el mundo real. El benchmark evalúa una dimensión concreta y estrecha del razonamiento.
  • Diseño del agente frente a modelos base. No está claro si el progreso vendrá de mejores andamiajes de agentes (arneses, búsqueda en el espacio de estados, enfoques de RL) o de arquitecturas de modelo diferentes. Como comenté antes, la ventaja de StochasticGoose en la vista previa desapareció en el benchmark completo, así que ningún enfoque ha demostrado aún generalización clara.
  • ¿Se mantendrá resistente el benchmark? Como vimos, los laboratorios llevaron ARC-AGI-2 de cifras de un dígito a muy por encima del 50% en menos de un año cuando se centraron en él. Está por ver si los cambios de ARC-AGI-3 (formato interactivo, inversión del ratio público/privado, puntuación por eficiencia de acciones) bastan para resistir una presión similar.
  • Costes de la ventana de contexto. Las cuadrículas de 64×64 con 16 colores pueden agotar rápidamente las ventanas de contexto de los modelos de lenguaje sin compresión, encareciendo los enfoques basados en LLM a escala.

El equipo de ARC Prize presenta el benchmark como un intento científico de medir una capacidad concreta que falta, no como una prueba definitiva de inteligencia general. A la luz de lo que sabemos hoy, es una lectura razonable.

Conclusión

ARC-AGI-3 propone una forma distinta de evaluar sistemas de IA. Al pasar de puzles estáticos a entornos interactivos, comprueba si los modelos pueden explorar, fijar objetivos y aprender por experiencia en lugar de seguir instrucciones.

Las primeras cifras llaman la atención. Modelos que dominan benchmarks de código, competiciones de matemáticas y pruebas de conocimiento apenas superan aquí el 1%. Si esa brecha se cierra rápido, como ocurrió con benchmarks ARC anteriores, o si el formato interactivo resulta más difícil de descifrar, es algo que merece la pena seguir de cerca.

Si quieres profundizar en los conceptos detrás de sistemas de IA adaptativos, echa un vistazo a nuestro itinerario de aprendizaje AI Fundamentals o a nuestro curso Building Scalable Agentic Systems.


Khalid Abdelaty's photo
Author
Khalid Abdelaty
LinkedIn

Soy ingeniero de datos y creador de comunidades. Trabajo con canalizaciones de datos, nube y herramientas de IA, al tiempo que escribo tutoriales prácticos y de gran impacto para DataCamp y programadores emergentes.

FAQs

¿Qué es ARC-AGI-3?

Un benchmark de razonamiento interactivo que pone a prueba si los agentes de IA pueden explorar entornos nuevos, inferir objetivos y actuar con eficiencia sin instrucciones.

¿En qué se diferencia ARC-AGI-3 de ARC-AGI-2?

ARC-AGI-2 usa puzles estáticos de entrada-salida; ARC-AGI-3 emplea entornos interactivos en vivo donde las reglas y objetivos solo emergen a través de las acciones del propio agente.

¿Es ARC-AGI-3 una competición de Kaggle?

Forma parte de ARC Prize 2026 y se aloja en Kaggle, pero con reglas más estrictas: sin acceso a internet durante la evaluación y, para optar a premio, las soluciones deben abrir su código y métodos. Las puntuaciones de modelos de frontera (GPT-5.4, Gemini, etc.) se recogieron aparte vía API, no mediante envíos en Kaggle.

¿Qué mide ARC-AGI-3?

Eficiencia en la adquisición de habilidades: cuán rápido aprende un agente de IA a desenvolverse en un entorno nuevo, puntuado por el número de acciones relativo a una referencia humana.

¿Aprobar ARC-AGI-3 significa AGI?

No. Un 100% significa que el agente iguala la eficiencia humana en estos entornos concretos, no que haya alcanzado inteligencia general.

Temas
Inteligencia Artificial

Aprende con DataCamp

Curso

Comprender la inteligencia artificial

2 h
426.1K
Aprende los conceptos básicos de la inteligencia artificial, como machine learning, aprendizaje profundo, PLN, IA generativa y mucho más.
Ver detallesRight Arrow
Empezar Curso
Ver másRight Arrow
Relacionado

blog

Tipos de agentes de IA: Comprender sus funciones, estructuras y aplicaciones

Conoce los principales tipos de agentes de IA, cómo interactúan con los entornos y cómo se utilizan en los distintos sectores. Comprende los agentes simples reflejos, basados en modelos, basados en objetivos, basados en utilidades, de aprendizaje y más.

blog

7 emocionantes proyectos de IA para todos los niveles en 2026

Desarrolla tu portafolio y mejora tus habilidades en la creación de soluciones innovadoras para problemas complejos trabajando en proyectos de IA.
Abid Ali Awan's photo

Abid Ali Awan

8 min

An AI juggles tasks

blog

Cinco proyectos que puedes crear con modelos de IA generativa (con ejemplos)

Aprende a utilizar modelos de IA generativa para crear un editor de imágenes, un chatbot similar a ChatGPT con pocos recursos y una aplicación clasificadora de aprobación de préstamos y a automatizar interacciones PDF y un asistente de voz con GPT.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

Cómo aprender IA desde cero en 2026: Guía completa de los expertos

Descubre todo lo que necesitas saber sobre el aprendizaje de la IA en 2026, desde consejos para empezar, recursos útiles e información de expertos del sector.
Adel Nehme's photo

Adel Nehme

15 min

Tutorial

IA explicable - Comprender y confiar en los modelos de aprendizaje automático

Sumérjase en la IA explicable (XAI) y aprenda a generar confianza en los sistemas de IA con LIME y SHAP para la interpretabilidad de modelos. Comprender la importancia de la transparencia y la equidad en las decisiones basadas en la IA.
Zoumana Keita 's photo

Zoumana Keita

12 min

Tutorial

Cómo ajustar GPT 3.5: Liberar todo el potencial de la IA

Explore GPT-3.5 Turbo y descubra el potencial transformador del ajuste fino. Aprenda a personalizar este modelo de lenguaje avanzado para aplicaciones especializadas, mejore su rendimiento y comprenda los costes asociados, la seguridad y las consideraciones de privacidad.
Moez Ali's photo

Moez Ali

11 min

Ver MásVer Más