Ir al contenido principal

Mejora recursiva de la IA: cómo funciona y por qué importa

Descubre qué significa la mejora recursiva en IA, cómo los sistemas de IA pueden ayudar a desarrollar mejor IA, cuán cerca están los modelos actuales de la RSI y por qué el concepto importa para las capacidades y la seguridad en IA.
Actualizado 17 sept 2026  · 12 min leer

Explorar con IA

ChatGPTClaudePerplexity

En septiembre de 2026, el investigador Jacob Coxon (que había pasado unos tres años investigando preentrenamiento en OpenAI antes de incorporarse a Anthropic dos meses antes) dimitió, advirtiendo públicamente de que los principales laboratorios están corriendo hacia lo que él llamó "superinteligencia auto-mejorable" sin actuar con la suficiente responsabilidad dado el riesgo. Evan Hubinger, responsable de ciencia de alineamiento en Anthropic, coincidió públicamente en que el riesgo futuro merece una preocupación seria, diferenciándolo de lo que los sistemas actuales pueden hacer realmente. El debate saltó rápido al discurso general sobre IA.

El concepto en el centro de esa discusión es la mejora recursiva de la propia IA (RSI). Conviene entenderlo por sí mismo, más allá de la polémica, porque la idea de fondo es más amplia y clarificadora que cualquier ciclo de noticias. Este artículo explica qué es realmente la RSI, cómo funciona el bucle de retroalimentación, qué pueden hacer hoy de verdad las IAs en esa dirección y por qué los investigadores discrepan sobre adónde conduce.

¿Qué es la mejora recursiva de la IA?

La mejora recursiva describe un bucle en el que la IA contribuye a crear una IA más capaz, y esa IA más capaz mejora a su vez su contribución al siguiente avance, y así sucesivamente:

La IA ayuda a mejorar la IA → la IA mejorada es mejor mejorando la IA → ese sistema contribuye al siguiente avance → repetir

Conviene separar tres cosas que a menudo se confunden.

  • Primero, el uso de IA por parte de humanos para acelerar la investigación en IA. Esto ya está ocurriendo y de forma amplia.
  • Segundo, la investigación en IA cada vez más autónoma, donde los sistemas asumen más partes del flujo de trabajo con menos dirección humana.
  • Tercero, la mejora recursiva plena, donde los sistemas de IA pueden diseñar y desarrollar en gran medida a sus sucesores por sí mismos.

La RSI plena es el tercer punto. Ningún sistema actual la ha logrado de forma concluyente. Esta es exactamente la línea que marca la propia Anthropic, señalando que la RSI completa aún no se ha alcanzado y puede que no sea inevitable. Esa distinción también es lo que hace que el debate sobre Coxon sea tan intenso: la discusión no es si la RSI existe hoy, sino a qué ritmo se está cerrando la brecha y qué exige eso a quienes construyen estos sistemas.

Cómo funciona la mejora recursiva

Un sistema que se auto-mejora, en el sentido de la RSI, contribuiría a la propia cadena de desarrollo de IA. Eso implica escribir y mejorar código de investigación, diseñar experimentos, generar o filtrar datos de entrenamiento, evaluar el rendimiento de modelos, identificar debilidades y proponer mejoras algorítmicas. La parte recursiva importa: si el sistema resultante de este proceso se vuelve mejor en esas mismas tareas, entonces la siguiente iteración del desarrollo de IA podría ocurrir más rápido o con mayor eficacia.

Diagrama que ilustra el bucle de retroalimentación de la mejora recursiva a través de generaciones sucesivas de IA. Imagen del autor. 

No es un modelo reescribiendo literalmente sus propios pesos en tiempo real. Piensa en generaciones sucesivas: cada generación de IA contribuye con más eficacia a construir la siguiente. El bucle se compone entre versiones, no dentro de un único sistema en ejecución.

Mejora recursiva vs. autocorrección de la IA

El malentendido más común sobre la RSI es confundirla con la autocorrección. Le pasa incluso a gente que sigue la IA de cerca, así que conviene ser precisos.

Autocorrección

La autocorrección ocurre cuando un modelo critica o revisa su propia respuesta, código o plan durante una tarea. Incluye detectar un error en su razonamiento, depurar código que acaba de escribir o pulir un borrador. Esto pasa continuamente en los sistemas actuales.

Mejora recursiva

La RSI es categóricamente distinta. Las mejoras afectan a las capacidades del sistema de IA o de sus sucesores, y pueden hacer que el propio desarrollo futuro de IA sea más eficaz. Un agente que depura su propio código repetidamente no es automáticamente mejora recursiva; es simplemente un agente capaz. La diferencia está en si la mejora persiste y se acumula de cara al desarrollo del siguiente sistema.

La autocorrección es una herramienta que el sistema usa en una tarea. La RSI es lo que ocurre cuando la tarea es construir el siguiente sistema.

Mejora recursiva frente a conceptos afines

Ayuda situar la RSI frente a otros conceptos que suelen aparecer en las mismas conversaciones, especialmente ahora que el debate de Coxon ha llevado términos como "superinteligencia" y "singularidad" a los mismos titulares.

RSI vs. investigación de IA automatizada

La I+D de IA automatizada abarca sistemas que ejecutan experimentos, analizan resultados y proponen próximos pasos. Pueden contribuir a la RSI sin constituir RSI plena. Un sistema que automatiza partes de la cadena de investigación forma parte de la tendencia, no es el punto final. La brecha entre "ayuda en la investigación" y "desarrolla autónomamente a sus sucesores" es lo que importa. El propio trabajo publicado por Anthropic describe cómo la IA asume más partes de esta cadena, y por eso la dimisión de Coxon tuvo tanto impacto. El movimiento es real; la cuestión es hasta dónde llega.

RSI vs. aprendizaje continuo

El aprendizaje continuo significa que un modelo en producción se actualiza con nueva información con el tiempo. La RSI significa mejorar el proceso utilizado para desarrollar sistemas de IA cada vez más capaces. Una cosa cambia lo que un modelo sabe; la otra cambia cuán capaz se vuelve el siguiente modelo.

RSI vs. superinteligencia artificial

La RSI describe un proceso. La superinteligencia describe un nivel de capacidad propuesto. Están relacionadas en el sentido de que la RSI es una vía hipotética hacia la superinteligencia, pero no son lo mismo, y mezclar ambos conceptos enturbia los dos.

Cuando Coxon advierte sobre la "superinteligencia auto-mejorable", describe un escenario en el que la RSI produce un sistema que supera la capacidad humana en múltiples dominios. Es una afirmación específica sobre lo que el proceso podría llegar a generar, no una descripción del proceso en sí.

RSI vs. singularidad de la IA

La singularidad de la IA es un punto hipotético en el que la mejora de la IA se vuelve tan rápida y autosostenida que los humanos ya no pueden predecir o controlar lo que viene después. Piensa en el momento en que la curva se vuelve vertical: el cambio sucede más rápido de lo que podemos entender o responder. La RSI es uno de los mecanismos propuestos para llegar ahí. Pero la singularidad es el resultado especulativo, no el proceso, y muchos investigadores creen que la curva se estabiliza mucho antes de que ocurra algo así.

¿Qué tan cerca estamos de la mejora recursiva?

Más cerca de lo que la mayoría imaginaba hace unos años. No tan cerca como sugieren algunos titulares.

Los sistemas de IA ya participan en la programación, depuración, ejecución de experimentos, análisis de resultados experimentales, evaluación de modelos y asistencia a la investigación en IA. Anthropic ha dicho públicamente que está delegando una parte creciente del trabajo de desarrollo de IA en sistemas de IA, y que sus ingenieros ahora publican sustancialmente más código que en años anteriores. Al mismo tiempo, Anthropic deja claro que los humanos mantienen papeles importantes en el juicio científico: decidir qué problemas abordar y evaluar si los resultados significan realmente lo que parecen.

La mayor implicación de la IA en la I+D de IA es una evidencia de avance hacia más automatización. No es la prueba de que ya exista un bucle autónomo de RSI. La cadena tiene más IA; aún no se ejecuta sola. Esta ambigüedad, progreso real con un final incierto, es justo lo que a Coxon le pareció insuficiente. Su dimisión no fue afirmar que la RSI ya haya llegado. Fue argumentar que tratarla como una preocupación lejana ya no es defendible.

¿Qué podría acelerar la mejora recursiva?

Entonces, ¿qué haría falta realmente para cerrar esa brecha? Destacan varios cuellos de botella, y la distancia a cada uno dice algo sobre el calendario realista.

Capacidad de programación de la IA

Es imprescindible escribir y modificar código de investigación de forma autónoma. Los modelos actuales son realmente buenos en esto, aunque todavía cometen errores que requieren revisión humana en trabajos de calado.

Experimentación automatizada

Ejecutar experimentos de forma autónoma es un cuello de botella distinto a escribir el código para ejecutarlos. Un sistema capaz de diseñar un experimento, ejecutarlo, interpretar los resultados y decidir qué probar después cierra una parte significativa del bucle. Los sistemas actuales hacen piezas de esto. El ciclo completo, sin que un humano compruebe el razonamiento en cada paso, sigue fuera de alcance.

Criterio investigador y generación de ideas

Aquí es donde se pone interesante. Anthropic identifica específicamente el gusto y juicio de investigación humanos como un área de ventaja comparativa que permanece. Es saber qué experimentos merece la pena ejecutar, qué resultados son fiables, qué direcciones tienen potencial. Gran parte del trabajo experimental es cada vez más automatizable. La capa de juicio no. También aquí es donde Anthropic cree que los humanos aportan el valor más insustituible ahora mismo, y donde la distancia a la RSI plena sigue siendo mayor.

Evaluación de modelos

Saber si un modelo realmente ha mejorado es más difícil de lo que parece. Evaluar exige criterio sobre qué importa, y los benchmarks actuales son fáciles de forzar o de agotar. Mientras los sistemas de IA no puedan evaluar de forma fiable a sus propios sucesores, los humanos siguen en el bucle en esta fase, lo cual es en sí un freno importante para una RSI autónoma.

Cómputo e infraestructura

La capacidad bruta no es la única limitación. Ejecutar el ciclo de desarrollo de forma autónoma requiere una infraestructura que soporte entrenamiento y evaluación a gran escala sin intervención humana constante, y eso sigue siendo caro y complejo a nivel organizativo.

Evaluación de modelos

Saber si un modelo realmente ha mejorado es más difícil de lo que parece. Evaluar exige criterio sobre qué importa, y los benchmarks actuales son fáciles de forzar o de agotar. Mientras los sistemas de IA no puedan evaluar de forma fiable a sus propios sucesores, los humanos siguen en el bucle en esta fase, lo cual es en sí un freno importante para una RSI autónoma.

Revisión humana

Incluso si los sistemas de IA pueden escribir código, ejecutar experimentos y evaluar resultados, los humanos siguen dando el visto bueno a lo que se publica. Ese paso de revisión es un límite duro a la velocidad del bucle. Puedes automatizar el trabajo y aun así atascarte en la aprobación. Hasta que se confíe lo suficiente en el juicio de la IA como para eliminar esa puerta, la revisión humana es probablemente el techo más inmediato del progreso de la RSI, más que una preocupación filosófica sobre el futuro.

Las ventajas de la mejora recursiva

La respuesta tiene dos partes: potencial y riesgo serio.

Avance científico y tecnológico más rápido

Si los sistemas de IA pueden acelerar la propia investigación en IA, el mismo efecto podría extenderse al desarrollo de software, el descubrimiento científico, la medicina y la ingeniería en general. El argumento es que una IA lo bastante buena acelerando investigación podría comprimir los plazos en muchos campos, no solo en IA.

Desarrollo más rápido de capacidades de IA

Aquí va el argumento del bucle de retroalimentación, sin rodeos: las mejoras en la capacidad de investigación en IA podrían aumentar la velocidad a la que se producen nuevas mejoras en IA. Ese efecto compuesto es lo que hace que la RSI sea teóricamente relevante, y lo que pone nerviosos a investigadores como Coxon hasta el punto de dimitir. Conviene señalar: un desarrollo más rápido de capacidades no produce automáticamente una explosión de inteligencia. El bucle puede ser real y aun así ser lento, estar acotado o sujeto a rendimientos decrecientes.

Los riesgos de la mejora recursiva

La supervisión humana como cuello de botella

Los experimentos, el código y los cambios de modelo generados por IA podrían acabar produciéndose más rápido de lo que los humanos pueden revisarlos con sentido. La supervisión que hoy moldea el desarrollo de IA depende de que los humanos sean capaces de seguir el ritmo de lo que se construye. Este es uno de los motivos por los que Anthropic sigue enfatizando el papel del juicio humano en su cadena de investigación, incluso mientras automatiza más trabajo.

Alineamiento y control

Que sistemas más capaces participen en desarrollar a sus sucesores hace que el problema del alineamiento sea más trascendente. Si el sistema que contribuye a la siguiente generación tiene objetivos sutilmente desalineados, estos podrían propagarse o empeorar en el sucesor. Este es precisamente el riesgo sobre el que Hubinger ha escrito extensamente, y lo que señalaba al estar de acuerdo con la preocupación de Coxon sobre riesgos futuros, manteniendo que los sistemas actuales aún no plantean la misma amenaza.

Ciberseguridad

Los sistemas autónomos más capaces también amplían la superficie de ataque. Un sistema implicado en su propia cadena de desarrollo es un objetivo de mayor valor, y los modos de fallo se vuelven más graves a medida que aumenta la autonomía. El confinamiento y el control de acceso son más difíciles de diseñar cuando el sistema a contener también ayuda a construir la siguiente versión de sí mismo.

Ganancias rápidas de capacidad

Si el bucle de retroalimentación acelera de forma significativa el desarrollo, las instituciones podrían tener menos tiempo para evaluar y responder a nuevas capacidades. Anthropic ha dicho que la RSI plena podría aumentar el riesgo de que los humanos pierdan el control de los sistemas de IA, a la vez que afirma que la RSI ni se ha logrado ni es inevitable.

Por qué la mejora recursiva es noticia

La dimisión de Jacob Coxon de Anthropic en septiembre de 2026 enmarcó el asunto en términos urgentes: que Anthropic y OpenAI están compitiendo hacia una superinteligencia auto-mejorable y no actúan con la cautela suficiente, dadas las posibles consecuencias. Evan Hubinger estuvo de acuerdo públicamente (situando su estimación personal de extinción humana causada por IA dentro de la década por encima del 10% y reconociendo que Anthropic aún no tiene un plan para alinear una superinteligencia), diferenciando a la vez esa preocupación futura del riesgo que plantean los sistemas actuales. Coxon ha dicho desde entonces que su desacuerdo central con la dirección de Anthropic es si una carrera competitiva hacia la RSI es inevitable y, por tanto, hay que participar en ella.

Ese desacuerdo convive con una publicación anterior de Anthropic que describe avances hacia el desarrollo de IA automatizado por IA, la misma investigación que muestra a la IA asumiendo más de la cadena de desarrollo. Ambas cosas son coherentes entre sí, lo que contribuye a que el debate no se pueda despachar a la ligera. No tomes las predicciones de Coxon sobre resultados catastróficos como hechos establecidos. Son parte de una discusión en curso, no ciencia asentada.

¿Podría la mejora recursiva llevar a una explosión de inteligencia?

El argumento teórico dice: una mejor IA lleva a mejor investigación en IA, que lleva a una IA aún mejor, que acelera la mejora. La lógica es clara. La pregunta es si se cumple en la práctica.

Una aceleración indefinida no se sigue automáticamente. Las limitaciones reales incluyen cómputo, energía, hardware, datos de entrenamiento, cuellos de botella algorítmicos, ciclos de retroalimentación experimental, rendimientos decrecientes y la dependencia que queda del juicio humano. Una explosión de inteligencia es una hipótesis debatida sobre lo que una RSI suficientemente eficaz podría producir, no una definición de la RSI en sí. Es un escenario en una distribución, no el final obvio. Nadie, incluidos los investigadores de Anthropic que más piensan sobre esto, sabe cuán empinada se vuelve la curva o dónde se estabiliza.

¿Cómo podría gobernarse la mejora recursiva?

Esa incertidumbre hace que la gobernanza sea a la vez más urgente y más difícil. El reto central es preservar una supervisión significativa si la investigación generada por IA empieza a ir más rápido de lo que la revisión humana puede seguir. Las propuestas y líneas de investigación activas incluyen evaluaciones de capacidad antes del despliegue, enfoques de contención de modelos, controles de acceso a sistemas de IA implicados en desarrollo de IA, monitorización de la actividad de I+D en IA, requisitos de aprobación humana para acciones de alto impacto, evaluación independiente y coordinación entre los laboratorios de frontera.

Ninguna de estas medidas es una solución completa, y el debate de Coxon subraya por qué: los marcos de gobernanza diseñados para el nivel actual de implicación de la IA en la cadena pueden no escalar al de mañana. La brecha entre dónde están las herramientas y hacia dónde va la tecnología es parte de lo que hace que este momento se sienta realmente trascendente para quienes trabajan más cerca de ello.

Conclusión

La mejora recursiva describe un bucle de retroalimentación en el que la IA contribuye a crear una IA más capaz, que a su vez puede volverse mejor contribuyendo a mejoras posteriores. Fácil de decir, genuinamente difícil de evaluar.

El desarrollo asistido por IA de hoy es real y va a más, como deja claro la propia investigación de Anthropic. La RSI autónoma plena, donde los sistemas de IA diseñan y desarrollan en gran medida a sus sucesores sin dirección humana, no se ha logrado. La propia Anthropic marca esa línea. La brecha entre ambas cosas es donde viven todas las preguntas interesantes y disputadas: a qué ritmo se cierra, qué pasa si lo hace y quién decide a qué velocidad avanzar.

El intercambio Coxon-Hubinger no creó esas preguntas. Las hizo imposibles de tratar como teóricas. Encuentres alarmante el calendario de Coxon o más mesurado el enfoque de Anthropic, la dinámica de fondo es la misma: la IA está cada vez más dentro del bucle que construye IA. Entender qué significa eso, con claridad y sin hype en ninguna dirección, es por lo que merece la pena conocer la RSI.


Vinod Chugani's photo
Author
Vinod Chugani
LinkedIn

Vinod Chugani comenzó su carrera en Tokio como el jefe más joven del equipo de ventas para hedge funds de JPMorgan y más tarde batió un récord individual de ventas en Lehman Brothers, para después crear un negocio de distribución de electrónica en 30 países que superó los 100 millones de SG$ en ingresos antes de dar el salto a los datos. Graduado en Economía por Duke y antiguo alumno de NYC Data Science Academy, fue uno de los tres becados entre más de 100 solicitantes para el curso Building AI Applications de Hugo Bowne-Anderson en Maven. Hoy escribe en DataCamp, KDnuggets, Machine Learning Mastery y Statology sobre temas que van desde estadística hasta IA agentiva, y mentoriza a profesionales de datos en NYC Data Science Academy con más de 1.000 sesiones uno a uno a sus espaldas.

 

Preguntas frecuentes sobre mejora recursiva

¿Cuál es la forma más simple de explicar la mejora recursiva?

Es un bucle de retroalimentación: la IA ayuda a desarrollar una IA mejor, que a su vez mejora desarrollando IA, lo que produce un sistema aún más capaz, y así sucesivamente. La palabra clave es "recursiva" porque cada ciclo puede mejorar el proceso en sí, no solo el resultado.

¿Algún sistema de IA ha logrado la mejora recursiva?

No de forma concluyente. Los sistemas de IA participan hoy en partes importantes del desarrollo de IA, como escribir código, ejecutar experimentos y evaluar modelos, pero los humanos siguen dirigiendo la investigación, eligen los problemas y toman las decisiones clave de juicio. La RSI plena, donde la IA diseña y construye en gran medida a sus sucesores de forma autónoma, no se ha demostrado. Anthropic lo ha afirmado explícitamente.

¿En qué se diferencia la RSI de una IA que aprende con el tiempo?

Una IA que se actualiza con nuevos datos (aprendizaje continuo) mejora lo que sabe. La RSI significa mejorar el proceso usado para desarrollar futuros sistemas de IA más capaces. Una cosa cambia el conocimiento de un modelo; la otra cambia cuán capaz será el siguiente modelo.

¿Cuál es la diferencia entre RSI y una explosión de inteligencia?

La RSI es un proceso: la IA contribuye a un mejor desarrollo de IA. Una explosión de inteligencia es una consecuencia hipotética de una RSI suficientemente eficaz, donde la capacidad crece de forma rápida y continua. La RSI podría darse sin producir una explosión de inteligencia, según la velocidad del bucle y las limitaciones que lo frenen.

¿Por qué importó la dimisión de Jacob Coxon en el debate sobre RSI?

Coxon, investigador con experiencia en Anthropic y OpenAI, dimitió en septiembre de 2026 alegando que los laboratorios líderes compiten hacia una superinteligencia auto-mejorable sin la debida cautela. Su salida llamó la atención porque coincidió con investigaciones publicadas por Anthropic que muestran a la IA asumiendo más trabajo de desarrollo de IA, lo que hace difícil separar ambas afirmaciones.

¿Qué tendría que pasar para que la RSI plena fuera real?

Habría que cerrar varios cuellos de botella: la capacidad de la IA para programar tendría que manejar tareas de investigación con fiabilidad, la experimentación automatizada debería funcionar sin supervisión humana constante y, sobre todo, la IA debería desarrollar algo parecido al criterio y gusto investigador, sabiendo qué direcciones merecen la pena. Anthropic identifica esta última parte como una ventaja humana vigente.

¿Es la RSI lo mismo que la superinteligencia?

No. La RSI describe un proceso; la superinteligencia describe un nivel de capacidad propuesto. La RSI es una vía hipotética que podría conducir hacia la superinteligencia, pero son conceptos distintos. Confundirlos es como mezclar una rutina de entrenamiento con el logro deportivo.

¿Cómo proponen los investigadores gobernar los riesgos de la RSI?

Las propuestas activas incluyen evaluaciones de capacidades antes de desplegar sistemas en funciones de desarrollo de IA, controles de acceso a los sistemas más capaces, monitorización de la actividad de I+D en IA y aprobación humana obligatoria para decisiones de alto riesgo. También se impulsa la coordinación entre laboratorios de frontera. El gran problema es conservar una supervisión significativa si la investigación generada por IA acaba yendo más rápido de lo que la revisión humana puede seguir, y nadie ha resuelto del todo eso aún.

Temas
Inteligencia Artificial

Aprende IA con DataCamp

Curso

Comprender la inteligencia artificial

2 h
420.8K
Aprende los conceptos básicos de la inteligencia artificial, como machine learning, aprendizaje profundo, PLN, IA generativa y mucho más.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow