Ir al contenido principal

Nested Learning: una solución al olvido catastrófico

El olvido catastrófico complica el aprendizaje continuo. Descubre cómo Nested Learning usa múltiples escalas temporales para mantener el conocimiento previo mientras aprende tareas nuevas.
Actualizado 27 jul 2026  · 11 min leer

Explorar con IA

Abrir en ChatGPTAbrir en ClaudeAbrir en Perplexity

Si has entrenado una red neuronal, probablemente has llamado a optimizer.step() miles de veces. Sabes que usa los gradientes calculados para actualizar los pesos del modelo y reducir la pérdida de entrenamiento, y normalmente ahí acaba la historia.

Pero nested learning te pide mirar al optimizador de otra forma. Interpreta a los optimizadores adaptativos como Adam como procesos de aprendizaje con su propio estado en evolución. Nested Learning fue presentado por Google Research en el artículo de NeurIPS 2025 "Nested Learning: The Illusion of Deep Learning Architectures".

En este artículo, veremos qué es Nested Learning, cómo funciona, por qué importa y cómo la arquitectura Hope lo lleva a la práctica. Si ya has entrenado un modelo con Adam o SGD, tienes el contexto necesario para seguirlo.

Resumen

  • Nested Learning es un paradigma de aprendizaje automático de Google Research que trata un modelo como un conjunto de problemas de optimización anidados que aprenden a diferentes velocidades, en lugar de una arquitectura única entrenada por un optimizador separado.
  • Ataca el olvido catastrófico: el problema por el que el fine-tuning con datos nuevos sobrescribe lo que el modelo ya sabía, la principal dificultad del aprendizaje continuo.
  • El cambio clave es tratar la arquitectura y el optimizador como la misma clase de elemento: distintos niveles de aprendizaje que se actualizan a diferentes ritmos, de modo que la información nueva entra por los componentes rápidos sin borrar el conocimiento lento y estable.
  • Hope es la arquitectura de prueba de concepto del paper: una variante auto-modificable de Titans combinada con un Continuum Memory System (CMS), donde los módulos de memoria se actualizan en un espectro de velocidades en lugar de una división fija corto/largo plazo.
  • En las pruebas del paper, Hope superó a baselines como Titans, Samba y un transformer estándar en modelado del lenguaje y razonamiento de sentido común, y se mantuvo competitiva en recuperación de contexto largo y aprendizaje continuo.
  • Es investigación temprana. No hay implementación oficial ni pip install, solo reproducciones de la comunidad en GitHub. Tómalo como una línea a seguir, no como algo listo para producción.

Domina el Aprendizaje Profundo en Python

Desarrolla las habilidades de aprendizaje profundo más demandadas a través de Python.
Empieza a Aprender Gratis

¿Qué es Nested Learning?

Nested Learning es un paradigma de machine learning que no trata un modelo como una sola arquitectura entrenada por un optimizador aparte, sino como un conjunto de problemas de optimización anidados que aprenden cada uno a su propio ritmo. Reencuadra la arquitectura del modelo y su algoritmo de entrenamiento como la misma clase de elemento: distintos niveles de aprendizaje que se ejecutan y se adaptan a la vez.

Organiza un sistema de machine learning en múltiples niveles de aprendizaje que operan a distintas escalas temporales. 

  • El nivel de parámetros aprende lentamente a lo largo de miles de pasos de entrenamiento. 
  • El nivel de memoria decide qué información conservar de entradas recientes. 
  • El nivel del optimizador aprende cómo actualizar los niveles inferiores. 

Los niveles superiores pueden influir en cómo se comportan los inferiores, lo que hace que la estructura sea jerárquica y no solo modular.

Principios clave de nested learning

Nested learning sigue cuatro principios clave:

  • Arquitectura y optimización forman parte del mismo sistema de aprendizaje. En Nested Learning, el optimizador pasa a ser parte del proceso de aprendizaje y puede adaptarse con el tiempo.
  • Componentes distintos aprenden a distintas velocidades. Los parámetros nucleares de un modelo pueden actualizarse lentamente a lo largo de miles de ejemplos, mientras que un mecanismo de contexto a corto plazo se actualiza con cada entrada nueva y un sistema de memoria lo hace a un ritmo intermedio.
  • La profundidad surge de procesos de aprendizaje anidados. El deep learning tradicional crea profundidad añadiendo capas. Nested Learning crea profundidad apilando varios niveles de aprendizaje y adaptación, donde parámetros, sistemas de memoria, optimizadores y mecanismos de actualización pueden aprender a diferentes escalas temporales.
  • El aprendizaje puede continuar tras el despliegue. Componentes como los sistemas de memoria y los mecanismos de aprendizaje también pueden seguir adaptándose durante la inferencia.

Nested learning vs deep learning tradicional

Durante años nos hemos apoyado en la arquitectura de deep learning, donde los datos fluyen por una red neuronal, se mide cuánto se equivoca el modelo en sus predicciones (la pérdida), y se ejecuta un optimizador que ajusta los parámetros del modelo para reducir ese error. 

Repites esto hasta que el modelo es suficientemente bueno. Luego congelas los parámetros y despliegas el modelo. A partir de ahí, no aprende de entradas nuevas, no se adapta a cambios en los datos y no mejora con el uso.

Nested Learning cambia eso. Además de los parámetros del modelo, los módulos de memoria, los optimizadores y otros componentes también siguen aprendiendo con el tiempo.

Factor

Deep learning tradicional

Nested learning

Profundidad 

La profundidad proviene de apilar capas de redes neuronales.

La profundidad proviene de anidar procesos de aprendizaje dentro de otros procesos de aprendizaje.

Aprendizaje

El aprendizaje ocurre principalmente durante el entrenamiento.

El aprendizaje ocurre durante el entrenamiento y continúa tras el despliegue.

Optimizador

Una herramienta fija que actualiza los pesos del modelo.

Un componente adaptativo que puede aprender y actualizar sus propias reglas.

Memoria

Codificada en los parámetros del modelo y el contexto a corto plazo.

Existe en múltiples niveles y escalas temporales.

Inferencia

Los pesos del modelo están fijos.

Ciertos componentes pueden seguir adaptándose durante la inferencia.

Por qué importa Nested Learning

Un modelo aprende información nueva actualizando sus parámetros, pero esas mismas actualizaciones pueden sobrescribir conocimientos previos. Este fenómeno se conoce como olvido catastrófico.

Los investigadores han propuesto técnicas como congelar capas, métodos de regularización como Elastic Weight Consolidation (EWC) y buffers de repetición para preservar el conocimiento anterior mientras se aprenden nuevas tareas. Pero estos enfoques están pensados para proteger al modelo del olvido, no para cambiar de raíz cómo se aprende.

Nested Learning sostiene que este enfoque de una sola escala temporal es una de las razones por las que el aprendizaje continuo sigue siendo tan difícil. En lugar de depender de un único conjunto de parámetros para absorber toda la información nueva, reparte la adaptación entre varios niveles de aprendizaje. 

Los distintos niveles se adaptan a ritmos diferentes, lo que permite incorporar información nueva sin reescribir constantemente el conocimiento anterior. Esta idea se inspira en parte en cómo funciona la cognición humana. No todo el aprendizaje ocurre al mismo ritmo:

  • Los reflejos pueden adaptarse casi al instante. 
  • Los recuerdos a corto plazo se forman en minutos u horas. 
  • Las creencias, los hábitos y la experiencia pueden tardar meses o años en desarrollarse.

Cómo funciona Nested Learning

Nested Learning organiza un sistema de machine learning en niveles, cada uno un proceso de aprendizaje con su propio rol y velocidad de actualización. Para entender cómo funcionan, conviene recorrerlos y ver cómo se conectan.

Nested learning: aprendizaje en múltiples niveles

El nivel de parámetros

Los parámetros son los pesos dentro de la red neuronal que almacenan lo que el modelo ha aprendido de sus datos de entrenamiento. Durante el entrenamiento, el optimizador actualiza estos pesos tras cada batch usando los gradientes calculados. 

Cada actualización es pequeña, así que los cambios significativos llegan gradualmente tras muchos pasos de entrenamiento. Como resultado, el nivel de parámetros aprende conocimiento estable y a largo plazo, pero se adapta lentamente a información nueva.

El nivel de memoria

El nivel de memoria captura información de entradas recientes que el nivel de parámetros es demasiado lento para aprender. 

En lugar de almacenar todo lo que ve, retiene la información más útil y descarta el resto. Así el modelo puede adaptarse a un contexto nuevo sin actualizar de inmediato su conocimiento a largo plazo.

El nivel del optimizador

El optimizador decide cómo deben actualizarse los parámetros del modelo durante el entrenamiento. Usa los gradientes calculados a partir de las predicciones del modelo para determinar el tamaño y la dirección de cada actualización.

Los optimizadores adaptativos como Adam hacen más que usar el gradiente actual. También siguen el rastro de gradientes recientes y usan ese historial al calcular la siguiente actualización de parámetros.

Si Adam ya hace esto, ¿qué aporta Nested Learning?

La diferencia está en qué puede aprenderse. En el deep learning estándar, las reglas que rigen cómo Adam actualiza su estado se fijan antes de empezar el entrenamiento y no cambian. Adam adapta los parámetros, pero nada adapta a Adam. 

Nested Learning introduce un proceso de meta-aprendizaje por encima del optimizador que puede evaluar su rendimiento y modificar sus reglas con el tiempo. El optimizador deja de ser una infraestructura fija y pasa a ser algo que también puede mejorar.

Cómo interactúan los niveles

Estos niveles no funcionan de forma independiente. La información fluye entre ellos y cada nivel influye en cómo aprenden los demás con el tiempo. 

  • El nivel de parámetros construye gradualmente conocimiento a largo plazo mediante el entrenamiento. 
  • El nivel de memoria aporta contexto reciente que ayuda al sistema a responder con más rapidez a la información nueva. 
  • El optimizador determina cómo se actualizan los parámetros

En conjunto, los niveles permiten equilibrar la adaptación a corto plazo con el aprendizaje a largo plazo.

La arquitectura Hope

Hope es la arquitectura de prueba de concepto del paper, una variante auto-modificable de la arquitectura Titans que Google construyó para comprobar si el nested learning funciona en la práctica. Combina una memoria que puede reescribir sus propias reglas de actualización con un Continuum Memory System, de modo que puede seguir aprendiendo a distintas velocidades en lugar de quedarse congelada tras el entrenamiento.

Titans auto-modificable

Titans incluye módulos de memoria para almacenar información que el modelo considera sorprendente o importante. En lugar de depender solo de sus parámetros, el modelo arrastra información útil a través de estos módulos de memoria.

Hope va un paso más allá. A medida que llegan datos nuevos, los módulos de memoria siguen actualizándose. El sistema también ajusta las reglas que usará en futuras actualizaciones. Por eso se denomina arquitectura auto-modificable.

Continuum Memory System

La mayoría de arquitecturas de memoria dividen la memoria en dos: corto y largo plazo. La información vive en un almacén rápido y temporal o se consolida en un almacenamiento estable a largo plazo. Hope sustituye esa división binaria por un continuo, un espectro de módulos de memoria que se actualizan a distintas velocidades.

Algunos componentes de memoria se actualizan rápidamente y capturan información reciente. Otros cambian más despacio y preservan conocimiento estable acumulado durante periodos más largos. Eso permite que la información nueva entre por las capas que se actualizan rápido sin perturbar de inmediato la memoria más lenta y estable.

Continuum Memory SystemCómo rinde Hope

El paper evaluó Hope en modelado del lenguaje, razonamiento con contexto largo, aprendizaje continuo e incorporación de conocimiento, usando distintos baselines según la tarea. El modelado del lenguaje y el razonamiento de sentido común se compararon con Titans, Samba y un transformer estándar, mientras que en recuperación de contexto largo se comparó Hope y Titans con TTT y Mamba2.

En los benchmarks de modelado del lenguaje y razonamiento de sentido común, Hope logró menor perplexity y mayor precisión que los tres baselines.

Gráfico de barras que muestra que el modelo Hope supera a Titans, Samba y Transformer tanto en modelado del lenguaje como en razonamiento de sentido común.

Los resultados más reveladores llegaron en tareas que exigen recuperar una pieza concreta de información enterrada en un contexto largo. El paper probó varias variantes de dificultad creciente: pass-key retrieval, number retrieval y la más difícil, word-level retrieval. Hope superó a los baselines en todas, con el diseño de CMS contribuyendo específicamente a las mejoras en contexto largo.

La arquitectura también rinde bien en benchmarks de aprendizaje continuo. Al entrenarse en secuencias de tareas que suelen provocar olvido catastrófico, Hope retiene más conocimiento previamente aprendido que los modelos de comparación reportados en el paper.

Nested Learning frente a otros enfoques de aprendizaje continuo

Nested Learning no es el primer intento de abordar el olvido catastrófico. Desde hace años, se han propuesto técnicas de aprendizaje continuo para que los modelos conserven conocimiento previo mientras aprenden tareas nuevas. Veamos las diferencias clave entre los enfoques.

Enfoque

Elastic Weight Consolidation (EWC)

Progressive Neural Networks

Experience Replay

Nested Learning

Mecanismo central

Añade un término de regularización para frenar las actualizaciones de pesos que fueron importantes en tareas previas.

Añade una red nueva dedicada para cada tarea nueva, con conexiones laterales a redes ya aprendidas, de modo que el conocimiento pueda transferirse hacia delante.

Almacena y reejecuta muestras de tareas anteriores junto a las nuevas durante el entrenamiento.

Organiza el aprendizaje en múltiples niveles interconectados que operan a diferentes escalas temporales

Cómo evita el olvido

Preserva los pesos de tareas anteriores; el conocimiento previo se mantiene al aprender tareas nuevas.

Las redes anteriores se congelan y guardan. Las tareas nuevas tienen su propia red, sin interferencias.

Mezclando ejemplos pasados en el entrenamiento actual.

Los niveles se actualizan a distintas frecuencias, de modo que la información nueva entra por componentes rápidos sin desplazar de inmediato el conocimiento estable en los más lentos.

Sobrecoste computacional

Bajo a moderado

Alto

Moderado a alto, escala con el tamaño del buffer de repetición. 

Aún en evaluación

Escalabilidad

Moderada; proteger más parámetros con el tiempo puede reducir la capacidad para aprender tareas nuevas.

Limitada porque el tamaño del modelo crece con cada tarea nueva

Eficaz pero requiere mantener buffers de repetición

Diseñada para escalar, pero aún es investigación temprana.

Madurez

Bien establecida

Bien establecida

Muy utilizada

Investigación temprana

Métodos como EWC, Progressive Neural Networks y Experience Replay son redes neuronales que ralentizan el olvido durante el entrenamiento. La arquitectura subyacente se mantiene en gran medida igual. 

Nested Learning replantea la propia arquitectura para que el aprendizaje suceda en múltiples niveles y escalas temporales: una memoria que cambia rápido gestiona la experiencia reciente, mientras que parámetros que cambian más despacio capturan el conocimiento a largo plazo.

Nested Learning en la práctica

Están apareciendo reproducciones no oficiales de la comunidad en GitHub, lo que permite experimentar con la arquitectura e intentar reproducir los resultados publicados.

Dicho esto, Nested Learning no tiene integraciones oficiales con los principales frameworks de deep learning, y no puedes simplemente pip install nested learning e incorporarlo a un proyecto existente de PyTorch o JAX. Construir y evaluar estos modelos aún requiere trabajar directamente con código de investigación.

Aun así, la dirección apunta a la adopción por la comunidad. Estate atento a que módulos de Hope o del Continuum Memory System (CMS) se integren en frameworks mainstream y se adopten en sistemas de producción.

Reflexiones finales

Nested Learning cuestiona uno de los supuestos clave del deep learning moderno. En lugar de hacer los modelos más capaces apilando más capas, explora si la inteligencia puede surgir de múltiples procesos de aprendizaje que operan a diferentes escalas temporales.

Ese cambio también transforma cómo pensamos la optimización. El deep learning tradicional trata la arquitectura del modelo y el algoritmo de aprendizaje como componentes separados. Nested Learning los acerca con el objetivo de hacer que el propio aprendizaje sea jerárquico.

Aún es pronto. Nested Learning sigue siendo un área activa de investigación, y muchas de sus ideas necesitarán una validación más amplia antes de convertirse en parte del machine learning mainstream. Si quieres afianzar los conceptos detrás de nested learning (redes neuronales, optimización y mecanismos de memoria), te recomendamos nuestro itinerario completo Deep Learning in Python.

Preguntas frecuentes sobre Nested Learning

¿Qué es el aprendizaje continuo en LLM?

El aprendizaje continuo en LLM es la capacidad de un modelo para seguir aprendiendo de datos nuevos sin olvidar su conocimiento previo. La mayoría de los LLM no lo hacen bien de serie. Cuando los afinamos con información nueva, suelen sobrescribir conocimientos antiguos. La investigación en aprendizaje continuo busca precisamente resolver esto.

¿Nested Learning requiere varios modelos de machine learning?

No necesariamente. Nested Learning tiene más que ver con organizar las tareas de aprendizaje en múltiples niveles que con usar varios modelos. Algunas implementaciones usan un único modelo con etapas de entrenamiento anidadas o representaciones jerárquicas, mientras que otras combinan varios modelos especializados.

¿Nested Learning es computacionalmente costoso?

Puede serlo, pero no siempre de forma significativa. El coste adicional viene de mantener y actualizar el proceso de aprendizaje de nivel superior junto al entrenamiento normal del modelo. Las arquitecturas modernas de nested learning como Hope están diseñadas pensando en la eficiencia, lo que las hace prácticas en muchos entornos de investigación. Sin embargo, su despliegue en producción sigue siendo un tema abierto.

¿Cuándo conviene evitar Nested Learning?

Si tu distribución de datos no va a cambiar y solo necesitas un buen rendimiento en un benchmark fijo, Nested Learning añade complejidad sin mucho retorno. También conviene evitarlo cuando la interpretabilidad es clave. Cuanto más se auto-adapta el proceso de aprendizaje, más difícil resulta explicar qué hace el modelo y por qué.

¿Cómo elegir entre Nested Learning y transfer learning?

Resuelven problemas distintos. El transfer learning toma lo que un modelo aprendió en un dominio y lo aplica a otro. Es una adaptación puntual. Nested Learning busca construir un sistema que siga adaptándose con el tiempo a medida que llega información nueva. Si tienes una tarea objetivo fija, el transfer learning es más simple y suele bastar. Si tu entorno es dinámico y el modelo debe mantenerse al día, Nested Learning es más adecuado.


Srujana Maddula's photo
Author
Srujana Maddula
LinkedIn

Srujana es una redactora técnica autónoma con una licenciatura de cuatro años en Informática. Escribir sobre diversos temas, como la ciencia de datos, la computación en la nube, el desarrollo, la programación, la seguridad y muchos otros, le resulta natural. Le encanta la literatura clásica y explorar nuevos destinos.

Temas

Los mejores cursos de deep learning

programa

Aprendizaje profundo en Python

18 h
Continúa tu viaje de aprendizaje automático hacia el aprendizaje profundo. Utiliza la biblioteca PyTorch para crear redes neuronales que modelen distintos tipos de datos.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

La maldición de la dimensionalidad en el aprendizaje automático: Retos, repercusiones y soluciones

Explore la maldición de la dimensionalidad en el análisis de datos y el aprendizaje automático, incluidos sus retos, efectos en los algoritmos y técnicas como PCA, LDA y t-SNE para combatirla.
Abid Ali Awan's photo

Abid Ali Awan

7 min

blog

Los 12 mejores libros sobre aprendizaje profundo para leer en 2026

El aprendizaje profundo es un campo muy disruptivo. Aquí tienes nuestra lista de lecturas imprescindibles para ampliar tus conocimientos y llevar tus habilidades al siguiente nivel.
Javier Canales Luna's photo

Javier Canales Luna

9 min

blog

Cómo aprender PNL desde cero en 2026: Una guía experta

En esta guía, descubrirás cómo aprender el procesamiento del lenguaje natural (NLP) desde cero. Con un plan de aprendizaje claro y semanal, explorarás conceptos esenciales de la PNL, aplicaciones prácticas y proyectos prácticos para desarrollar tus habilidades.
Laiba Siddiqui's photo

Laiba Siddiqui

13 min

blog

Introducción al aprendizaje no supervisado

Aprende sobre el aprendizaje no supervisado, sus tipos -agrupación, minería de reglas de asociación y reducción de la dimensionalidad- y en qué se diferencia del aprendizaje supervisado.
Kurtis Pykes 's photo

Kurtis Pykes

9 min

Tutorial

Aprendizaje automático de datos categóricos con el tutorial de Python

Aprenda los trucos más comunes para manejar datos categóricos y preprocesarlos para construir modelos de aprendizaje automático.
Moez Ali's photo

Moez Ali

Tutorial

Introducción a las redes neuronales profundas

Comprender las redes neuronales profundas y su importancia en el mundo moderno del aprendizaje profundo de la inteligencia artificial
Bharath K's photo

Bharath K

Ver MásVer Más