programa
Si has entrenado una red neuronal, probablemente has llamado a optimizer.step() miles de veces. Sabes que usa los gradientes calculados para actualizar los pesos del modelo y reducir la pérdida de entrenamiento, y normalmente ahí acaba la historia.
Pero nested learning te pide mirar al optimizador de otra forma. Interpreta a los optimizadores adaptativos como Adam como procesos de aprendizaje con su propio estado en evolución. Nested Learning fue presentado por Google Research en el artículo de NeurIPS 2025 "Nested Learning: The Illusion of Deep Learning Architectures".
En este artículo, veremos qué es Nested Learning, cómo funciona, por qué importa y cómo la arquitectura Hope lo lleva a la práctica. Si ya has entrenado un modelo con Adam o SGD, tienes el contexto necesario para seguirlo.
Resumen
- Nested Learning es un paradigma de aprendizaje automático de Google Research que trata un modelo como un conjunto de problemas de optimización anidados que aprenden a diferentes velocidades, en lugar de una arquitectura única entrenada por un optimizador separado.
- Ataca el olvido catastrófico: el problema por el que el fine-tuning con datos nuevos sobrescribe lo que el modelo ya sabía, la principal dificultad del aprendizaje continuo.
- El cambio clave es tratar la arquitectura y el optimizador como la misma clase de elemento: distintos niveles de aprendizaje que se actualizan a diferentes ritmos, de modo que la información nueva entra por los componentes rápidos sin borrar el conocimiento lento y estable.
- Hope es la arquitectura de prueba de concepto del paper: una variante auto-modificable de Titans combinada con un Continuum Memory System (CMS), donde los módulos de memoria se actualizan en un espectro de velocidades en lugar de una división fija corto/largo plazo.
- En las pruebas del paper, Hope superó a baselines como Titans, Samba y un transformer estándar en modelado del lenguaje y razonamiento de sentido común, y se mantuvo competitiva en recuperación de contexto largo y aprendizaje continuo.
- Es investigación temprana. No hay implementación oficial ni
pip install, solo reproducciones de la comunidad en GitHub. Tómalo como una línea a seguir, no como algo listo para producción.
Domina el Aprendizaje Profundo en Python
¿Qué es Nested Learning?
Nested Learning es un paradigma de machine learning que no trata un modelo como una sola arquitectura entrenada por un optimizador aparte, sino como un conjunto de problemas de optimización anidados que aprenden cada uno a su propio ritmo. Reencuadra la arquitectura del modelo y su algoritmo de entrenamiento como la misma clase de elemento: distintos niveles de aprendizaje que se ejecutan y se adaptan a la vez.
Organiza un sistema de machine learning en múltiples niveles de aprendizaje que operan a distintas escalas temporales.
- El nivel de parámetros aprende lentamente a lo largo de miles de pasos de entrenamiento.
- El nivel de memoria decide qué información conservar de entradas recientes.
- El nivel del optimizador aprende cómo actualizar los niveles inferiores.
Los niveles superiores pueden influir en cómo se comportan los inferiores, lo que hace que la estructura sea jerárquica y no solo modular.
Principios clave de nested learning
Nested learning sigue cuatro principios clave:
- Arquitectura y optimización forman parte del mismo sistema de aprendizaje. En Nested Learning, el optimizador pasa a ser parte del proceso de aprendizaje y puede adaptarse con el tiempo.
- Componentes distintos aprenden a distintas velocidades. Los parámetros nucleares de un modelo pueden actualizarse lentamente a lo largo de miles de ejemplos, mientras que un mecanismo de contexto a corto plazo se actualiza con cada entrada nueva y un sistema de memoria lo hace a un ritmo intermedio.
- La profundidad surge de procesos de aprendizaje anidados. El deep learning tradicional crea profundidad añadiendo capas. Nested Learning crea profundidad apilando varios niveles de aprendizaje y adaptación, donde parámetros, sistemas de memoria, optimizadores y mecanismos de actualización pueden aprender a diferentes escalas temporales.
- El aprendizaje puede continuar tras el despliegue. Componentes como los sistemas de memoria y los mecanismos de aprendizaje también pueden seguir adaptándose durante la inferencia.
Nested learning vs deep learning tradicional
Durante años nos hemos apoyado en la arquitectura de deep learning, donde los datos fluyen por una red neuronal, se mide cuánto se equivoca el modelo en sus predicciones (la pérdida), y se ejecuta un optimizador que ajusta los parámetros del modelo para reducir ese error.
Repites esto hasta que el modelo es suficientemente bueno. Luego congelas los parámetros y despliegas el modelo. A partir de ahí, no aprende de entradas nuevas, no se adapta a cambios en los datos y no mejora con el uso.
Nested Learning cambia eso. Además de los parámetros del modelo, los módulos de memoria, los optimizadores y otros componentes también siguen aprendiendo con el tiempo.
|
Factor |
Deep learning tradicional |
Nested learning |
|
Profundidad |
La profundidad proviene de apilar capas de redes neuronales. |
La profundidad proviene de anidar procesos de aprendizaje dentro de otros procesos de aprendizaje. |
|
Aprendizaje |
El aprendizaje ocurre principalmente durante el entrenamiento. |
El aprendizaje ocurre durante el entrenamiento y continúa tras el despliegue. |
|
Optimizador |
Una herramienta fija que actualiza los pesos del modelo. |
Un componente adaptativo que puede aprender y actualizar sus propias reglas. |
|
Memoria |
Codificada en los parámetros del modelo y el contexto a corto plazo. |
Existe en múltiples niveles y escalas temporales. |
|
Inferencia |
Los pesos del modelo están fijos. |
Ciertos componentes pueden seguir adaptándose durante la inferencia. |
Por qué importa Nested Learning
Un modelo aprende información nueva actualizando sus parámetros, pero esas mismas actualizaciones pueden sobrescribir conocimientos previos. Este fenómeno se conoce como olvido catastrófico.
Los investigadores han propuesto técnicas como congelar capas, métodos de regularización como Elastic Weight Consolidation (EWC) y buffers de repetición para preservar el conocimiento anterior mientras se aprenden nuevas tareas. Pero estos enfoques están pensados para proteger al modelo del olvido, no para cambiar de raíz cómo se aprende.
Nested Learning sostiene que este enfoque de una sola escala temporal es una de las razones por las que el aprendizaje continuo sigue siendo tan difícil. En lugar de depender de un único conjunto de parámetros para absorber toda la información nueva, reparte la adaptación entre varios niveles de aprendizaje.
Los distintos niveles se adaptan a ritmos diferentes, lo que permite incorporar información nueva sin reescribir constantemente el conocimiento anterior. Esta idea se inspira en parte en cómo funciona la cognición humana. No todo el aprendizaje ocurre al mismo ritmo:
- Los reflejos pueden adaptarse casi al instante.
- Los recuerdos a corto plazo se forman en minutos u horas.
- Las creencias, los hábitos y la experiencia pueden tardar meses o años en desarrollarse.
Cómo funciona Nested Learning
Nested Learning organiza un sistema de machine learning en niveles, cada uno un proceso de aprendizaje con su propio rol y velocidad de actualización. Para entender cómo funcionan, conviene recorrerlos y ver cómo se conectan.

El nivel de parámetros
Los parámetros son los pesos dentro de la red neuronal que almacenan lo que el modelo ha aprendido de sus datos de entrenamiento. Durante el entrenamiento, el optimizador actualiza estos pesos tras cada batch usando los gradientes calculados.
Cada actualización es pequeña, así que los cambios significativos llegan gradualmente tras muchos pasos de entrenamiento. Como resultado, el nivel de parámetros aprende conocimiento estable y a largo plazo, pero se adapta lentamente a información nueva.
El nivel de memoria
El nivel de memoria captura información de entradas recientes que el nivel de parámetros es demasiado lento para aprender.
En lugar de almacenar todo lo que ve, retiene la información más útil y descarta el resto. Así el modelo puede adaptarse a un contexto nuevo sin actualizar de inmediato su conocimiento a largo plazo.
El nivel del optimizador
El optimizador decide cómo deben actualizarse los parámetros del modelo durante el entrenamiento. Usa los gradientes calculados a partir de las predicciones del modelo para determinar el tamaño y la dirección de cada actualización.
Los optimizadores adaptativos como Adam hacen más que usar el gradiente actual. También siguen el rastro de gradientes recientes y usan ese historial al calcular la siguiente actualización de parámetros.
Si Adam ya hace esto, ¿qué aporta Nested Learning?
La diferencia está en qué puede aprenderse. En el deep learning estándar, las reglas que rigen cómo Adam actualiza su estado se fijan antes de empezar el entrenamiento y no cambian. Adam adapta los parámetros, pero nada adapta a Adam.
Nested Learning introduce un proceso de meta-aprendizaje por encima del optimizador que puede evaluar su rendimiento y modificar sus reglas con el tiempo. El optimizador deja de ser una infraestructura fija y pasa a ser algo que también puede mejorar.
Cómo interactúan los niveles
Estos niveles no funcionan de forma independiente. La información fluye entre ellos y cada nivel influye en cómo aprenden los demás con el tiempo.
- El nivel de parámetros construye gradualmente conocimiento a largo plazo mediante el entrenamiento.
- El nivel de memoria aporta contexto reciente que ayuda al sistema a responder con más rapidez a la información nueva.
- El optimizador determina cómo se actualizan los parámetros.
En conjunto, los niveles permiten equilibrar la adaptación a corto plazo con el aprendizaje a largo plazo.
La arquitectura Hope
Hope es la arquitectura de prueba de concepto del paper, una variante auto-modificable de la arquitectura Titans que Google construyó para comprobar si el nested learning funciona en la práctica. Combina una memoria que puede reescribir sus propias reglas de actualización con un Continuum Memory System, de modo que puede seguir aprendiendo a distintas velocidades en lugar de quedarse congelada tras el entrenamiento.
Titans auto-modificable
Titans incluye módulos de memoria para almacenar información que el modelo considera sorprendente o importante. En lugar de depender solo de sus parámetros, el modelo arrastra información útil a través de estos módulos de memoria.
Hope va un paso más allá. A medida que llegan datos nuevos, los módulos de memoria siguen actualizándose. El sistema también ajusta las reglas que usará en futuras actualizaciones. Por eso se denomina arquitectura auto-modificable.
Continuum Memory System
La mayoría de arquitecturas de memoria dividen la memoria en dos: corto y largo plazo. La información vive en un almacén rápido y temporal o se consolida en un almacenamiento estable a largo plazo. Hope sustituye esa división binaria por un continuo, un espectro de módulos de memoria que se actualizan a distintas velocidades.
Algunos componentes de memoria se actualizan rápidamente y capturan información reciente. Otros cambian más despacio y preservan conocimiento estable acumulado durante periodos más largos. Eso permite que la información nueva entre por las capas que se actualizan rápido sin perturbar de inmediato la memoria más lenta y estable.
Cómo rinde Hope
El paper evaluó Hope en modelado del lenguaje, razonamiento con contexto largo, aprendizaje continuo e incorporación de conocimiento, usando distintos baselines según la tarea. El modelado del lenguaje y el razonamiento de sentido común se compararon con Titans, Samba y un transformer estándar, mientras que en recuperación de contexto largo se comparó Hope y Titans con TTT y Mamba2.
En los benchmarks de modelado del lenguaje y razonamiento de sentido común, Hope logró menor perplexity y mayor precisión que los tres baselines.

Los resultados más reveladores llegaron en tareas que exigen recuperar una pieza concreta de información enterrada en un contexto largo. El paper probó varias variantes de dificultad creciente: pass-key retrieval, number retrieval y la más difícil, word-level retrieval. Hope superó a los baselines en todas, con el diseño de CMS contribuyendo específicamente a las mejoras en contexto largo.
La arquitectura también rinde bien en benchmarks de aprendizaje continuo. Al entrenarse en secuencias de tareas que suelen provocar olvido catastrófico, Hope retiene más conocimiento previamente aprendido que los modelos de comparación reportados en el paper.
Nested Learning frente a otros enfoques de aprendizaje continuo
Nested Learning no es el primer intento de abordar el olvido catastrófico. Desde hace años, se han propuesto técnicas de aprendizaje continuo para que los modelos conserven conocimiento previo mientras aprenden tareas nuevas. Veamos las diferencias clave entre los enfoques.
|
Enfoque |
Elastic Weight Consolidation (EWC) |
Progressive Neural Networks |
Experience Replay |
Nested Learning |
|
Mecanismo central |
Añade un término de regularización para frenar las actualizaciones de pesos que fueron importantes en tareas previas. |
Añade una red nueva dedicada para cada tarea nueva, con conexiones laterales a redes ya aprendidas, de modo que el conocimiento pueda transferirse hacia delante. |
Almacena y reejecuta muestras de tareas anteriores junto a las nuevas durante el entrenamiento. |
Organiza el aprendizaje en múltiples niveles interconectados que operan a diferentes escalas temporales |
|
Cómo evita el olvido |
Preserva los pesos de tareas anteriores; el conocimiento previo se mantiene al aprender tareas nuevas. |
Las redes anteriores se congelan y guardan. Las tareas nuevas tienen su propia red, sin interferencias. |
Mezclando ejemplos pasados en el entrenamiento actual. |
Los niveles se actualizan a distintas frecuencias, de modo que la información nueva entra por componentes rápidos sin desplazar de inmediato el conocimiento estable en los más lentos. |
|
Sobrecoste computacional |
Bajo a moderado |
Alto |
Moderado a alto, escala con el tamaño del buffer de repetición. |
Aún en evaluación |
|
Escalabilidad |
Moderada; proteger más parámetros con el tiempo puede reducir la capacidad para aprender tareas nuevas. |
Limitada porque el tamaño del modelo crece con cada tarea nueva |
Eficaz pero requiere mantener buffers de repetición |
Diseñada para escalar, pero aún es investigación temprana. |
|
Madurez |
Bien establecida |
Bien establecida |
Muy utilizada |
Investigación temprana |
Métodos como EWC, Progressive Neural Networks y Experience Replay son redes neuronales que ralentizan el olvido durante el entrenamiento. La arquitectura subyacente se mantiene en gran medida igual.
Nested Learning replantea la propia arquitectura para que el aprendizaje suceda en múltiples niveles y escalas temporales: una memoria que cambia rápido gestiona la experiencia reciente, mientras que parámetros que cambian más despacio capturan el conocimiento a largo plazo.
Nested Learning en la práctica
Están apareciendo reproducciones no oficiales de la comunidad en GitHub, lo que permite experimentar con la arquitectura e intentar reproducir los resultados publicados.
Dicho esto, Nested Learning no tiene integraciones oficiales con los principales frameworks de deep learning, y no puedes simplemente pip install nested learning e incorporarlo a un proyecto existente de PyTorch o JAX. Construir y evaluar estos modelos aún requiere trabajar directamente con código de investigación.
Aun así, la dirección apunta a la adopción por la comunidad. Estate atento a que módulos de Hope o del Continuum Memory System (CMS) se integren en frameworks mainstream y se adopten en sistemas de producción.
Reflexiones finales
Nested Learning cuestiona uno de los supuestos clave del deep learning moderno. En lugar de hacer los modelos más capaces apilando más capas, explora si la inteligencia puede surgir de múltiples procesos de aprendizaje que operan a diferentes escalas temporales.
Ese cambio también transforma cómo pensamos la optimización. El deep learning tradicional trata la arquitectura del modelo y el algoritmo de aprendizaje como componentes separados. Nested Learning los acerca con el objetivo de hacer que el propio aprendizaje sea jerárquico.
Aún es pronto. Nested Learning sigue siendo un área activa de investigación, y muchas de sus ideas necesitarán una validación más amplia antes de convertirse en parte del machine learning mainstream. Si quieres afianzar los conceptos detrás de nested learning (redes neuronales, optimización y mecanismos de memoria), te recomendamos nuestro itinerario completo Deep Learning in Python.
Preguntas frecuentes sobre Nested Learning
¿Qué es el aprendizaje continuo en LLM?
El aprendizaje continuo en LLM es la capacidad de un modelo para seguir aprendiendo de datos nuevos sin olvidar su conocimiento previo. La mayoría de los LLM no lo hacen bien de serie. Cuando los afinamos con información nueva, suelen sobrescribir conocimientos antiguos. La investigación en aprendizaje continuo busca precisamente resolver esto.
¿Nested Learning requiere varios modelos de machine learning?
No necesariamente. Nested Learning tiene más que ver con organizar las tareas de aprendizaje en múltiples niveles que con usar varios modelos. Algunas implementaciones usan un único modelo con etapas de entrenamiento anidadas o representaciones jerárquicas, mientras que otras combinan varios modelos especializados.
¿Nested Learning es computacionalmente costoso?
Puede serlo, pero no siempre de forma significativa. El coste adicional viene de mantener y actualizar el proceso de aprendizaje de nivel superior junto al entrenamiento normal del modelo. Las arquitecturas modernas de nested learning como Hope están diseñadas pensando en la eficiencia, lo que las hace prácticas en muchos entornos de investigación. Sin embargo, su despliegue en producción sigue siendo un tema abierto.
¿Cuándo conviene evitar Nested Learning?
Si tu distribución de datos no va a cambiar y solo necesitas un buen rendimiento en un benchmark fijo, Nested Learning añade complejidad sin mucho retorno. También conviene evitarlo cuando la interpretabilidad es clave. Cuanto más se auto-adapta el proceso de aprendizaje, más difícil resulta explicar qué hace el modelo y por qué.
¿Cómo elegir entre Nested Learning y transfer learning?
Resuelven problemas distintos. El transfer learning toma lo que un modelo aprendió en un dominio y lo aplica a otro. Es una adaptación puntual. Nested Learning busca construir un sistema que siga adaptándose con el tiempo a medida que llega información nueva. Si tienes una tarea objetivo fija, el transfer learning es más simple y suele bastar. Si tu entorno es dinámico y el modelo debe mantenerse al día, Nested Learning es más adecuado.
Srujana es una redactora técnica autónoma con una licenciatura de cuatro años en Informática. Escribir sobre diversos temas, como la ciencia de datos, la computación en la nube, el desarrollo, la programación, la seguridad y muchos otros, le resulta natural. Le encanta la literatura clásica y explorar nuevos destinos.



