Cursus
Si vous avez déjà entraîné un réseau de neurones, vous avez sans doute appelé optimizer.step() des milliers de fois. Vous savez qu’il utilise les gradients calculés pour mettre à jour les poids du modèle et réduire la perte d’entraînement — et, en général, l’histoire s’arrête là.
Mais le nested learning vous invite à voir l’optimiseur autrement. Il interprète les optimiseurs adaptatifs comme des processus d’apprentissage dotés de leur propre état évolutif. Le nested learning a été introduit par Google Research dans l’article NeurIPS 2025 « Nested Learning: The Illusion of Deep Learning Architectures ».
Dans cet article, nous verrons ce qu’est le nested learning, comment il fonctionne, pourquoi il compte et comment l’architecture Hope le met en pratique. Si vous avez déjà entraîné un modèle avec Adam ou SGD, vous avez d’ores et déjà les bases pour suivre.
En bref
- Le nested learning est un paradigme d’apprentissage automatique développé par Google Research qui considère un modèle non pas comme une architecture unique entraînée par un optimiseur séparé, mais comme un ensemble de problèmes d’optimisation imbriqués apprenant à des vitesses différentes.
- Il cible l’oubli catastrophique : le phénomène où le fine-tuning sur de nouvelles données écrase des acquis antérieurs, principal frein à l’apprentissage continu.
- Le changement clé consiste à traiter l’architecture et l’optimiseur comme une même nature d’objet : des niveaux d’apprentissage qui se mettent à jour à des cadences différentes, afin que les informations nouvelles entrent par des composants rapides sans effacer les connaissances stables et lentes.
- Hope est l’architecture de preuve de concept de l’article : une variante auto-modifiante de Titans couplée à un Continuum Memory System (CMS), où les modules mémoire se mettent à jour selon un spectre de vitesses, plutôt qu’une simple dichotomie court terme/long terme.
- Dans les expériences présentées, Hope surpasse des baselines comme Titans, Samba et un transformer standard en modélisation du langage et en raisonnement de sens commun, tout en restant solide sur la recherche en contexte long et l’apprentissage continu.
- C’est une recherche encore naissante. Il n’existe pas d’implémentation officielle ni de
pip install, uniquement des reproductions communautaires sur GitHub : à considérer comme une piste à suivre, pas comme prêt pour la production.
Maîtriser l'apprentissage profond en Python
Qu’est-ce que le nested learning ?
Le nested learning est un paradigme d’apprentissage automatique qui traite un même modèle non pas comme une architecture unique entraînée par un optimiseur distinct, mais comme un ensemble de problèmes d’optimisation imbriqués, chacun apprenant à son propre rythme. Il requalifie l’architecture du modèle et son algorithme d’entraînement en une même famille : des niveaux d’apprentissage différenciés qui s’exécutent et s’adaptent simultanément.
Il organise un système d’apprentissage automatique en plusieurs niveaux fonctionnant sur des échelles de temps différentes.
- Le niveau paramètres apprend lentement, sur des milliers d’itérations d’entraînement.
- Le niveau mémoire décide quelles informations conserver à partir des entrées récentes.
- Le niveau optimiseur apprend comment mettre à jour les niveaux situés en dessous.
Les niveaux supérieurs peuvent influencer le comportement des niveaux inférieurs, ce qui rend la structure hiérarchique et pas seulement modulaire.
Principes clés du nested learning
Le nested learning s’appuie sur quatre principes majeurs :
- L’architecture et l’optimisation font partie d’un même système d’apprentissage. Dans le nested learning, l’optimiseur devient un acteur de l’apprentissage et peut s’adapter dans le temps.
- Des composants différents apprennent à des vitesses différentes. Les paramètres centraux d’un modèle se mettent à jour lentement sur des milliers d’exemples, alors qu’un mécanisme de contexte court terme évolue à chaque nouvelle entrée, et qu’un système mémoire se situe entre les deux.
- La profondeur vient de processus d’apprentissage imbriqués. Le deep learning traditionnel gagne en profondeur en empilant des couches. Le nested learning la crée en superposant plusieurs niveaux d’apprentissage et d’adaptation, où paramètres, systèmes mémoire, optimiseurs et mécanismes de mise à jour apprennent à des échelles de temps différentes.
- L’apprentissage peut se poursuivre après le déploiement. Des composants comme les systèmes mémoire et les mécanismes d’apprentissage peuvent continuer à s’adapter aussi pendant l’inférence.
Nested learning vs deep learning traditionnel
Pendant des années, nous nous sommes appuyés sur l’architecture de deep learning, où les données traversent un réseau de neurones, on mesure l’erreur de prédiction du modèle (la perte), puis on exécute un optimiseur qui ajuste les paramètres pour réduire cette erreur.
On répète jusqu’à obtenir un modèle suffisamment performant. Ensuite, on gèle les paramètres et on déploie. Dès lors, le modèle n’apprend plus des nouvelles entrées, ne s’adapte pas aux dérives de données et ne s’améliore pas à l’usage.
Le nested learning change la donne. En plus des paramètres du modèle, les modules mémoire, les optimiseurs et d’autres composants continuent eux aussi d’apprendre avec le temps.
|
Facteur |
Deep learning traditionnel |
Nested learning |
|
Profondeur |
La profondeur provient de l’empilement de couches de réseaux de neurones. |
La profondeur vient de l’imbrication de processus d’apprentissage les uns dans les autres. |
|
Apprentissage |
L’apprentissage se fait principalement pendant l’entraînement. |
L’apprentissage a lieu pendant l’entraînement et se poursuit après le déploiement. |
|
Optimiseur |
Un outil fixe qui met à jour les poids du modèle. |
Un composant adaptatif capable d’apprendre et de modifier ses propres règles. |
|
Mémoire |
Encodée dans les paramètres du modèle et le contexte court terme. |
Présente à plusieurs niveaux et échelles de temps. |
|
Inférence |
Les poids du modèle sont figés. |
Certains composants peuvent continuer à s’adapter pendant l’inférence. |
Pourquoi le nested learning est important
Un modèle apprend de nouvelles informations en mettant à jour ses paramètres, mais ces mises à jour peuvent aussi écraser des connaissances acquises auparavant. Ce phénomène est appelé oubli catastrophique.
Les chercheurs ont proposé des techniques comme le gel de couches, des méthodes de régularisation telles que l’Elastic Weight Consolidation (EWC) et des buffers de relecture pour préserver les acquis tout en apprenant de nouvelles tâches. Mais ces approches visent à protéger le modèle de l’oubli, sans repenser fondamentalement la façon dont il apprend.
Le nested learning soutient que cette approche à échelle de temps unique est l’une des raisons pour lesquelles l’apprentissage continu reste si difficile. Plutôt que de s’en remettre à un seul jeu de paramètres pour absorber chaque nouvelle information, il répartit l’adaptation sur plusieurs niveaux d’apprentissage.
Chaque niveau s’adapte à sa vitesse, ce qui permet d’intégrer du nouveau sans réécrire en permanence l’ancien. L’idée s’inspire en partie de la cognition humaine : tous nos apprentissages n’évoluent pas au même rythme :
- Les réflexes s’ajustent presque instantanément.
- La mémoire à court terme se forme en quelques minutes ou heures.
- Les convictions, habitudes et expertises demandent des mois, voire des années.
Comment fonctionne le nested learning
Le nested learning organise un système d’apprentissage automatique en niveaux, chacun étant un processus d’apprentissage distinct avec son rôle et sa cadence de mise à jour. Pour comprendre l’ensemble, parcourons-les et voyons leurs interactions.

Le niveau paramètres
Les paramètres sont les poids internes du réseau de neurones qui stockent ce que le modèle a appris à partir de ses données d’entraînement. Pendant l’entraînement, l’optimiseur met à jour ces poids à chaque lot en utilisant les gradients calculés.
Chaque mise à jour est faible ; les changements significatifs s’accumulent donc au fil de nombreuses étapes. Résultat : le niveau paramètres apprend des connaissances stables à long terme mais s’adapte lentement au nouveau.
Le niveau mémoire
Le niveau mémoire capture des informations issues des entrées récentes que le niveau paramètres apprend trop lentement.
Plutôt que de tout conserver, il retient l’information utile et écarte le reste. Le modèle peut ainsi s’adapter à un nouveau contexte sans modifier immédiatement ses connaissances de long terme.
Le niveau optimiseur
L’optimiseur décide comment mettre à jour les paramètres du modèle pendant l’entraînement. Il utilise les gradients issus des prédictions du modèle pour déterminer l’amplitude et la direction de chaque mise à jour.
Les optimiseurs adaptatifs comme Adam vont au-delà du gradient courant : ils conservent un historique des gradients récents et l’utilisent pour calculer la prochaine mise à jour des paramètres.
Si Adam fait déjà cela, qu’apporte le nested learning ?
La différence tient à ce qui peut s’apprendre. En deep learning standard, les règles qui régissent la mise à jour de l’état d’Adam sont fixées avant l’entraînement et ne changent jamais. Adam adapte les paramètres, mais rien n’adapte Adam.
Le nested learning introduit un méta-apprentissage au-dessus de l’optimiseur, capable d’évaluer sa performance et de modifier ses règles au fil du temps. L’optimiseur cesse d’être une infrastructure figée pour devenir un élément qui s’améliore lui-même.
Comment les niveaux interagissent
Ces différents niveaux n’opèrent pas en vase clos. L’information circule entre eux et chacun influence l’apprentissage des autres dans le temps.
- Le niveau paramètres construit progressivement des connaissances à long terme par l’entraînement.
- Le niveau mémoire apporte un contexte récent qui aide le système à réagir plus vite aux nouveautés.
- Le niveau optimiseur détermine comment mettre à jour les paramètres.
Ensemble, ces niveaux permettent d’équilibrer adaptation à court terme et apprentissage à long terme.
L’architecture Hope
Hope est l’architecture de preuve de concept de l’article, une variante auto-modifiante de l’architecture Titans que Google a conçue pour tester la mise en pratique du nested learning. Elle associe une mémoire capable de réécrire ses propres règles de mise à jour à un Continuum Memory System, afin de poursuivre l’apprentissage à plusieurs vitesses au lieu de se figer après entraînement.
Titans auto-modifiant
Titans intègre des modules mémoire pour stocker des informations jugées surprenantes ou importantes par le modèle. Plutôt que de ne s’appuyer que sur ses paramètres, le modèle propage des informations utiles via ces modules mémoire.
Hope va plus loin. Au fil des nouvelles données, les modules mémoire continuent de se mettre à jour. Le système ajuste aussi les règles qu’il utilisera pour les mises à jour futures : d’où le qualificatif d’auto-modifiant.
Continuum Memory System
La plupart des architectures mémoire distinguent deux bacs : court terme et long terme. L’information vit soit dans un store rapide et temporaire, soit est consolidée en mémoire stable. Hope remplace cette dichotomie par un continuum : un spectre de modules mémoire qui évoluent à des vitesses différentes.
Certains composants s’actualisent rapidement et capturent l’information récente. D’autres changent plus lentement et préservent des connaissances stables accumulées sur de plus longues périodes. Ainsi, les nouvelles informations peuvent entrer par les couches à mise à jour rapide sans perturber immédiatement la mémoire plus lente et plus stable.
Performances de Hope
L’article évalue Hope sur la modélisation du langage, le raisonnement sur contextes longs, l’apprentissage continu et l’intégration de connaissances, avec des baselines différentes selon les tâches. La modélisation du langage et le raisonnement de sens commun sont comparés à Titans, Samba et un transformer standard, tandis que les tâches de recherche en contexte long comparent Hope et Titans à TTT et Mamba2.
Sur les benchmarks de modélisation du langage et de raisonnement de sens commun, Hope atteint une perplexité plus faible et une précision plus élevée que les trois baselines.

Les résultats les plus parlants viennent des tâches qui exigent de retrouver une information précise enfouie dans un long contexte. L’article teste plusieurs variantes de difficulté croissante : récupération de clé, de nombre, et, la plus ardue, au niveau du mot. Hope surpasse les baselines sur toutes les variantes, le CMS contribuant spécifiquement aux gains en contexte long.
L’architecture s’en sort aussi très bien sur les benchmarks d’apprentissage continu. Entraîné sur des suites de tâches qui provoquent habituellement un oubli catastrophique, Hope conserve davantage d’acquis que les modèles de comparaison cités.
Nested learning vs autres approches d’apprentissage continu
Le nested learning n’est pas la première tentative pour lutter contre l’oubli catastrophique. Depuis des années, des techniques d’apprentissage continu visent à permettre aux modèles de retenir leurs acquis tout en apprenant de nouvelles tâches. Voyons les différences clé entre ces approches.
|
Approche |
Elastic Weight Consolidation (EWC) |
Progressive Neural Networks |
Experience Replay |
Nested learning |
|
Mécanisme central |
Ajoute un terme de régularisation pour ralentir les mises à jour des poids importants pour des tâches précédentes. |
Ajoute un nouveau réseau dédié à chaque nouvelle tâche, avec des connexions latérales vers les réseaux déjà appris, afin de transférer les connaissances. |
Stocke et rejoue des échantillons d’anciennes tâches en parallèle des nouvelles pendant l’entraînement. |
Organise l’apprentissage en plusieurs niveaux interactifs opérant à des échelles de temps différentes. |
|
Comment il évite l’oubli |
Préserve les poids des tâches précédentes ; les acquis sont conservés pendant l’apprentissage de nouvelles tâches. |
Les réseaux antérieurs sont gelés et conservés. Les nouvelles tâches ont leur propre réseau, sans inter férence. |
Mélange d’exemples passés au sein de l’entraînement courant. |
Des niveaux se mettent à jour à des fréquences différentes : l’information neuve entre par les composants rapides sans déloger immédiatement les connaissances stables des composants plus lents. |
|
Surcharge de calcul |
Faible à modérée |
Élevée |
Modérée à élevée, selon la taille du buffer de relecture. |
En cours d’évaluation |
|
Scalabilité |
Modérée ; protéger davantage de paramètres avec le temps peut réduire la capacité à apprendre de nouvelles tâches. |
Limitée, car la taille du modèle croît à chaque nouvelle tâche. |
Efficace, mais nécessite l’entretien de buffers de relecture. |
Pensé pour l’échelle, mais encore à un stade précoce. |
|
Maturité |
Bien établie |
Bien établie |
Largement utilisée |
Recherche à un stade initial |
Des méthodes comme EWC, Progressive Neural Networks et Experience Replay sont des stratégies qui ralentissent l’oubli pendant l’entraînement. L’architecture sous-jacente, elle, change peu.
Le nested learning repense l’architecture elle-même : l’apprentissage se déroule sur plusieurs niveaux et échelles de temps : une mémoire à évolution rapide gère l’expérience récente, tandis que des paramètres plus lents capturent le savoir à long terme.
Le nested learning en pratique
Des reproductions non officielles apparaissent sur GitHub, offrant aux chercheurs un moyen d’expérimenter l’architecture et de tenter de reproduire les résultats publiés.
Cela dit, le nested learning n’a pas d’intégrations officielles avec les grands frameworks de deep learning, et vous ne pouvez pas simplement pip install nested learning pour l’ajouter à un projet PyTorch ou JAX existant. La construction et l’évaluation de ces modèles supposent encore de travailler directement avec du code de recherche.
Mais la dynamique vise l’adoption par la communauté. Surveillez donc l’intégration de modules Hope ou Continuum Memory System (CMS) dans les frameworks grand public et leur adoption en production.
Pour conclure
Le nested learning remet en question l’un des postulats du deep learning moderne. Plutôt que d’accroître les capacités en empilant des couches, il explore l’émergence d’intelligence à partir de processus d’apprentissage multiples opérant à des échelles de temps différentes.
Ce changement transforme également notre vision de l’optimisation. Le deep learning traditionnel traite l’architecture du modèle et l’algorithme d’apprentissage comme deux composants distincts. Le nested learning les rapproche, avec l’ambition de rendre l’apprentissage lui-même hiérarchique.
Nous n’en sommes qu’aux débuts. Le nested learning reste un champ de recherche actif, et nombre de ses idées devront être validées plus largement avant de dégager dans l’apprentissage automatique grand public. Pour consolider vos fondamentaux sur les concepts qui le sous-tendent (réseaux de neurones, optimisation, mécanismes mémoire), nous vous recommandons notre parcours Deep Learning in Python.
FAQ sur le nested learning
Qu’est-ce que l’apprentissage continu dans les LLM ?
L’apprentissage continu dans les LLM désigne la capacité d’un modèle à continuer d’apprendre à partir de nouvelles données sans oublier ses connaissances précédentes. La plupart des LLM n’y excellent pas nativement : lors d’un fine-tuning sur de nouvelles informations, ils ont tendance à écraser l’ancien. La recherche sur l’apprentissage continu vise justement à résoudre ce problème.
Le nested learning exige-t-il plusieurs modèles de machine learning ?
Pas nécessairement. Le nested learning concerne surtout l’organisation des tâches d’apprentissage en plusieurs niveaux, pas l’emploi de multiples modèles. Certaines implémentations utilisent un seul modèle avec des étapes d’entraînement imbriquées ou des représentations hiérarchiques, d’autres combinent plusieurs modèles spécialisés.
Le nested learning est-il coûteux en calcul ?
Cela peut l’être, mais pas toujours de façon significative. Le surcoût vient du maintien et de la mise à jour du processus d’apprentissage de plus haut niveau en parallèle de l’entraînement classique du modèle. Les architectures modernes de nested learning comme Hope sont conçues pour l’efficacité, ce qui les rend praticables dans de nombreux environnements de recherche. En revanche, le déploiement en production reste un sujet ouvert.
Quand faut-il éviter le nested learning ?
Si votre distribution de données ne change pas et que vous visez une forte performance sur un benchmark fixe, le nested learning ajoute de la complexité sans grand bénéfice. Il est aussi à éviter lorsque l’interprétabilité est cruciale : plus le processus d’apprentissage s’adapte lui-même, plus il devient difficile d’expliquer ce que fait le modèle et pourquoi.
Comment choisir entre nested learning et transfert d’apprentissage ?
Ils résolvent des problèmes différents. Le transfert d’apprentissage réutilise ce qu’un modèle a appris dans un domaine pour l’appliquer à un autre : c’est une adaptation ponctuelle. Le nested learning vise à construire un système qui continue à s’adapter au fil du temps à mesure que de nouvelles informations arrivent. Si votre tâche cible est fixe, le transfert d’apprentissage est plus simple et généralement suffisant. Si votre environnement est dynamique et que le modèle doit rester à jour, le nested learning est plus approprié.
Srujana est rédactrice technique indépendante et titulaire d'un diplôme de quatre ans en informatique. Écrire sur divers sujets, notamment la science des données, l'informatique en nuage, le développement, la programmation, la sécurité et bien d'autres encore, est pour elle une évidence. Elle aime la littérature classique et la découverte de nouvelles destinations.
