Pular para o conteúdo principal

Nested Learning: uma solução para o esquecimento catastrófico

O esquecimento catastrófico dificulta o aprendizado contínuo. Veja como o Nested Learning usa múltiplas escalas de tempo para preservar o que o modelo já sabe enquanto aprende tarefas novas.
Atualizado 27 de jul. de 2026  · 11 min lido

Explorar com IA

Abrir no ChatGPTAbrir no ClaudeAbrir no Perplexity

Se você já treinou uma rede neural, provavelmente chamou optimizer.step() milhares de vezes. Você sabe que ele usa os gradientes calculados para atualizar os pesos do modelo e reduzir a perda de treinamento — e geralmente a história termina aí.

Mas o nested learning convida você a olhar para o otimizador de outro jeito. Ele interpreta otimizadores adaptativos como o Adam como processos de aprendizado com estado próprio e em evolução. O Nested Learning foi apresentado pelo Google Research no artigo da NeurIPS 2025 "Nested Learning: The Illusion of Deep Learning Architectures".

Neste artigo, vamos explorar o que é nested learning, como funciona, por que isso importa e como a arquitetura Hope coloca a ideia em prática. Se você já treinou um modelo com Adam ou SGD, tem a base necessária para acompanhar.

Resumo

  • Nested Learning é um paradigma de machine learning do Google Research que trata um modelo como um conjunto de problemas de otimização aninhados que aprendem em velocidades diferentes — não apenas uma arquitetura treinada por um otimizador separado.
  • Ele mira o esquecimento catastrófico: quando o fine-tuning em novos dados sobrescreve o que o modelo já sabia — o principal desafio do aprendizado contínuo.
  • A virada está em tratar a arquitetura e o otimizador como a mesma classe de entidade — níveis de aprendizado que se atualizam em ritmos distintos. Assim, novas informações entram por componentes rápidos sem apagar o conhecimento estável e mais lento.
  • Hope é a arquitetura de prova de conceito do artigo: uma variante autoadaptável de Titans, combinada com um Continuum Memory System (CMS), em que módulos de memória atualizam em um espectro de velocidades em vez de uma divisão fixa curto/longo prazo.
  • Nos testes do artigo, a Hope superou baselines como Titans, Samba e um transformer padrão em modelagem de linguagem e raciocínio de senso comum, e se manteve bem em recuperação de longo contexto e aprendizado contínuo.
  • É pesquisa em estágio inicial. Não há implementação oficial nem pip install, só reproduções da comunidade no GitHub. Encare como uma direção promissora, não algo pronto para produção.

Domine o aprendizado profundo em Python

Desenvolva habilidades de aprendizagem profunda sob demanda com Python.
Comece a Aprender De Graça

O que é Nested Learning?

Nested Learning é um paradigma de machine learning que vê um modelo não como uma única arquitetura treinada por um otimizador separado, mas como um conjunto de problemas de otimização aninhados, cada um aprendendo em seu próprio ritmo. Ele reenquadra a arquitetura do modelo e seu algoritmo de treinamento como a mesma classe de componente: níveis de aprendizado que rodam e se adaptam ao mesmo tempo.

Ele organiza um sistema de machine learning em múltiplos níveis de aprendizado que operam em diferentes escalas de tempo. 

  • O nível de parâmetros aprende devagar ao longo de milhares de steps de treinamento. 
  • O nível de memória decide quais informações reter a partir de entradas recentes. 
  • O nível do otimizador aprende como atualizar os níveis abaixo dele. 

Níveis superiores podem influenciar o comportamento dos níveis inferiores — por isso a estrutura é hierárquica, não apenas modular.

Princípios-chave do nested learning

O nested learning segue quatro princípios centrais:

  • Arquitetura e otimização fazem parte do mesmo sistema de aprendizado. No Nested Learning, o otimizador integra o processo de aprendizado e pode se adaptar ao longo do tempo.
  • Componentes diferentes aprendem em velocidades diferentes. Os parâmetros centrais podem atualizar lentamente ao longo de milhares de exemplos, enquanto um mecanismo de contexto de curto prazo atualiza a cada nova entrada, e um sistema de memória atualiza em um ritmo intermediário.
  • A profundidade vem de processos de aprendizado aninhados. No deep learning tradicional, a profundidade surge ao empilhar camadas. No Nested Learning, ela vem de empilhar múltiplos níveis de aprendizado e adaptação, nos quais parâmetros, sistemas de memória, otimizadores e mecanismos de atualização podem aprender em escalas de tempo distintas.
  • O aprendizado pode continuar após a implantação. Componentes como sistemas de memória e mecanismos de aprendizado também podem continuar se adaptando durante a inferência.

Nested learning vs. deep learning tradicional

Por anos, confiamos na arquitetura de deep learning, em que os dados passam por uma rede neural, mede-se o quão erradas estão as previsões do modelo (a loss) e roda-se um otimizador que ajusta os parâmetros para reduzir esse erro. 

Repete-se isso até o modelo ficar bom o suficiente. Depois, você congela os parâmetros e coloca o modelo em produção. A partir daí, ele não aprende com novas entradas, não se adapta a mudanças nos dados e não melhora com o uso.

O Nested Learning muda esse jogo. Além dos parâmetros do modelo, módulos de memória, otimizadores e outros componentes também continuam aprendendo ao longo do tempo.

Fator

Deep learning tradicional

Nested learning

Profundidade 

A profundidade vem do empilhamento de camadas da rede neural.

A profundidade vem de aninhar processos de aprendizado dentro de outros processos de aprendizado.

Aprendizado

Acontece principalmente durante o treinamento.

Acontece no treinamento e continua após a implantação.

Otimizador

Ferramenta fixa que atualiza os pesos do modelo.

Componente adaptativo que pode aprender e atualizar suas próprias regras.

Memória

Codificada nos parâmetros do modelo e no contexto de curto prazo.

Existe em vários níveis e escalas de tempo.

Inferência

Os pesos do modelo ficam fixos.

Certos componentes podem continuar se adaptando durante a inferência.

Por que o Nested Learning importa

Um modelo aprende novas informações ao atualizar seus parâmetros, mas essas mesmas atualizações podem sobrescrever conhecimentos anteriores. Esse fenômeno é conhecido como esquecimento catastrófico.

Pesquisadores criaram técnicas como congelamento de camadas, regularização (como o Elastic Weight Consolidation, EWC) e buffers de replay para preservar conhecimento anterior enquanto o modelo aprende novas tarefas. Mas essas abordagens protegem o modelo do esquecimento — não mudam, de forma fundamental, como o aprendizado acontece.

O Nested Learning argumenta que essa abordagem em uma única escala temporal é uma das razões pelas quais o aprendizado contínuo ainda é tão difícil. Em vez de depender de um único conjunto de parâmetros para absorver toda nova informação, ele distribui a adaptação por vários níveis de aprendizado. 

Níveis diferentes se adaptam em velocidades diferentes, o que permite incorporar informação nova sem reescrever continuamente o conhecimento antigo. Essa ideia se inspira, em parte, em como a cognição humana funciona. Afinal, nem todo aprendizado acontece no mesmo ritmo:

  • Reflexos podem se ajustar quase instantaneamente. 
  • Memórias de curto prazo se formam em minutos ou horas. 
  • Crenças, hábitos e expertise levam meses ou anos para se desenvolver.

Como o Nested Learning funciona

O Nested Learning organiza um sistema de machine learning em níveis — cada um é um processo de aprendizado com papel e velocidade de atualização próprios. Para entender como funcionam, vale percorrer cada nível e ver como eles se conectam.

Nested learning: aprendizado em múltiplos níveis

O nível de parâmetros

Parâmetros são os pesos dentro da rede neural que armazenam o que o modelo aprendeu nos dados de treinamento. Durante o treinamento, o otimizador atualiza esses pesos a cada batch usando os gradientes calculados. 

Cada atualização é pequena, então mudanças significativas acontecem gradualmente ao longo de muitos steps. Como resultado, o nível de parâmetros aprende conhecimento estável e de longo prazo, mas é lento para se adaptar a informações novas.

O nível de memória

O nível de memória captura informações de entradas recentes que o nível de parâmetros é lento demais para aprender. 

Em vez de guardar tudo o que vê, ele retém o que é mais útil e descarta o resto. Isso permite que o modelo se adapte ao novo contexto sem atualizar imediatamente o conhecimento de longo prazo.

O nível do otimizador

O otimizador decide como os parâmetros do modelo devem ser atualizados durante o treinamento. Ele usa os gradientes calculados a partir das previsões do modelo para determinar o tamanho e a direção de cada atualização.

Otimizadores adaptativos como o Adam vão além do gradiente atual. Eles acompanham gradientes recentes e usam esse histórico ao calcular a próxima atualização de parâmetros.

Se o Adam já faz isso, o que o Nested Learning adiciona?

A diferença está no que pode ser aprendido. No deep learning padrão, as regras que governam como o Adam atualiza seu estado são definidas antes do treinamento e nunca mudam. O Adam adapta os parâmetros, mas nada adapta o Adam. 

O Nested Learning introduz um processo de meta-aprendizado acima do otimizador que avalia seu desempenho e modifica suas regras ao longo do tempo. O otimizador deixa de ser infraestrutura fixa e passa a ser algo que também pode melhorar.

Como os níveis interagem

Esses níveis não funcionam de forma isolada. A informação flui entre eles, e cada nível influencia como os outros aprendem ao longo do tempo. 

  • O nível de parâmetros constrói gradualmente conhecimento de longo prazo via treinamento. 
  • O nível de memória fornece contexto recente que ajuda o sistema a responder mais rápido a novas informações. 
  • O otimizador determina como os parâmetros são atualizados

Juntos, os níveis permitem equilibrar adaptação de curto prazo e aprendizado de longo prazo.

A arquitetura Hope

Hope é a arquitetura de prova de conceito do artigo — uma variante autoadaptável da arquitetura Titans que o Google construiu para testar se o nested learning funciona na prática. Ela combina uma memória que pode reescrever suas próprias regras de atualização com um Continuum Memory System, para continuar aprendendo em várias velocidades, em vez de congelar após o treinamento.

Titans autoadaptável

Titans contém módulos de memória para armazenar informações que o modelo considera surpreendentes ou importantes. Em vez de depender apenas dos parâmetros, o modelo leva adiante informações úteis por meio desses módulos de memória.

A Hope vai além. Conforme entram novos dados, os módulos de memória continuam se atualizando. O sistema também ajusta as regras que usará em atualizações futuras. É por isso que a arquitetura é chamada de autoadaptável.

Continuum Memory System

A maioria das arquiteturas de memória divide em dois baldes: curto e longo prazo. A informação vive em um armazenamento rápido e temporário ou é consolidada em armazenamento estável. A Hope substitui essa divisão binária por um contínuo — um espectro de módulos de memória que atualizam em diferentes velocidades.

Alguns componentes de memória atualizam rapidamente e capturam informações recentes. Outros mudam mais devagar e preservam conhecimento estável acumulado ao longo de períodos maiores. Isso permite que novas informações entrem pelas camadas que se atualizam rápido sem atrapalhar imediatamente as memórias mais lentas e estáveis.

Continuum Memory SystemComo a Hope se sai

O artigo avaliou a Hope em modelagem de linguagem, raciocínio com contexto longo, aprendizado contínuo e incorporação de conhecimento, usando diferentes baselines conforme a tarefa. Modelagem de linguagem e raciocínio de senso comum foram comparados a Titans, Samba e um transformer padrão, enquanto as tarefas de recuperação de longo contexto compararam Hope e Titans com TTT e Mamba2.

Nos benchmarks de modelagem de linguagem e raciocínio de senso comum, a Hope obteve perplexidade menor e acurácia maior do que as três baselines.

Gráfico de barras mostra o modelo Hope superando Titans, Samba e Transformer tanto em modelagem de linguagem quanto em raciocínio de senso comum.

Os resultados mais reveladores vieram de tarefas que exigem recuperar uma informação específica enterrada em um contexto longo. O artigo testou várias variantes de dificuldade crescente: pass-key retrieval, number retrieval e, a mais difícil, word-level retrieval. A Hope superou as baselines em todas as variantes, com o design de CMS contribuindo especificamente para os ganhos em longo contexto.

A arquitetura também vai bem em benchmarks de aprendizado contínuo. Ao treinar em sequências de tarefas que tipicamente causam esquecimento catastrófico, a Hope retém mais conhecimento previamente aprendido do que os modelos de comparação relatados no artigo.

Nested Learning vs. outras abordagens de aprendizado contínuo

O Nested Learning não é a primeira tentativa de lidar com o esquecimento catastrófico. Há anos, pesquisadores propõem técnicas de aprendizado contínuo para manter conhecimento passado enquanto se aprendem novas tarefas. Vamos ver as diferenças-chave entre as abordagens.

Abordagem

Elastic Weight Consolidation (EWC)

Progressive Neural Networks

Experience Replay

Nested Learning

Mecanismo central

Adiciona um termo de regularização para desacelerar atualizações em pesos importantes para tarefas anteriores.

Adiciona uma nova rede dedicada para cada nova tarefa, com conexões laterais às redes anteriores, permitindo transferência de conhecimento.

Armazena e reproduz amostras de tarefas passadas junto das novas durante o treinamento.

Organiza o aprendizado em múltiplos níveis que interagem e operam em diferentes escalas de tempo

Como evita o esquecimento

Preserva pesos de tarefas anteriores; o conhecimento prévio é mantido ao aprender novas tarefas.

Redes anteriores são congeladas e salvas. Novas tarefas recebem sua própria rede, sem interferência.

Mistura exemplos passados no treinamento atual.

Níveis atualizam em frequências distintas; informação nova entra pelos componentes rápidos sem deslocar de imediato o conhecimento estável dos mais lentos.

Sobrecarga computacional

Baixa a moderada

Alta

Moderada a alta, escala com o tamanho do buffer de replay. 

Ainda em avaliação

Escalabilidade

Moderada; proteger mais parâmetros ao longo do tempo pode reduzir a capacidade de aprender novas tarefas.

Limitada, pois o tamanho do modelo cresce a cada nova tarefa

Eficaz, mas exige manter buffers de replay

Projetada para escalar, mas ainda é pesquisa inicial.

Maturidade

Consolidada

Consolidada

Ampla adoção

Pesquisa em estágio inicial

todos como EWC, Progressive Neural Networks e Experience Replay são redes neurais que reduzem o esquecimento durante o treinamento. A arquitetura subjacente permanece, em grande parte, a mesma. 

O Nested Learning repensa a arquitetura em si, para que o aprendizado aconteça em vários níveis e escalas de tempo: memórias que mudam rápido lidam com experiências recentes, enquanto parâmetros mais lentos capturam conhecimento de longo prazo.

Nested Learning na prática

Reproduções não oficiais da comunidade começaram a aparecer no GitHub, dando aos pesquisadores um caminho para experimentar a arquitetura e tentar reproduzir os resultados publicados.

Dito isso, o nested learning não tem integrações oficiais com os principais frameworks de deep learning, e você não pode simplesmente dar um pip install em nested learning e adicioná-lo a um projeto em PyTorch ou JAX. Construir e avaliar esses modelos ainda exige trabalhar diretamente com código de pesquisa.

Mas a direção mira a adoção pela comunidade. Então, fique de olho na integração de módulos Hope ou Continuum Memory System (CMS) em frameworks mainstream e em sistemas de produção.

Considerações finais

O Nested Learning questiona uma das premissas centrais do deep learning moderno. Em vez de tornar modelos mais capazes empilhando camadas, ele explora se a inteligência pode emergir de múltiplos processos de aprendizado operando em escalas de tempo diferentes.

Essa mudança também transforma nossa visão sobre otimização. O deep learning tradicional trata a arquitetura do modelo e o algoritmo de aprendizado como componentes separados. O Nested Learning aproxima esses elementos, com o objetivo de tornar o próprio aprendizado hierárquico.

Ainda é cedo. O Nested Learning continua sendo um campo ativo de pesquisa, e muitas de suas ideias precisam de validação mais ampla antes de se tornarem parte do machine learning mainstream. Se você quer fortalecer a base nos conceitos por trás do nested learning — incluindo redes neurais, otimização e mecanismos de memória — recomendo conferir nossa trilha completa Deep Learning in Python.

Perguntas frequentes sobre Nested Learning

O que é aprendizado contínuo em LLM?

Aprendizado contínuo em LLMs é a capacidade de um modelo continuar aprendendo com novos dados sem esquecer o que já sabia. A maioria dos LLMs não faz isso bem nativamente. Quando você faz fine-tuning com novas informações, eles tendem a sobrescrever conhecimento antigo. A pesquisa em aprendizado contínuo busca resolver exatamente esse problema.

O nested learning exige vários modelos de machine learning?

Não necessariamente. O nested learning diz mais respeito a organizar tarefas de aprendizado em múltiplos níveis do que usar vários modelos. Algumas implementações usam um único modelo com estágios de treinamento aninhados ou representações hierárquicas, enquanto outras combinam vários modelos especializados.

O nested learning é computacionalmente caro?

Pode ser, mas nem sempre de forma significativa. O custo adicional vem de manter e atualizar o processo de aprendizado de nível superior junto com o treinamento regular do modelo. Arquiteturas modernas de nested learning, como a Hope, são projetadas com eficiência em mente, o que as torna práticas para muitos ambientes de pesquisa. No entanto, a implantação em produção ainda é um ponto em aberto.

Quando evitar o uso de nested learning?

Se sua distribuição de dados não vai mudar e você só precisa de desempenho forte em um benchmark fixo, o nested learning adiciona complexidade sem muito retorno. Também vale evitar quando a interpretabilidade é crítica. Quanto mais o processo de aprendizado se autoajusta, mais difícil fica explicar o que o modelo está fazendo e por quê.

Como escolher entre nested learning e transfer learning?

Eles resolvem problemas diferentes. Transfer learning aproveita o que um modelo aprendeu em um domínio e aplica em outro — é uma adaptação pontual. O nested learning trata de construir um sistema que continua se adaptando ao longo do tempo conforme chegam novas informações. Se você tem uma tarefa-alvo fixa, transfer learning é mais simples e geralmente suficiente. Se o ambiente é dinâmico e o modelo precisa se manter atualizado, nested learning é mais adequado.


Srujana Maddula's photo
Author
Srujana Maddula
LinkedIn

Srujana é redatora freelancer de tecnologia e tem um diploma de quatro anos em Ciência da Computação. Escrever sobre vários tópicos, incluindo ciência de dados, computação em nuvem, desenvolvimento, programação, segurança e muitos outros, é algo natural para ela. Ela gosta de literatura clássica e de explorar novos destinos.

Tópicos

Melhores cursos de deep learning

Programa

Aprendizagem profunda Em Python

18 h
Continue sua jornada de machine learning até a aprendizagem profunda. Use a biblioteca PyTorch para criar redes neurais para modelar diferentes tipos de dados.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

blog

A maldição da dimensionalidade no aprendizado de máquina: Desafios, impactos e soluções

Explore a maldição da dimensionalidade na análise de dados e no aprendizado de máquina, incluindo seus desafios, efeitos nos algoritmos e técnicas como PCA, LDA e t-SNE para combatê-la.
Abid Ali Awan's photo

Abid Ali Awan

7 min

blog

O que é aprendizagem preguiçosa?

Os algoritmos de aprendizagem preguiçosa funcionam memorizando os dados de treinamento em vez de construir um modelo geral.
Abid Ali Awan's photo

Abid Ali Awan

5 min

blog

O que é aprendizagem incremental?

O aprendizado incremental é uma metodologia de aprendizado de máquina em que um modelo de IA aprende novas informações ao longo do tempo, mantendo e desenvolvendo o conhecimento anterior.
Abid Ali Awan's photo

Abid Ali Awan

9 min

blog

O que é aprendizagem contínua? Revolucionando o aprendizado de máquina e a adaptabilidade

Uma cartilha sobre aprendizado contínuo: uma evolução do aprendizado de máquina tradicional que incorpora novos dados sem retreinamento periódico.

Yolanda Ferreiro

7 min

blog

Introdução ao aprendizado não supervisionado

Saiba mais sobre o aprendizado não supervisionado, seus tipos - agrupamento, mineração de regras de associação e redução de dimensionalidade - e como ele se difere do aprendizado supervisionado.
Kurtis Pykes 's photo

Kurtis Pykes

9 min

blog

8 modelos de aprendizado de máquina explicados em 20 minutos

Descubra tudo o que você precisa saber sobre os tipos de modelos de aprendizado de máquina, inclusive para que eles são usados e exemplos de como implementá-los.
Natassha Selvaraj's photo

Natassha Selvaraj

15 min

Ver MaisVer Mais