Hoppa till huvudinnehållet

Nested Learning: en lösning på katastrofal glömska

Katastrofal glömska gör kontinuerligt lärande svårt. Se hur Nested Learning använder flera tidsskalor för att behålla gammal kunskap samtidigt som den lär sig nya uppgifter.
Uppdaterad 27 juli 2026  · 11 min läsa

Utforska med AI

Öppna i ChatGPTÖppna i ClaudeÖppna i Perplexity

Om du har tränat ett neuralt nätverk har du förmodligen anropat optimizer.step() tusentals gånger. Du vet att den använder beräknade gradienter för att uppdatera modellens vikter och minska träningsförlusten, och oftast stannar berättelsen där.

Men nested learning ber dig att se på optimeraren på ett annat sätt. Den tolkar adaptiva optimerare som Adam som inlärningsprocesser med eget, föränderligt tillstånd. Nested Learning introducerades av Google Research i NeurIPS 2025-artikeln "Nested Learning: The Illusion of Deep Learning Architectures."

I den här artikeln utforskar vi vad nested learning är, hur det fungerar, varför det spelar roll och hur Hope-arkitekturen omsätter det i praktiken. Om du har tränat en modell med Adam eller SGD tidigare har du redan bakgrunden som behövs för att hänga med.

Sammanfattning

  • Nested Learning är ett maskininlärningsparadigm från Google Research som betraktar en modell som en uppsättning inbäddade optimeringsproblem som lär sig i olika hastigheter, snarare än en enda arkitektur som tränas av en separat optimerare.
  • Det siktar in sig på katastrofal glömska: problemet där finjustering på ny data skriver över vad en modell redan kunde, vilket är det främsta som gör kontinuerligt lärande svårt.
  • Den grundläggande förskjutningen är att behandla arkitekturen och optimeraren som samma typ av sak, olika nivåer av lärande som uppdaterar i olika takt, så att ny information kan tas in via snabba komponenter utan att radera långsam, stabil kunskap.
  • Hope är artikelns proof-of-concept-arkitektur: en självmodifierande variant av Titans i par med ett Continuum Memory System (CMS), där minnesmoduler uppdateras över ett spektrum av hastigheter i stället för en fast uppdelning i kort- och långtidsminne.
  • I artikelns tester slog Hope baslinjer som Titans, Samba och en standardtransformer på språkmodellering och sunt förnuft-resonemang, och stod sig på långkontextåterhämtning och kontinuerligt lärande.
  • Det är tidig forskning. Det finns ingen officiell implementation och ingen pip install, bara community-reproduktioner på GitHub, så se det som en riktning att följa snarare än något produktionsklart.

Vad är Nested Learning?

Nested Learning är ett maskininlärningsparadigm som ser en enskild modell inte som en arkitektur som tränas av en separat optimerare, utan som en uppsättning inbäddade optimeringsproblem som var och en lär sig i sin egen takt. Det ramar in modellens arkitektur och dess träningsalgoritm som samma typ av företeelse, olika nivåer av lärande som körs och anpassas samtidigt.

Det organiserar ett maskininlärningssystem i flera inlärningsnivåer som verkar på olika tidsskalor. 

  • Parameternivån lär sig långsamt över tusentals träningssteg. 
  • Minnesnivån avgör vilken information som ska behållas över senaste indata. 
  • Optimerarnivån lär sig hur nivåerna under den ska uppdateras. 

Högre nivåer kan påverka hur lägre nivåer beter sig, vilket gör strukturen hierarkisk snarare än bara modulär.

Grundprinciper för nested learning

Nested Learning följer dessa fyra nyckelprinciper:

  • Arkitektur och optimering ingår i samma lärandesystem. I Nested Learning blir optimeraren en del av inlärningsprocessen och kan anpassa sig över tid.
  • Olika komponenter lär sig i olika hastighet. En modells kärnparametrar kan uppdateras långsamt över tusentals exempel, medan en korttidskontext-mekanism uppdateras vid varje ny inmatning, och ett minnessystem uppdateras någonstans däremellan.
  • Djup kommer från inbäddade inlärningsprocesser. Traditionell deep learning skapar djup genom att lägga till lager. Nested Learning skapar djup genom att stapla flera nivåer av inlärning och anpassning, där parametrar, minnessystem, optimerare och uppdateringsmekanismer alla kan lära sig på olika tidsskalor.
  • Inlärning kan fortsätta efter driftsättning. Komponenter som minnessystem och inlärningsmekanismer kan fortsätta att anpassa sig även under inferens.

Nested learning vs traditionell deep learning

I åratal har vi förlitat oss på deep learning-arkitektur, där data flödar genom ett neuralt nätverk, man mäter hur fel modellens förutsägelser är (kallat förlust), och kör en optimerare som justerar modellens parametrar för att minska felet. 

Du upprepar detta tills modellen är tillräckligt bra. Sedan fryser du parametrarna och driftsätter modellen. Från och med då lär den sig inte av ny indata, anpassar sig inte till skift i datan och blir inte bättre med användning.

Nested Learning ändrar på det. Förutom modellens parametrar fortsätter även minnesmoduler, optimerare och andra komponenter att lära sig över tid.

Faktor

Traditionell deep learning

Nested learning

Djup 

Djup kommer från att stapla neurala nätverkslager.

Djup kommer från att nästla inlärningsprocesser i andra inlärningsprocesser.

Inlärning

Inlärning sker främst under träning.

Inlärning sker under träning och fortsätter efter driftsättning.

Optimerare

Ett fast verktyg som uppdaterar modellvikter.

En adaptiv komponent som kan lära sig och uppdatera sina egna regler.

Minne

Inkodat i modellparametrar och korttidskontext.

Existerar över flera nivåer och tidsskalor.

Inferens

Modellvikter är fasta.

Vissa komponenter kan fortsätta att anpassa sig under inferens.

Varför Nested Learning är viktigt

En modell lär sig ny information genom att uppdatera sina parametrar, men samma uppdateringar kan skriva över kunskap den lärt sig tidigare. Detta fenomen kallas katastrofal glömska.

Forskare har introducerat tekniker som att frysa lager, regulariseringsmetoder som Elastic Weight Consolidation (EWC) och replay-buffertar för att bevara tidigare kunskap samtidigt som man lär sig nya uppgifter. Men dessa metoder är utformade för att skydda en modell från att glömma, inte för att i grunden ändra hur inlärning sker.

Nested Learning menar att detta enkel-tidsskaleupplägg är en av orsakerna till att kontinuerligt lärande förblir så svårt. I stället för att förlita sig på en enda uppsättning parametrar för att absorbera varje ny informationsbit, sprider det anpassningen över flera inlärningsnivåer. 

Olika nivåer anpassar sig i olika hastigheter, vilket gör det möjligt att ta in ny information utan att ständigt skriva om äldre kunskap. Denna idé är delvis inspirerad av hur mänsklig kognition fungerar. All inlärning sker ju inte i samma takt:

  • Reflexer kan anpassas nästan omedelbart. 
  • Korttidsminnen formas över minuter eller timmar. 
  • Övertygelser, vanor och expertis kan ta månader eller år att utveckla.

Hur Nested Learning fungerar

Nested Learning organiserar ett maskininlärningssystem i nivåer, var och en en distinkt inlärningsprocess med egen roll och uppdateringshastighet. För att förstå hur de fungerar är det hjälpsamt att gå igenom varje nivå och se hur de hänger ihop.

Nested learning: Learning at multiple levels

Parameternivån

Parametrar är vikterna i det neurala nätverket som lagrar vad modellen har lärt sig från sina träningsdata. Under träning uppdaterar optimeraren dessa vikter efter varje batch med hjälp av de beräknade gradienterna. 

Varje uppdatering är liten, så meningsfulla förändringar sker gradvis över många träningssteg. Därför lär sig parameternivån stabil, långsiktig kunskap men anpassar sig långsamt till ny information.

Minnesnivån

Minnesnivån fångar information från senaste indata som parameternivån är för långsam för att lära sig. 

I stället för att lagra allt den ser, behåller den den mest användbara informationen och förkastar resten. Detta gör att modellen kan anpassa sig till en ny kontext utan att omedelbart uppdatera sin långsiktiga kunskap.

Optimerarnivån

Optimeraren avgör hur modellens parametrar ska uppdateras under träning. Den använder gradienterna beräknade från modellens förutsägelser för att bestämma storlek och riktning på varje uppdatering.

Adaptiva optimerare som Adam gör mer än att använda aktuell gradient. De håller också reda på senaste gradienter och använder den historiken när nästa parameteruppdatering beräknas.

Om Adam redan gör detta, vad tillför Nested Learning?

Skillnaden ligger i vad som kan läras. I standard deep learning är reglerna som styr hur Adam uppdaterar sitt tillstånd fastställda innan träningen börjar och ändras aldrig. Adam anpassar parametrarna, men ingenting anpassar Adam. 

Nested Learning introducerar en metalärandeprocess ovanför optimeraren som kan utvärdera hur optimeraren presterar och modifiera dess regler över tid. Optimeraren slutar vara fast infrastruktur och blir något som själv kan förbättras.

Hur nivåerna samverkar

Dessa olika nivåer arbetar inte oberoende. Information flödar mellan dem, och varje nivå påverkar hur de andra lär sig över tid. 

  • Parameternivån bygger gradvis långsiktig kunskap genom träning. 
  • Minnesnivån ger närliggande kontext som hjälper systemet att reagera snabbare på ny information. 
  • Optimeraren avgör hur parametrarna uppdateras

Tillsammans gör nivåerna att modellen kan balansera kortsiktig anpassning med långsiktigt lärande.

Hope-arkitekturen

Hope är artikelns proof-of-concept-arkitektur, en självmodifierande variant av Titans-arkitekturen som Google byggde för att testa om nested learning faktiskt fungerar i praktiken. Den parar ett minne som kan skriva om sina egna uppdateringsregler med ett Continuum Memory System, så att den kan fortsätta lära i flera olika hastigheter i stället för att frysa efter träning.

Självmodifierande Titans

Titans innehåller minnesmoduler för att lagra information som modellen anser överraskande eller viktig. I stället för att bara förlita sig på sina parametrar bär modellen vidare användbar information genom dessa minnesmoduler.

Hope går ett steg längre. När ny data kommer in fortsätter minnesmodulerna att uppdateras. Systemet justerar också de regler det använder för framtida uppdateringar. Därför kallas arkitekturen självmodifierande.

Continuum Memory System

De flesta minnesarkitekturer delar upp minnet i två fack: korttids- och långtidsminne. Information lever antingen i ett snabbt, temporärt lager eller konsolideras till stabil långtidslagring. Hope ersätter den binära uppdelningen med ett kontinuum, ett spektrum av minnesmoduler som uppdateras i olika hastigheter.

Vissa minneskomponenter uppdaterar snabbt och fångar ny information. Andra förändras långsammare och bevarar stabil kunskap som ackumulerats över längre perioder. Det betyder att ny information kan komma in via de snabbuppdaterande lagren utan att omedelbart störa långsammare, mer stabilt minne.

Continuum Memory SystemHur Hope presterar

Artikeln utvärderade Hope på språkmodellering, långkontextresonemang, kontinuerligt lärande och kunskapsinkorporering, med olika baslinjer för olika uppgifter. Språkmodellering och sunt förnuft-resonemang jämfördes med Titans, Samba och en standardtransformer, medan uppgifter för långkontextåterhämtning jämförde Hope och Titans med TTT och Mamba2.

På benchmarktester för språkmodellering och sunt förnuft-resonemang uppnådde Hope lägre perplexitet och högre noggrannhet än alla tre baslinjer.

Stapeldiagram som visar att Hope-modellen överträffar Titans, Samba och Transformer på både språkmodellering och sunt förnuft-prestandamått.

De mer talande resultaten kom från uppgifter som kräver att modellen hämtar ett specifikt informationsstycke begravt i en lång kontext. Artikeln testade flera varianter med ökande svårighet: nyckelåterhämtning, sifferåterhämtning och den svåraste varianten, ordnivååterhämtning. Hope överträffade baslinjerna i alla varianter, där CMS-designen bidrog specifikt till vinsterna i långkontext.

Arkitekturen presterar också väl på benchmarktester för kontinuerligt lärande. När den tränas över sekvenser av uppgifter som typiskt orsakar katastrofal glömska, behåller Hope mer tidigare inlärd kunskap än jämförelsemodellerna som rapporteras i artikeln.

Nested Learning vs andra metoder för kontinuerligt lärande

Nested Learning är inte det första försöket att åtgärda katastrofal glömska. I åratal har forskare föreslagit tekniker för kontinuerligt lärande för att låta modeller behålla tidigare inlärd kunskap samtidigt som de lär sig nya uppgifter. Låt oss se de viktigaste skillnaderna mellan föreslagna tillgångssätt.

Tillvägagångssätt

Elastic Weight Consolidation (EWC)

Progressive Neural Networks

Experience Replay

Nested Learning

Kärnmekanism

Lägger till en regulariseringsterm för att bromsa uppdateringar av vikter som var viktiga för tidigare uppgifter.

Lägger till ett nytt dedikerat nätverk för varje ny uppgift, med laterala kopplingar till tidigare inlärda nätverk, så att kunskap kan överföras framåt.

Lagrar och återspelar exempel från tidigare uppgifter tillsammans med nya under träning.

Organiserar inlärning i flera interagerande nivåer som verkar på olika tidsskalor

Hur den förhindrar glömska

Bevarar tidigare uppgifters vikter; tidigare kunskap behålls samtidigt som nya uppgifter lärs in.

Tidigare nätverk fryses och sparas. Nya uppgifter får egna nätverk, så det sker ingen störning.

Blandar in tidigare exempel i den aktuella träningen.

Nivåer uppdateras med olika frekvens, så ny information kommer in via snabba komponenter utan att omedelbart tränga undan stabil kunskap i långsammare komponenter.

Beräkningsmässig overhead

Låg till måttlig

Hög

Måttlig till hög, skalar med storleken på replay-bufferten. 

Utvärderas fortfarande

Skalbarhet

Måttlig; att skydda fler parametrar över tid kan minska modellens förmåga att lära nya uppgifter.

Begränsad eftersom modellstorleken växer med varje ny uppgift

Effektiv men kräver underhåll av replay-buffertar

Designad för att skala, men fortfarande tidig forskning.

Mognad

Väletablerad

Väletablerad

Allmänt använd

Tidig forskning

Metoder som EWC, Progressive Neural Networks och Experience Replay är neurala nätverk som bromsar glömska under träning. Den underliggande arkitekturen förblir till stor del densamma. 

Nested Learning tänker om själva arkitekturen, så att inlärning sker över flera nivåer och tidsskalor: snabbt föränderligt minne hanterar färska erfarenheter, medan långsammare föränderliga parametrar fångar långsiktig kunskap.

Nested Learning i praktiken

Inofficiella community-reproduktioner har börjat dyka upp på GitHub, vilket ger forskare en möjlighet att experimentera med arkitekturen och försöka reproducera de publicerade resultaten.

Det sagt, Nested learning har inga officiella integrationer med stora deep learning-ramverk, och du kan inte bara pip install nested learning och lägga till det i ett befintligt PyTorch- eller JAX-projekt. Att bygga och utvärdera dessa modeller kräver fortfarande att man arbetar direkt med forskningskod.

Men riktningen är inriktad på community-adoption. Så håll utkik efter att Hope- eller Continuum Memory System (CMS)-moduler integreras i mainstream-ramverk och tas i bruk i produktionssystem.

Avslutande tankar

Nested Learning utmanar en av grundantagandena bakom modern deep learning. I stället för att göra modeller mer kapabla genom att stapla fler lager, undersöker det om intelligens kan växa fram ur flera inlärningsprocesser som verkar på olika tidsskalor.

Den förskjutningen ändrar också hur vi tänker kring optimering. Traditionell deep learning behandlar modellarkitekturen och inlärningsalgoritmen som separata komponenter. Nested Learning för dem närmare varandra med målet att göra själva lärandet hierarkiskt.

Det är fortfarande tidiga dagar. Nested Learning är fortsatt ett aktivt forskningsområde, och många av dess idéer kommer att behöva bredare validering innan de blir en del av mainstream-maskininlärning. Om du vill bygga en starkare grund i koncepten bakom nested learning, inklusive neurala nätverk, optimering och minnesmekanismer, rekommenderar jag att du kollar in vår heltäckande Deep Learning in Python-track.

Nested Learning: vanliga frågor

Vad är kontinuerligt lärande i LLM?

Kontinuerligt lärande i LLM:er är en modells förmåga att fortsätta lära sig av ny data utan att glömma sin tidigare kunskap. De flesta LLM:er gör inte detta bra direkt ur lådan. När du finjusterar dem på ny information tenderar de att skriva över gammal kunskap. Forskningen om kontinuerligt lärande handlar specifikt om att lösa just det.

Kräver nested learning flera maskininlärningsmodeller?

Inte nödvändigtvis. Nested learning handlar mer om att organisera inlärningsuppgifter i flera nivåer än om att använda flera modeller. Vissa implementationer använder en enda modell med inbäddade träningssteg eller hierarkiska representationer, medan andra kombinerar flera specialiserade modeller.

Är nested learning beräkningsmässigt dyrt?

Det kan det vara, men inte alltid särskilt mycket. Den extra kostnaden kommer av att underhålla och uppdatera den högre inlärningsprocessen parallellt med modellens vanliga träning. Moderna nested learning-arkitekturer som Hope är utformade med effektivitet i åtanke, vilket gör dem praktiska i många forskningsmiljöer. Däremot är driftsättning av nested learning i produktion fortfarande ett öppet område.

När bör du undvika att använda nested learning?

Om din datadistribution inte kommer att förändras och du bara behöver stark prestanda på ett fast benchmark, tillför nested learning komplexitet utan särskilt stor utdelning. Det är också värt att undvika när tolkningsbarhet är mycket viktigt. Ju mer inlärningsprocessen anpassar sig själv, desto svårare blir det att förklara vad modellen faktiskt gör och varför.

Hur väljer du mellan nested learning och transfer learning?

De löser olika problem. Transfer learning tar det en modell lärt sig i en domän och tillämpar det i en annan. Det är en engångsanpassning. Nested learning handlar om att bygga ett system som fortsätter att anpassa sig över tid när ny information kommer. Om du har en fast måluppgift är transfer learning enklare och vanligtvis tillräckligt. Om din miljö är dynamisk och modellen behöver vara aktuell, är nested learning mer lämpligt.

Ämnen

Toppkurser i deep learning

track

Djupinlärning i Python

18 timmar
Fortsätt din maskininlärningsresa in i djupinlärning. Använd PyTorch-biblioteket för att skapa neurala nätverk för att modellera olika datatyper.
Se detaljerRight Arrow
Starta Kursen
Se merRight Arrow