Перейти к основному контенту

Вложенное обучение: решение проблемы катастрофического забывания

Катастрофическое забывание усложняет непрерывное обучение. Посмотрите, как вложенное обучение использует разные временные шкалы, чтобы сохранять старые знания и осваивать новые задачи.
Обновлено 27 июл. 2026 г.  · 11 мин читать

Изучить с помощью AI

Открыть в ChatGPTОткрыть в ClaudeОткрыть в Perplexity

Если вы обучали нейросеть, вы, вероятно, вызывали optimizer.step() тысячи раз. Вы знаете, что он использует вычисленные градиенты для обновления весов модели и уменьшения функции потерь при обучении — обычно на этом история заканчивается.

Но вложенное обучение предлагает по-новому взглянуть на оптимизатор. Оно трактует адаптивные оптимизаторы, такие как Adam, как обучающиеся процессы с собственной эволюционирующей состоянием. Вложенное обучение было представлено Google Research в статье NeurIPS 2025 «Nested Learning: The Illusion of Deep Learning Architectures».

В этой статье мы разберём, что такое вложенное обучение, как оно работает, зачем оно нужно и как архитектура Hope реализует этот подход. Если вы раньше обучали модель с Adam или SGD, у вас уже есть необходимая база, чтобы следить за изложением.

Итоги вкратце

  • Вложенное обучение — это парадигма машинного обучения от Google Research, в которой модель рассматривается как набор вложенных задач оптимизации, обучающихся с разной скоростью, а не как одна архитектура, обучаемая отдельным оптимизатором.
  • Его цель — катастрофическое забывание: проблема, при которой дообучение на новых данных затирает ранее усвоенные знания модели. Именно это больше всего усложняет непрерывное обучение.
  • Ключевой сдвиг — относиться к архитектуре и оптимизатору как к сущностям одного типа: это разные уровни обучения, обновляющиеся с разной частотой, благодаря чему новая информация может поступать через быстрые компоненты, не стирая медленное, стабильное знание.
  • Hope — демонстрационная архитектура из статьи: самоизменяющийся вариант Titans в паре с Continuum Memory System (CMS), где модули памяти обновляются с континуумом скоростей, а не только в фиксированном разделении на краткосрочную и долгосрочную память.
  • В экспериментах из статьи Hope превзошла базовые модели — Titans, Samba и стандартный трансформер — в языковом моделировании и тестах на здравый смысл, а также показала хорошие результаты в задачах извлечения из длинного контекста и непрерывного обучения.
  • Это ранняя стадия исследований. Официальной реализации нет и pip install не существует — только репродукции сообщества на GitHub, так что воспринимайте это как направление для наблюдения, а не готовое к продакшену решение.

Что такое вложенное обучение?

Вложенное обучение — это парадигма машинного обучения, в которой единая модель рассматривается не как одна архитектура, обучаемая отдельным оптимизатором, а как набор вложенных задач оптимизации, каждая из которых учится со своей скоростью. Она заново определяет архитектуру модели и алгоритм обучения как явления одного порядка — это уровни обучения, которые запускаются и адаптируются одновременно.

Она организует систему машинного обучения в несколько уровней, работающих на разных временных масштабах. 

  • Уровень параметров обучается медленно — на протяжении тысяч шагов обучения. 
  • Уровень памяти решает, какую информацию сохранять по недавним входам. 
  • Уровень оптимизатора учится обновлять уровни ниже себя. 

Более высокие уровни могут влиять на поведение нижних, благодаря чему структура является иерархической, а не просто модульной.

Ключевые принципы вложенного обучения

Вложенное обучение основывается на четырёх ключевых принципах:

  • Архитектура и оптимизация — части одной обучающейся системы. В вложенном обучении оптимизатор становится частью процесса обучения и может со временем адаптироваться.
  • Разные компоненты учатся с разной скоростью. Базовые параметры модели могут обновляться медленно — на тысячах примеров, механизм краткосрочного контекста — на каждом новом входе, а система памяти — где-то посередине.
  • Глубина возникает из вложенных процессов обучения. Традиционное глубокое обучение наращивает глубину, добавляя слои. Вложенное обучение создаёт глубину, накладывая друг на друга несколько уровней обучения и адаптации, где параметры, системы памяти, оптимизаторы и механизмы обновления могут учиться на разных временных шкалах.
  • Обучение может продолжаться после развёртывания. Компоненты, такие как системы памяти и механизмы обучения, могут продолжать адаптироваться и во время инференса.

Вложенное обучение vs традиционное глубокое обучение

Годами мы опирались на архитектуру глубокого обучения, где данные проходят через нейросеть, оценивается, насколько ошибочны предсказания модели (это называется функция потерь), и запускается оптимизатор, который настраивает параметры модели, чтобы уменьшить эту ошибку. 

Это повторяется до тех пор, пока модель не станет достаточно хорошей. Затем параметры «замораживаются», и модель разворачивается. С этого момента она не учится на новых входах, не адаптируется к сдвигам в данных и не улучшается с использованием.

Вложенное обучение меняет это. Вместе с параметрами модели со временем продолжают обучаться и модули памяти, оптимизаторы и другие компоненты.e.

Фактор

Традиционное глубокое обучение

Вложенное обучение

Глубина 

Глубина возникает за счёт наслоения слоёв нейросети.

Глубина возникает за счёт вложения одних процессов обучения в другие.

Обучение

Обучение происходит преимущественно во время тренировки.

Обучение идёт во время тренировки и продолжается после развёртывания.

Оптимизатор

Фиксированный инструмент для обновления весов модели.

Адаптивный компонент, который может учиться и менять собственные правила.

Память

Закодирована в параметрах модели и краткосрочном контексте.

Существует на нескольких уровнях и временных шкалах.

Инференс

Веса модели фиксированы.

Некоторые компоненты могут продолжать адаптироваться во время инференса.

Почему важно вложенное обучение

Модель усваивает новую информацию, обновляя параметры, но эти же обновления могут затирать ранее выученные знания. Это явление известно как катастрофическое забывание.

Исследователи предложили техники, такие как «заморозка» слоёв, методы регуляризации вроде Elastic Weight Consolidation (EWC) и буферы повторного проигрывания, чтобы сохранить прежние знания при изучении новых задач. Но эти подходы призваны защитить модель от забывания, а не кардинально изменить сам процесс обучения.

Вложенное обучение утверждает, что подход с одной временной шкалой — одна из причин, по которой непрерывное обучение остаётся таким сложным. Вместо того чтобы полагаться на один набор параметров, поглощающий каждую новую порцию информации, оно распределяет адаптацию по нескольким уровням обучения. 

Разные уровни адаптируются с разной скоростью, что позволяет включать новую информацию, не переписывая постоянно старые знания. Эта идея отчасти вдохновлена работой человеческого мышления. Ведь не всё обучение происходит с одинаковой скоростью:

  • Рефлексы могут адаптироваться почти мгновенно. 
  • Кратковременные воспоминания формируются за минуты или часы. 
  • Убеждения, привычки и экспертиза формируются месяцами и годами.

Как работает вложенное обучение

Вложенное обучение организует систему машинного обучения в уровни — каждый представляет собой отдельный процесс обучения со своей ролью и скоростью обновления. Чтобы понять, как это работает, полезно пройтись по каждому уровню и увидеть их взаимосвязи.

Вложенное обучение: обучение на нескольких уровнях

Уровень параметров

Параметры — это веса внутри нейросети, в которых хранится то, что модель выучила на обучающих данных. Во время обучения оптимизатор обновляет эти веса после каждого батча, используя вычисленные градиенты. 

Каждое обновление невелико, поэтому существенные изменения происходят постепенно, на многих шагах обучения. В результате уровень параметров усваивает стабильные долгосрочные знания, но медленно адаптируется к новой информации.

Уровень памяти

Уровень памяти захватывает информацию из недавних входов, которую уровень параметров усваивает слишком медленно. 

Он не хранит всё подряд, а сохраняет самое полезное и отбрасывает остальное. Это позволяет модели адаптироваться к новому контексту, не обновляя немедленно долгосрочные знания.

Уровень оптимизатора

Оптимизатор решает, как обновлять параметры модели во время обучения. Он использует градиенты, вычисленные из предсказаний модели, чтобы определить величину и направление каждого обновления.

Адаптивные оптимизаторы, такие как Adam, делают больше, чем просто используют текущий градиент. Они также отслеживают недавние градиенты и учитывают эту историю при вычислении следующего обновления параметров.

Если Adam уже это делает, что добавляет вложенное обучение?

Разница в том, что может обучаться. В стандартном глубоком обучении правила, по которым Adam обновляет своё состояние, фиксируются до начала обучения и не меняются. Adam адаптирует параметры, но никто не адаптирует сам Adam. 

Вложенное обучение вводит процесс мета-обучения над оптимизатором, который может оценивать его работу и со временем модифицировать его правила. Оптимизатор перестаёт быть фиксированной инфраструктурой и становится тем, что само может улучшаться.

Как уровни взаимодействуют

Эти уровни не работают изолированно. Между ними идёт обмен информацией, и каждый уровень влияет на то, как другие учатся со временем. 

  • Уровень параметров постепенно накапливает долгосрочные знания в процессе обучения. 
  • Уровень памяти предоставляет недавний контекст, помогая системе быстрее реагировать на новую информацию. 
  • Оптимизатор определяет, как обновляются параметры

Совместно уровни позволяют модели балансировать краткосрочную адаптацию и долгосрочное обучение.

Архитектура Hope

Hope — это демонстрационная архитектура из статьи: самоизменяющийся вариант архитектуры Titans, созданный Google для проверки того, работает ли вложенное обучение на практике. Она сочетает память, способную переписывать собственные правила обновления, с Continuum Memory System, чтобы модель могла продолжать учиться на нескольких скоростях вместо «заморозки» после обучения.

Самоизменяющиеся Titans

Titans включают модули памяти для хранения информации, которую модель считает удивительной или важной. Вместо того чтобы полагаться только на свои параметры, модель переносит полезную информацию вперёд через эти модули памяти.

Hope идёт дальше. По мере поступления новых данных модули памяти продолжают обновляться. Система также настраивает правила, которыми она будет руководствоваться при будущих обновлениях. Поэтому архитектура называется самоизменяющейся.

Continuum Memory System

Большинство архитектур памяти делят её на два «ведра»: краткосрочную и долгосрочную. Информация либо хранится во временном быстром буфере, либо консолидируется в стабильном долговременном хранилище. Hope заменяет это бинарное разделение континуумом — спектром модулей памяти, обновляющихся с разной скоростью.

Некоторые компоненты памяти обновляются быстро и фиксируют недавнюю информацию. Другие меняются медленнее и сохраняют стабильные знания, накопленные за более длительные периоды. Это значит, что новая информация может входить через быстро обновляющиеся слои, не нарушая сразу медленную, более стабильную память.

Continuum Memory SystemКак показывает себя Hope

В статье оценивали Hope в задачах языкового моделирования, рассуждений на длинном контексте, непрерывного обучения и инкорпорации знаний, используя разные бейслайны для разных задач. Языковое моделирование и здравый смысл сравнивались с Titans, Samba и стандартным трансформером, а в задачах извлечения из длинного контекста Hope и Titans сравнивались с TTT и Mamba2.

На бенчмарках языкового моделирования и здравого смысла Hope показала меньшую перплексию и более высокую точность, чем все три бейслайна.

Столбчатая диаграмма, показывающая, что модель Hope превосходит Titans, Samba и Transformer как в языковом моделировании, так и в задачах на здравый смысл.

Ещё более показательные результаты были в задачах, где модели нужно извлечь конкретный фрагмент информации, спрятанный в длинном контексте. В статье тестировались несколько вариантов по возрастанию сложности: извлечение пароля, числа и самый сложный вариант — извлечение на уровне слов. Hope превзошла базовые модели во всех вариантах, причём вклад в улучшение на длинном контексте внёс именно дизайн CMS.

Архитектура также хорошо проявила себя на бенчмарках непрерывного обучения. При обучении на последовательностях задач, которые обычно вызывают катастрофическое забывание, Hope сохраняла больше ранее усвоенных знаний, чем модели сравнения, приведённые в статье.

Вложенное обучение и другие подходы к непрерывному обучению

Вложенное обучение — не первая попытка решить проблему катастрофического забывания. На протяжении многих лет исследователи предлагали методы непрерывного обучения, позволяющие моделям сохранять ранее усвоенные знания при изучении новых задач. Рассмотрим ключевые различия между предлагавшимись подходами.

Подход

Elastic Weight Consolidation (EWC)

Progressive Neural Networks

Experience Replay

Вложенное обучение

Основной механизм

Добавляет член регуляризации, замедляющий обновления весов, важных для предыдущих задач.

Добавляет новую выделенную сеть для каждой новой задачи с латеральными связями к ранее обученным сетям, чтобы знания передавались вперёд.

Хранит и воспроизводит примеры из прошлых задач вместе с новыми во время обучения.

Организует обучение в несколько взаимодействующих уровней, работающих на разных временных шкалах

Как предотвращает забывание

Сохраняет веса предыдущих задач; ранние знания удерживаются при изучении новых.

Ранние сети замораживаются и сохраняются. Новые задачи получают собственную сеть, поэтому вмешательства нет.

Смешивает прошлые примеры с текущим обучением.

Уровни обновляются с разной частотой, поэтому новая информация поступает через быстрые компоненты, не вытесняя сразу стабильные знания в медленных.

Вычислительные накладные расходы

Низкие или умеренные

Высокие

От умеренных до высоких, растут с размером буфера повторов. 

В процессе оценки

Масштабируемость

Умеренная; по мере защиты всё большего числа параметров способность модели учиться новым задачам может падать.

Ограниченная, поскольку размер модели растёт с каждой новой задачей

Эффективна, но требует поддержания буферов повторов

Задумана как масштабируемая, но всё ещё на ранней стадии исследований.

Зрелость

Хорошо устоявшийся подход

Хорошо устоявшийся подход

Широко используется

Ранняя стадия исследований

Методы вроде EWC, Progressive Neural Networks и Experience Replay — это нейросетевые техники, которые замедляют забывание во время обучения. Базовая архитектура при этом в целом остаётся прежней. 

Вложенное обучение переосмысливает саму архитектуру, чтобы обучение происходило на нескольких уровнях и временных шкалах: быстро меняющаяся память обрабатывает недавний опыт, а медленнее меняющиеся параметры фиксируют долгосрочные знания.

Вложенное обучение на практике

Неофициальные репродукции от сообщества начали появляться на GitHub, давая исследователям возможность поэкспериментировать с архитектурой и попробовать воспроизвести опубликованные результаты.

При этом у вложенного обучения нет официальных интеграций с основными фреймворками глубокого обучения, и вы не можете просто pip install nested learning и подключить его к существующему проекту на PyTorch или JAX. Построение и оценка таких моделей по-прежнему требуют работы напрямую с исследовательским кодом.

Но направление ориентировано на внедрение сообществом. Следите за тем, как модули Hope или Continuum Memory System (CMS) будут интегрироваться в мейнстримные фреймворки и использоваться в продакшене.

Заключение

Вложенное обучение ставит под вопрос одну из базовых предпосылок современного глубокого обучения. Вместо того чтобы делать модели способнее путём наращивания слоёв, оно исследует, может ли интеллект возникать из множества процессов обучения, работающих на разных временных шкалах.

Этот сдвиг меняет и наше представление об оптимизации. Традиционное глубокое обучение рассматривает архитектуру модели и алгоритм обучения как отдельные компоненты. Вложенное обучение сближает их с целью сделать само обучение иерархическим.

Это всё ещё ранние дни. Вложенное обучение остаётся активной областью исследований, и многим его идеям потребуется более широкая валидация, прежде чем они станут частью мейнстримного машинного обучения. Если вы хотите укрепить базу в концепциях, лежащих в основе вложенного обучения — нейросетях, оптимизации и механизмах памяти, — рекомендую ознакомиться с нашим комплексным треком Deep Learning in Python.

Частые вопросы о вложенном обучении

Что такое непрерывное обучение в LLM?

Непрерывное обучение в LLM — это способность модели продолжать учиться на новых данных, не забывая прежние знания. Большинство LLM «из коробки» с этим справляются плохо. При дообучении на новой информации они склонны затирать старые знания. Исследования в области непрерывного обучения направлены именно на решение этой проблемы.

Требует ли вложенное обучение нескольких моделей машинного обучения?

Не обязательно. Вложенное обучение — это скорее про организацию задач обучения по уровням, чем про использование нескольких моделей. В некоторых реализациях используется одна модель с вложенными этапами обучения или иерархическими представлениями, в других — комбинируются несколько специализированных моделей.

Является ли вложенное обучение вычислительно затратным?

Может быть, но не всегда существенно. Дополнительные издержки связаны с поддержанием и обновлением вышестоящего процесса обучения параллельно обычной тренировке модели. Современные архитектуры вложенного обучения, такие как Hope, спроектированы с учётом эффективности, что делает их практичными для многих исследовательских условий. Однако развёртывание вложенного обучения в продакшене всё ещё открытый вопрос.

Когда следует избегать использования вложенного обучения?

Если распределение ваших данных не будет меняться и вам нужна высокая точность на фиксированном бенчмарке, вложенное обучение добавит сложности без особой отдачи. Его также стоит избегать, когда критична интерпретируемость. Чем сильнее процесс обучения сам себя адаптирует, тем сложнее объяснить, что именно делает модель и почему.

Как выбрать между вложенным обучением и трансферным обучением?

Они решают разные задачи. Трансферное обучение переносит знания модели из одной области в другую. Это разовая адаптация. Вложенное обучение — про построение системы, которая продолжает адаптироваться по мере поступления новой информации. Если у вас фиксированная целевая задача, трансферное обучение проще и обычно достаточно. Если среда динамична и модели нужно постоянно быть в курсе, лучше подойдёт вложенное обучение.

Темы

Лучшие курсы по глубокому обучению

Track

Глубокое обучение на Python

18 ч
Продолжите свой путь в машинном обучении в глубокое обучение. Используйте библиотеку PyTorch для создания нейронных сетей, чтобы моделировать различные типы данных.
ПодробнееRight Arrow
Начать Курс
Смотрите большеRight Arrow