Chuyển đến nội dung chính

Học Lồng Ghép: Cách khắc phục hiện tượng quên thảm khốc

Quên thảm khốc khiến học liên tục trở nên khó khăn. Xem cách Học Lồng Ghép dùng nhiều thang thời gian để giữ kiến thức cũ trong khi học tác vụ mới.
Đã cập nhật 27 thg 7, 2026  · 11 phút đọc

Khám phá với AI

Mở trong ChatGPTMở trong ClaudeMở trong Perplexity

Nếu bạn đã từng huấn luyện mạng nơ-ron, có lẽ bạn đã gọi optimizer.step() hàng nghìn lần. Bạn biết nó dùng các gradient tính được để cập nhật trọng số của mô hình và giảm loss huấn luyện, và thường thì câu chuyện dừng lại ở đó.

Nhưng Học lồng ghép yêu cầu bạn nhìn trình tối ưu theo một cách khác. Cách tiếp cận này diễn giải các bộ tối ưu thích nghi như Adam như những quá trình học với trạng thái riêng tiến hóa theo thời gian. Học Lồng Ghép được giới thiệu bởi Google Research trong bài báo NeurIPS 2025 "Nested Learning: The Illusion of Deep Learning Architectures."

Trong bài viết này, chúng ta sẽ tìm hiểu Học Lồng Ghép là gì, hoạt động ra sao, vì sao nó quan trọng, và cách kiến trúc Hope đưa nó vào thực hành. Nếu bạn đã từng huấn luyện mô hình với Adam hoặc SGD, bạn đã có nền tảng để theo dõi.

Tóm tắt nhanh

  • Học Lồng Ghép là một mô hình tư duy trong máy học từ Google Research, coi một mô hình như tập hợp các bài toán tối ưu lồng nhau học ở các tốc độ khác nhau, thay vì một kiến trúc duy nhất được huấn luyện bởi một bộ tối ưu tách biệt.
  • Nó nhắm tới hiện tượng quên thảm khốc: vấn đề khi fine-tuning trên dữ liệu mới ghi đè kiến thức mô hình đã có, điều khiến học liên tục trở nên khó khăn.
  • Thay đổi cốt lõi là coi kiến trúc và bộ tối ưu là cùng một loại thành phần: các cấp độ học khác nhau cập nhật ở các tốc độ khác nhau, để thông tin mới đi vào qua các thành phần nhanh mà không xóa sạch kiến thức chậm, ổn định.
  • Hope là kiến trúc minh chứng: một biến thể tự biến đổi của Titans kết hợp với Hệ Thống Bộ Nhớ Liên Tục (CMS), nơi các mô-đun bộ nhớ cập nhật trên một phổ tốc độ thay vì chia cứng ngắn hạn/dài hạn.
  • Trong các thử nghiệm của bài báo, Hope vượt các baseline như Titans, Samba và một transformer tiêu chuẩn ở tác vụ mô hình ngôn ngữ và suy luận thường thức, và duy trì hiệu quả ở truy hồi ngữ cảnh dài và học liên tục.
  • Đây là nghiên cứu giai đoạn đầu. Chưa có triển khai chính thức và không có pip install, chỉ có bản tái tạo từ cộng đồng trên GitHub, nên hãy xem đây là hướng đi đáng theo dõi hơn là thứ sẵn sàng cho sản xuất.

Học Lồng Ghép là gì?

Học Lồng Ghép là một mô hình tư duy trong máy học coi một mô hình không phải là một kiến trúc đơn lẻ được huấn luyện bởi bộ tối ưu tách biệt, mà là tập hợp các bài toán tối ưu lồng nhau, mỗi bài toán học ở tốc độ riêng. Nó định khung lại kiến trúc mô hình và thuật toán huấn luyện như cùng một loại, là các cấp độ học chạy và thích nghi đồng thời.

Nó tổ chức một hệ thống máy học thành nhiều cấp độ học hoạt động trên các thang thời gian khác nhau. 

  • Cấp tham số học chậm qua hàng nghìn bước huấn luyện. 
  • Cấp bộ nhớ quyết định thông tin nào cần giữ lại qua các đầu vào gần đây. 
  • Cấp bộ tối ưu học cách cập nhật các cấp bên dưới nó. 

Các cấp cao hơn có thể ảnh hưởng cách các cấp thấp hơn hành xử, điều này khiến cấu trúc có tính thứ bậc chứ không chỉ là mô-đun.

Nguyên tắc cốt lõi của Học Lồng Ghép

Học Lồng Ghép tuân theo bốn nguyên tắc chính sau:

  • Kiến trúc và tối ưu thuộc cùng một hệ thống học. Trong Học Lồng Ghép, bộ tối ưu trở thành một phần của quá trình học và có thể thích nghi theo thời gian.
  • Các thành phần khác nhau học ở tốc độ khác nhau. Tham số lõi của mô hình có thể cập nhật chậm qua hàng nghìn ví dụ, trong khi cơ chế ngữ cảnh ngắn hạn cập nhật theo từng đầu vào mới, và hệ thống bộ nhớ cập nhật ở đâu đó giữa hai mức đó.
  • Độ sâu đến từ các quá trình học lồng nhau. Deep learning truyền thống tạo độ sâu bằng cách xếp chồng các tầng. Học Lồng Ghép tạo độ sâu bằng cách xếp nhiều cấp độ học và thích nghi, nơi tham số, hệ thống bộ nhớ, bộ tối ưu và cơ chế cập nhật đều có thể học ở các thang thời gian khác nhau.
  • Học có thể tiếp diễn sau khi triển khai. Các thành phần như hệ thống bộ nhớ và cơ chế học cũng có thể tiếp tục thích nghi trong giai đoạn suy luận.

Học lồng ghép so với deep learning truyền thống

Trong nhiều năm, chúng ta đã phụ thuộc vào kiến trúc deep learning, nơi dữ liệu đi qua mạng nơ-ron, đo độ sai của dự đoán mô hình (gọi là loss), và chạy một bộ tối ưu điều chỉnh tham số mô hình để giảm lỗi đó. 

Lặp lại cho đến khi mô hình đủ tốt. Sau đó bạn đóng băng tham số và triển khai mô hình. Từ thời điểm đó, nó không học từ đầu vào mới, không thích nghi khi dữ liệu thay đổi, và không tự cải thiện khi sử dụng.

Học Lồng Ghép thay đổi điều đó. Cùng với tham số mô hình, các mô-đun bộ nhớ, bộ tối ưu và thành phần khác cũng tiếp tục học theo thời gian.

Yếu tố

Deep learning truyền thống

Học lồng ghép

Độ sâu 

Độ sâu đến từ xếp chồng các tầng mạng nơ-ron.

Độ sâu đến từ việc lồng các quá trình học bên trong những quá trình học khác.

Học

Học diễn ra chủ yếu trong giai đoạn huấn luyện.

Học diễn ra trong huấn luyện và tiếp tục sau khi triển khai.

Bộ tối ưu

Một công cụ cố định cập nhật trọng số mô hình.

Một thành phần thích nghi có thể học và cập nhật quy tắc của chính nó.

Bộ nhớ

Mã hóa trong tham số mô hình và ngữ cảnh ngắn hạn.

Tồn tại qua nhiều cấp độ và thang thời gian.

Suy luận

Trọng số mô hình cố định.

Một số thành phần có thể tiếp tục thích nghi trong suy luận.

Vì sao Học Lồng Ghép quan trọng

Mô hình học thông tin mới bằng cách cập nhật tham số, nhưng chính các cập nhật đó có thể ghi đè kiến thức học từ trước. Hiện tượng này được gọi là quên thảm khốc.

Các nhà nghiên cứu đã đưa ra kỹ thuật như đóng băng tầng, các phương pháp regularization như Elastic Weight Consolidation (EWC), và bộ đệm phát lại để bảo toàn kiến thức cũ khi học tác vụ mới. Nhưng các cách tiếp cận này được thiết kế để bảo vệ mô hình khỏi quên, chứ không thay đổi căn bản cách việc học diễn ra.

Học Lồng Ghép cho rằng cách tiếp cận một thang thời gian duy nhất là một trong những lý do khiến học liên tục vẫn khó khăn. Thay vì dựa vào một tập tham số duy nhất để hấp thụ mọi thông tin mới, nó phân bổ thích nghi qua nhiều cấp độ học. 

Các cấp độ khác nhau thích nghi ở tốc độ khác nhau, giúp đưa thông tin mới vào mà không liên tục viết lại kiến thức cũ. Ý tưởng này phần nào lấy cảm hứng từ nhận thức của con người. Suy cho cùng, không phải mọi việc học đều diễn ra cùng nhịp độ:

  • Phản xạ có thể thích nghi gần như tức thì. 
  • Ký ức ngắn hạn hình thành trong vài phút hoặc vài giờ. 
  • Niềm tin, thói quen và chuyên môn có thể mất hàng tháng hoặc năm để phát triển.

Học Lồng Ghép hoạt động như thế nào

Học Lồng Ghép tổ chức một hệ thống máy học thành các cấp, mỗi cấp là một quá trình học riêng với vai trò và tốc độ cập nhật riêng. Để hiểu cách chúng vận hành, hữu ích khi đi qua từng cấp và xem chúng kết nối với nhau ra sao.

Học lồng ghép: Học ở nhiều cấp độ

Cấp tham số

Tham số là các trọng số trong mạng nơ-ron lưu trữ những gì mô hình đã học từ dữ liệu huấn luyện. Trong huấn luyện, bộ tối ưu cập nhật các trọng số này sau mỗi batch bằng các gradient tính được. 

Mỗi lần cập nhật là nhỏ, nên thay đổi có ý nghĩa diễn ra dần dần qua nhiều bước huấn luyện. Do đó, cấp tham số học kiến thức ổn định, dài hạn nhưng chậm thích nghi với thông tin mới.

Cấp bộ nhớ

Cấp bộ nhớ nắm bắt thông tin từ các đầu vào gần đây mà cấp tham số quá chậm để học. 

Thay vì lưu mọi thứ nhìn thấy, nó giữ lại thông tin hữu ích nhất và loại bỏ phần còn lại. Điều này cho phép mô hình thích nghi với ngữ cảnh mới mà chưa cần cập nhật ngay kiến thức dài hạn.

Cấp bộ tối ưu

Bộ tối ưu quyết định cách tham số mô hình nên được cập nhật trong huấn luyện. Nó dùng các gradient tính từ dự đoán của mô hình để xác định độ lớn và hướng của mỗi cập nhật.

Các bộ tối ưu thích nghi như Adam làm nhiều hơn là dùng gradient hiện tại. Chúng cũng theo dõi các gradient gần đây và dùng lịch sử đó khi tính cập nhật tham số tiếp theo.

Nếu Adam đã làm điều này, Học Lồng Ghép bổ sung gì?

Khác biệt nằm ở những gì có thể học. Trong deep learning tiêu chuẩn, các quy tắc chi phối cách Adam cập nhật trạng thái được cố định trước khi huấn luyện và không bao giờ thay đổi. Adam thích nghi tham số, nhưng không có gì thích nghi Adam. 

Học Lồng Ghép đưa vào một quá trình meta-learning ở trên bộ tối ưu có thể đánh giá hiệu quả của bộ tối ưu và chỉnh sửa các quy tắc của nó theo thời gian. Bộ tối ưu không còn là hạ tầng cố định mà trở thành thứ tự cải thiện được.

Cách các cấp độ tương tác

Các cấp độ này không hoạt động độc lập. Thông tin chảy giữa chúng, và mỗi cấp ảnh hưởng cách các cấp khác học theo thời gian. 

  • Cấp tham số dần xây dựng kiến thức dài hạn thông qua huấn luyện. 
  • Cấp bộ nhớ cung cấp ngữ cảnh gần đây giúp hệ thống phản hồi thông tin mới nhanh hơn. 
  • Bộ tối ưu quyết định cách tham số được cập nhật

Kết hợp lại, các cấp cho phép mô hình cân bằng giữa thích nghi ngắn hạn và học dài hạn.

Kiến trúc Hope

Hope là kiến trúc minh chứng của bài báo, một biến thể tự biến đổi của kiến trúc Titans mà Google xây dựng để kiểm chứng liệu học lồng ghép có thực sự hiệu quả trong thực tế. Nó ghép một bộ nhớ có thể tự viết lại quy tắc cập nhật của nó với Hệ Thống Bộ Nhớ Liên Tục, để có thể tiếp tục học ở nhiều tốc độ khác nhau thay vì đóng băng sau huấn luyện.

Titans tự biến đổi

Titans chứa các mô-đun bộ nhớ để lưu trữ thông tin mà mô hình cho là bất ngờ hoặc quan trọng. Thay vì chỉ dựa vào tham số, mô hình mang thông tin hữu ích về phía trước qua các mô-đun bộ nhớ này.

Hope tiến thêm một bước. Khi dữ liệu mới đến, các mô-đun bộ nhớ tiếp tục cập nhật. Hệ thống cũng điều chỉnh các quy tắc nó dùng cho các cập nhật tương lai. Đó là lý do kiến trúc này được gọi là tự biến đổi.

Hệ Thống Bộ Nhớ Liên Tục

Hầu hết kiến trúc bộ nhớ chia bộ nhớ thành hai nhóm: ngắn hạn và dài hạn. Thông tin hoặc nằm trong kho tạm thời nhanh hoặc được củng cố vào lưu trữ dài hạn ổn định. Hope thay thế sự chia đôi đó bằng một phổ liên tục, một dải các mô-đun bộ nhớ cập nhật ở tốc độ khác nhau.

Một số thành phần bộ nhớ cập nhật nhanh và nắm bắt thông tin gần đây. Những thành phần khác thay đổi chậm hơn và gìn giữ kiến thức ổn định tích lũy trong thời gian dài hơn. Điều đó có nghĩa là thông tin mới có thể đi vào qua các lớp cập nhật nhanh mà chưa làm gián đoạn ngay bộ nhớ chậm hơn, ổn định hơn.

Hệ Thống Bộ Nhớ Liên TụcHiệu năng của Hope

Bài báo đánh giá Hope trên mô hình ngôn ngữ, suy luận ngữ cảnh dài, học liên tục và tích hợp tri thức, dùng các baseline khác nhau cho từng tác vụ. Mô hình ngôn ngữ và suy luận thường thức được so sánh với Titans, Samba và một transformer tiêu chuẩn, trong khi các tác vụ truy hồi ngữ cảnh dài so sánh Hope và Titans với TTT và Mamba2.

Trên các benchmark mô hình ngôn ngữ và suy luận thường thức, Hope đạt perplexity thấp hơn và độ chính xác cao hơn cả ba baseline.

Biểu đồ cột cho thấy Hope vượt Titans, Samba và Transformer trên cả mô hình ngôn ngữ và suy luận thường thức.

Kết quả đáng chú ý hơn đến từ các tác vụ yêu cầu mô hình truy hồi một mẩu thông tin cụ thể bị chôn trong ngữ cảnh dài. Bài báo thử nghiệm nhiều biến thể với độ khó tăng dần: truy hồi khóa, truy hồi số, và biến thể khó nhất, truy hồi cấp độ từ. Hope vượt các baseline trên mọi biến thể, với thiết kế CMS đóng góp rõ rệt cho lợi thế ở ngữ cảnh dài.

Kiến trúc này cũng hoạt động tốt trên các benchmark học liên tục. Khi được huấn luyện qua các chuỗi tác vụ vốn thường gây quên thảm khốc, Hope giữ lại nhiều kiến thức đã học hơn so với các mô hình so sánh được báo cáo trong bài.

Học Lồng Ghép so với các cách tiếp cận Học Liên Tục khác

Học Lồng Ghép không phải nỗ lực đầu tiên nhằm giải quyết quên thảm khốc. Nhiều năm qua, các nhà nghiên cứu đã đề xuất kỹ thuật học liên tục để cho phép mô hình giữ kiến thức đã học khi học tác vụ mới. Hãy xem các khác biệt chính giữa các cách tiếp cận khác nhau.

Cách tiếp cận

Elastic Weight Consolidation (EWC)

Progressive Neural Networks

Experience Replay

Học Lồng Ghép

Cơ chế cốt lõi

Thêm một hạng tử regularization để làm chậm cập nhật các trọng số quan trọng cho tác vụ trước.

Thêm một mạng dành riêng cho mỗi tác vụ mới, với kết nối ngang tới các mạng đã học trước đó, để kiến thức có thể chuyển tiếp.

Lưu và phát lại các mẫu từ tác vụ trước cùng với tác vụ mới trong huấn luyện.

Tổ chức việc học thành nhiều cấp tương tác hoạt động ở các thang thời gian khác nhau

Cách ngăn quên

Bảo toàn trọng số của tác vụ trước; kiến thức cũ được giữ khi học tác vụ mới.

Các mạng trước đó được đóng băng và lưu lại. Tác vụ mới có mạng riêng nên không bị nhiễu chéo.

Trộn ví dụ cũ vào huấn luyện hiện tại.

Các cấp cập nhật với tần suất khác nhau, nên thông tin mới đi vào qua thành phần nhanh mà chưa chiếm chỗ kiến thức ổn định ở thành phần chậm.

Chi phí tính toán

Thấp đến trung bình

Cao

Trung bình đến cao, tăng theo kích thước bộ đệm phát lại. 

Đang được đánh giá

Khả năng mở rộng

Trung bình; bảo vệ nhiều tham số theo thời gian có thể giảm khả năng học tác vụ mới.

Hạn chế vì kích thước mô hình tăng theo mỗi tác vụ mới

Hiệu quả nhưng cần duy trì bộ đệm phát lại

Được thiết kế để mở rộng, nhưng vẫn là nghiên cứu giai đoạn đầu.

Mức độ trưởng thành

Đã được khẳng định

Đã được khẳng định

Được dùng rộng rãi

Nghiên cứu giai đoạn đầu

Các phương pháp như EWC, Progressive Neural Networks và Experience Replay là các mạng nơ-ron làm chậm việc quên trong huấn luyện. Kiến trúc nền tảng vẫn hầu như giữ nguyên. 

Học Lồng Ghép suy nghĩ lại về chính kiến trúc, để việc học diễn ra qua nhiều cấp và thang thời gian: bộ nhớ thay đổi nhanh xử lý trải nghiệm gần đây, trong khi tham số thay đổi chậm nắm bắt kiến thức dài hạn.

Học Lồng Ghép trong thực tiễn

Các bản tái tạo không chính thức từ cộng đồng đã bắt đầu xuất hiện trên GitHub, giúp các nhà nghiên cứu thử nghiệm kiến trúc và cố gắng tái lập kết quả đã công bố.

Tuy vậy, Học lồng ghép chưa có tích hợp chính thức với các framework deep learning lớn, và bạn không thể chỉ pip install học lồng ghép để thêm vào dự án PyTorch hoặc JAX sẵn có. Xây dựng và đánh giá các mô hình này vẫn đòi hỏi làm việc trực tiếp với mã nghiên cứu.

Nhưng hướng đi tập trung vào việc cộng đồng đón nhận. Vì vậy hãy theo dõi các mô-đun Hope hoặc Hệ Thống Bộ Nhớ Liên Tục (CMS) được tích hợp vào các framework phổ biến và được áp dụng trong hệ thống sản xuất.

Lời kết

Học Lồng Ghép thách thức một giả định cốt lõi đằng sau deep learning hiện đại. Thay vì làm mô hình mạnh hơn bằng cách xếp thêm tầng, nó khám phá liệu trí tuệ có thể nảy sinh từ nhiều quá trình học hoạt động ở các thang thời gian khác nhau hay không.

Sự dịch chuyển đó cũng thay đổi cách chúng ta nghĩ về tối ưu hóa. Deep learning truyền thống coi kiến trúc mô hình và thuật toán học là các thành phần tách rời. Học Lồng Ghép đưa chúng lại gần nhau với mục tiêu biến chính quá trình học trở nên có thứ bậc.

Vẫn còn sớm. Học Lồng Ghép vẫn là lĩnh vực nghiên cứu sôi động, và nhiều ý tưởng của nó cần được kiểm chứng rộng rãi hơn trước khi trở thành một phần của máy học đại trà. Nếu bạn muốn xây nền tảng vững chắc hơn về các khái niệm đằng sau học lồng ghép, bao gồm mạng nơ-ron, tối ưu hóa và cơ chế bộ nhớ, tôi khuyến nghị xem lộ trình Deep Learning in Python toàn diện của chúng tôi.

Câu hỏi thường gặp về Học Lồng Ghép

Học liên tục trong LLM là gì?

Học liên tục trong LLM là khả năng của mô hình tiếp tục học từ dữ liệu mới mà không quên kiến thức trước đó. Hầu hết LLM không làm tốt điều này ngay từ đầu. Khi bạn fine-tune với thông tin mới, chúng có xu hướng ghi đè kiến thức cũ. Nghiên cứu về học liên tục nhằm giải quyết chính vấn đề đó.

Học lồng ghép có bắt buộc dùng nhiều mô hình máy học không?

Không nhất thiết. Học lồng ghép thiên về tổ chức các nhiệm vụ học thành nhiều cấp hơn là dùng nhiều mô hình. Một số triển khai dùng một mô hình duy nhất với các giai đoạn huấn luyện lồng nhau hoặc biểu diễn có thứ bậc, trong khi số khác kết hợp nhiều mô hình chuyên biệt.

Học lồng ghép có tốn tài nguyên tính toán không?

Có thể tốn kém, nhưng không phải lúc nào cũng đáng kể. Chi phí bổ sung đến từ việc duy trì và cập nhật quá trình học cấp cao song song với huấn luyện thông thường của mô hình. Các kiến trúc học lồng ghép hiện đại như Hope được thiết kế chú trọng hiệu quả, giúp chúng thực tiễn cho nhiều môi trường nghiên cứu. Tuy nhiên, triển khai học lồng ghép trong sản xuất vẫn là vấn đề bỏ ngỏ.

Khi nào nên tránh dùng học lồng ghép?

Nếu phân phối dữ liệu của bạn sẽ không thay đổi và bạn chỉ cần hiệu năng mạnh trên một benchmark cố định, học lồng ghép thêm phức tạp mà không mang lại nhiều lợi ích. Cũng nên tránh khi tính diễn giải rất quan trọng. Quá trình học tự thích nghi càng nhiều, càng khó giải thích chính xác mô hình đang làm gì và vì sao.

Bạn chọn giữa học lồng ghép và học chuyển giao như thế nào?

Chúng giải quyết các vấn đề khác nhau. Học chuyển giao (transfer learning) lấy những gì mô hình học ở một miền và áp dụng sang miền khác. Đó là một lần thích nghi. Học lồng ghép xây dựng hệ thống tiếp tục thích nghi theo thời gian khi thông tin mới đến. Nếu bạn có tác vụ mục tiêu cố định, học chuyển giao đơn giản hơn và thường là đủ. Nếu môi trường động và mô hình cần luôn cập nhật, học lồng ghép phù hợp hơn.


Srujana Maddula's photo
Author
Srujana Maddula
LinkedIn

Srujana là một cây bút công nghệ tự do với bằng Cử nhân Khoa học Máy tính. Việc viết về nhiều chủ đề như khoa học dữ liệu, điện toán đám mây, phát triển, lập trình, bảo mật và nhiều lĩnh vực khác đến với cô một cách tự nhiên. Cô yêu thích văn học kinh điển và khám phá những điểm đến mới.

Chủ đề

Các khóa học Deep Learning hàng đầu

Tracks

Học sâu trong Python

18 giờ
Tiếp tục hành trình học máy của quý vị sang lĩnh vực học sâu. Sử dụng thư viện PyTorch để xây dựng mạng nơ-ron nhằm mô hình hóa các loại dữ liệu khác nhau.
Xem chi tiếtRight Arrow
Bắt Đầu Khóa Học
Xem thêmRight Arrow
Có liên quan

blogs

Claude Opus 4.6: Tính năng, điểm chuẩn, các bài kiểm tra thực hành và hơn thế nữa

Mô hình mới nhất của Anthropic dẫn đầu bảng xếp hạng về mã hóa theo hướng tác nhân và suy luận phức tạp. Thêm nữa, nó có cửa sổ ngữ cảnh 1M.
Matt Crabtree's photo

Matt Crabtree

10 phút

Xem ThêmXem Thêm