Catastrophic Forgetting
Khám phá cách ngăn chặn hiện tượng quên thảm họa trong mạng neural. Tìm hiểu các chiến lược giảm thiểu đã được chứng minh khi huấn luyện các model Ultralytics YOLO.
Hiện tượng quên thảm họa, thường được gọi là can thiệp thảm họa, là một hiện tượng được nghiên cứu rộng rãi trong machine learning, trong đó mạng neural nhân tạo đột ngột mất thông tin đã học trước đó khi học các tác vụ mới. Khi một model trải qua quá trình huấn luyện tuần tự để thích ứng với dataset mới, các thuật toán tối ưu hóa sử dụng lan truyền ngược sẽ cập nhật trọng số model. Quá trình này thường vô tình ghi đè các biểu diễn toán học cần thiết cho những tác vụ trước đó. Do đó, một hệ thống AI được tối ưu hóa cao cho mục đích ban đầu có thể bị suy giảm nghiêm trọng hiệu năng trên các tác vụ ban đầu nếu chỉ được huấn luyện bằng dữ liệu mới mà không có biện pháp đối phó cụ thể.
Vì sao hiện tượng quên thảm họa xảy ra#
Trong deep learning, kiến thức của một model được lưu trữ trên một mạng lưới phân tán gồm các neuron liên kết với nhau. Trong quá trình fine-tuning, các hàm tối ưu hóa như hạ gradient ngẫu nhiên điều chỉnh các kết nối này để giảm thiểu sai số trên dữ liệu mới. Nếu dataset huấn luyện mới không chứa các ví dụ thuộc những class ban đầu, quá trình tối ưu hóa sẽ dịch chuyển các trọng số về phía phân phối dữ liệu mới, qua đó thực chất xóa đi “ký ức” về phân phối cũ. Các nghiên cứu gần đây về dịch chuyển cấu trúc cho thấy sự sụp đổ nội tại này về cơ bản hạn chế khả năng của các mạng neural hiện đại trong việc đạt được học tập suốt đời tương tự con người ngay khi triển khai.
Phân biệt các khái niệm liên quan#
Điều quan trọng là phân biệt hiện tượng quên thảm họa với các khái niệm AI khác:
- Quên thảm họa và sụp đổ model: Trong khi hiện tượng quên xảy ra do học các tác vụ mới theo từng bước, sụp đổ model là sự suy giảm dần hiệu năng trên cùng một tác vụ khi một model liên tục huấn luyện trên dữ liệu tổng hợp do các model AI khác tạo ra.
- Quên thảm họa và học liên tục: Học liên tục là phương pháp nghiên cứu tổng quát nhằm giải quyết hiện tượng quên thảm họa. Các thuật toán học liên tục cố gắng cho phép model tiếp thu kiến thức mới theo tuần tự mà không quên kiến thức đã học.
Ví dụ trong thực tế#
Hiện tượng quên thảm họa đặt ra thách thức đáng kể trong nhiều lĩnh vực AI hoạt động trong môi trường thực tế động:
- Hệ thống tự hành: Trong các pipeline nhận thức dành cho phương tiện tự hành, một hệ thống computer vision ban đầu được huấn luyện để nhận diện người đi bộ và biển báo giao thông tiêu chuẩn có thể được fine-tune để nhận diện các biển báo công trường mới, đặc thù theo từng khu vực. Nếu không có các cơ chế bảo vệ, hệ thống có thể đột ngột gặp khó khăn trong việc phát hiện người đi bộ một cách đáng tin cậy, tạo ra rủi ro nghiêm trọng về an toàn.
- AI ngôn ngữ và nhận thức: Khi tùy chỉnh các large language model cho những tác vụ chuyên biệt theo lĩnh vực—chẳng hạn như chẩn đoán y khoa—model có thể quên khả năng căn chỉnh hội thoại hoặc kỹ năng suy luận tổng quát. Một phân tích so sánh gần đây về LLMs cho thấy việc fine-tune tiêu chuẩn trên các văn bản chuyên môn hóa cao thường làm suy yếu căn chỉnh an toàn trước đó, khiến model mất đi khả năng chính là làm theo chỉ dẫn.
Khắc phục hiện tượng quên thảm họa#
Các kỹ sư AI sử dụng một số chiến lược để giảm thiểu vấn đề này và duy trì bài toán đánh đổi giữa tính mềm dẻo và tính ổn định ở mức tối ưu:
- Phát lại và hợp nhất dataset: Phương pháp đáng tin cậy nhất là trộn một phần dữ liệu huấn luyện ban đầu với dữ liệu mới. Các công cụ như Ultralytics Platform đơn giản hóa việc quản lý và versioning các dataset kết hợp, bảo đảm các class ban đầu được phát lại hiệu quả trong quá trình huấn luyện.
- Hợp nhất trọng số đàn hồi (EWC): Kỹ thuật regularization này giới hạn việc cập nhật các tham số quan trọng đối với những tác vụ cũ. Bằng cách xác định và bảo toàn các trọng số then chốt này, model giảm hiện tượng quên, như được nhấn mạnh trong các thử nghiệm gần đây về khắc phục hiện tượng quên của mạng.
- Fine-tuning hiệu quả theo tham số (PEFT): Các phương pháp như thích ứng hạng thấp (LoRA) đóng băng các trọng số pretrained cốt lõi và đưa các ma trận nhỏ có thể huấn luyện vào mạng, ngăn kiến thức nền bị ghi đè.
- Đóng băng các layer: Trong các phiên huấn luyện ngắn hơn, việc đóng băng các layer backbone và neck bảo đảm các bộ trích xuất đặc trưng cốt lõi vẫn nguyên vẹn.
- Tối ưu hóa không gradient: Các framework mới đây đã chứng minh rằng những phương pháp dựa trên forward pass cũng có thể giảm thiểu hiệu quả hiện tượng quên trong các môi trường bị hạn chế về việc cập nhật gradient.
Ví dụ triển khai trong Vision AI#
Khi điều chỉnh Ultralytics YOLO cho một tác vụ phát hiện đối tượng mới, đóng băng các layer là một phương pháp hiệu quả và dễ áp dụng. Ví dụ sau minh họa cách huấn luyện một model Ultralytics YOLO26 trên dataset mới đồng thời ngăn hiện tượng quên thảm họa bằng cách đóng băng 10 layer đầu tiên.
from ultralytics import YOLO
# Load a pretrained Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Train on a combined dataset while freezing core backbone layers
# The 'freeze=10' argument prevents catastrophic forgetting of foundational visual features
results = model.train(data="combined_dataset.yaml", epochs=20, freeze=10, lr0=0.001)
# Evaluate the model to ensure it retains performance on old and new tasks
metrics = model.val()





