Longformer
Khám phá kiến trúc Longformer để xử lý hiệu quả các chuỗi dữ liệu dài. Tìm hiểu cách sparse attention khắc phục giới hạn bộ nhớ cho NLP và Computer Vision.
Longformer là một loại kiến trúc Deep Learning chuyên biệt, được thiết kế để xử lý hiệu quả các chuỗi dữ liệu dài và khắc phục những hạn chế của các model truyền thống. Ban đầu được giới thiệu để giải quyết những giới hạn của Transformers tiêu chuẩn, vốn thường gặp khó khăn với các chuỗi dài hơn 512 token do hạn chế về bộ nhớ, Longformer sử dụng một cơ chế attention được cải tiến. Bằng cách giảm độ phức tạp tính toán từ bậc hai xuống bậc tuyến tính, kiến trúc này cho phép các hệ thống AI phân tích toàn bộ tài liệu, bản ghi dài hoặc chuỗi di truyền phức tạp trong một lần xử lý mà không cần cắt ngắn input.
Bài toán nút thắt cổ chai của Attention#
Để hiểu tầm quan trọng của Longformer, cần xem xét những hạn chế của các model tiền nhiệm như BERT và các model GPT-3 đời đầu. Transformer tiêu chuẩn sử dụng một phép toán "self-attention", trong đó mỗi token (từ hoặc một phần của từ) attention đến mọi token khác trong chuỗi. Điều này tạo ra chi phí tính toán bậc hai; khi độ dài chuỗi tăng gấp đôi, bộ nhớ cần thiết trên GPU tăng gấp bốn lần. Do đó, hầu hết các model tiêu chuẩn áp đặt giới hạn nghiêm ngặt lên kích thước input, thường buộc data scientist phải chia tài liệu thành các đoạn nhỏ, tách rời nhau, dẫn đến mất ngữ cảnh.
Longformer giải quyết vấn đề này bằng cách giới thiệu Sparse Attention. Thay vì kết nối đầy đủ giữa mọi cặp token, nó sử dụng kết hợp giữa local attention theo cửa sổ và global attention:
- Sliding Window Attention: Mỗi token chỉ attention đến các token lân cận ngay bên cạnh. Cơ chế này nắm bắt ngữ cảnh cục bộ và cấu trúc cú pháp, tương tự cách một Mạng nơ-ron tích chập (CNN) xử lý hình ảnh.
- Dilated Sliding Window: Để mở rộng trường tiếp nhận mà không làm tăng chi phí tính toán, cửa sổ có thể bao gồm các khoảng trống, cho phép model nhìn "xa hơn" trong văn bản.
- Global Attention: Các token được chọn trước (chẳng hạn như token phân loại
[CLS]) attention đến mọi token khác trong chuỗi, đồng thời mọi token đều attention đến chúng. Điều này đảm bảo model duy trì được hiểu biết cấp cao về toàn bộ input cho các tác vụ như tóm tắt văn bản.
Các ứng dụng trong thực tế#
Khả năng xử lý đồng thời hàng nghìn token mở ra những khả năng mới cho Xử lý ngôn ngữ tự nhiên (NLP) và nhiều lĩnh vực khác.
1. Phân tích tài liệu pháp lý và y tế#
Trong các ngành như luật và chăm sóc sức khỏe, tài liệu hiếm khi ngắn. Một hợp đồng pháp lý hoặc bệnh sử của bệnh nhân có thể dài hàng chục trang. Các Mô hình ngôn ngữ lớn (LLMs) truyền thống sẽ yêu cầu chia nhỏ những tài liệu này, có khả năng bỏ sót các mối liên hệ quan trọng giữa một điều khoản ở trang 1 và một định nghĩa ở trang 30. Longformer cho phép thực hiện Nhận dạng thực thể có tên (NER) và phân loại trên toàn bộ tài liệu cùng lúc, đảm bảo ngữ cảnh tổng thể ảnh hưởng đến cách diễn giải các thuật ngữ cụ thể.
2. Hỏi đáp với văn bản dài (QA)#
Các hệ thống Question Answering tiêu chuẩn thường gặp khó khăn khi câu trả lời yêu cầu tổng hợp thông tin được phân bổ trong một bài viết dài. Bằng cách giữ toàn bộ văn bản trong bộ nhớ, các model dựa trên Longformer có thể thực hiện suy luận nhiều bước, kết nối các sự kiện được tìm thấy trong những đoạn văn khác nhau để tạo ra câu trả lời toàn diện. Đây là yếu tố quan trọng đối với các hệ thống hỗ trợ kỹ thuật tự động và công cụ nghiên cứu học thuật.
Phân biệt các thuật ngữ chính#
- Longformer so với Transformer: Transformer tiêu chuẩn sử dụng attention đầy đủ $N^2$, cho kết quả chính xác nhưng có chi phí tính toán cao với input dài. Longformer sử dụng attention thưa $N$, đánh đổi một lượng năng lực lý thuyết không đáng kể để đạt được mức tăng hiệu suất rất lớn, cho phép xử lý input có 4.096 token trở lên.
- Longformer so với Transformer-XL: Mặc dù cả hai đều xử lý được các chuỗi dài, Transformer-XL dựa vào cơ chế hồi quy (lưu trạng thái trước đó vào cache) để ghi nhớ các đoạn trước. Longformer xử lý chuỗi dài một cách nguyên bản trong một lần, giúp đơn giản hóa quá trình huấn luyện song song trên các nền tảng như Ultralytics Platform.
- Longformer so với BigBird: Đây là hai kiến trúc rất tương đồng được phát triển vào cùng khoảng thời gian. Cả hai đều sử dụng cơ chế attention thưa để đạt khả năng mở rộng tuyến tính. BigBird bổ sung một thành phần random attention cụ thể bên cạnh các cửa sổ trượt.
Các khái niệm triển khai#
Mặc dù Longformer là một kiến trúc thay vì một hàm cụ thể, việc hiểu cách chuẩn bị dữ liệu cho các model có ngữ cảnh dài là rất quan trọng. Trong các framework hiện đại như PyTorch, điều này thường bao gồm việc quản lý các embedding vượt quá giới hạn tiêu chuẩn.
Ví dụ sau minh họa cách tạo một tensor input giả lập cho kịch bản có ngữ cảnh dài, đồng thời so sánh với kích thước thường dùng trong các model detection tiêu chuẩn như YOLO26.
import torch
# Standard BERT-like models typically cap at 512 tokens
standard_input = torch.randint(0, 30000, (1, 512))
# Longformer architectures can handle significantly larger inputs (e.g., 4096)
# This allows the model to "see" the entire sequence at once.
long_context_input = torch.randint(0, 30000, (1, 4096))
print(f"Standard Input Shape: {standard_input.shape}")
print(f"Long Context Input Shape: {long_context_input.shape}")
# In computer vision, a similar concept applies when processing high-res images
# without downsampling, preserving fine-grained details.Mức độ liên quan đến Computer Vision#
Mặc dù ban đầu được thiết kế cho văn bản, các nguyên lý đứng sau Longformer đã ảnh hưởng đến Computer Vision. Khái niệm giới hạn attention trong một vùng lân cận cục bộ tương tự các phép toán cục bộ trong các tác vụ thị giác. Vision Transformer (ViT) cũng gặp các vấn đề mở rộng tương tự với hình ảnh độ phân giải cao, vì số lượng pixel (hoặc patch) có thể rất lớn. Các kỹ thuật bắt nguồn từ sparse attention của Longformer được sử dụng để cải thiện hiệu suất phân loại hình ảnh và detection đối tượng, giúp các model như YOLO26 duy trì tốc độ cao khi xử lý dữ liệu thị giác chi tiết.
Để tìm hiểu thêm về các chi tiết kiến trúc, bài báo Longformer gốc của AllenAI cung cấp các benchmark chuyên sâu và những lập luận lý thuyết. Ngoài ra, việc huấn luyện hiệu quả các model lớn như vậy thường được hưởng lợi từ những kỹ thuật như mixed precision và các thuật toán tối ưu hóa nâng cao.









