Linear Attention
Tìm hiểu cách attention tuyến tính tối ưu hóa các model deep learning bằng cách giảm độ phức tạp của Transformer xuống O(N). Khám phá cách phương pháp này mở rộng hiệu quả cho các ứng dụng AI.
Attention tuyến tính là một kỹ thuật tối ưu hóa nền tảng được thiết kế để cải thiện đáng kể hiệu quả tính toán của các model học sâu (DL) hiện đại. Trong các kiến trúc Transformer truyền thống, cơ chế attention tiêu chuẩn xử lý các chuỗi bằng cách so sánh từng token với mọi token khác. Điều này tạo ra nút thắt nghiêm trọng về tính toán và bộ nhớ, được gọi là độ phức tạp thời gian bậc hai, hay O(N bình phương), trong đó N là độ dài chuỗi. Attention tuyến tính thay đổi phép toán nền tảng này để độ phức tạp tăng tuyến tính, hay O(N). Đột phá này cho phép các model trong lĩnh vực trí tuệ nhân tạo (AI) xử lý các tập dữ liệu khổng lồ, chẳng hạn như toàn bộ sách hoặc ảnh gigapixel, mà không làm cạn bộ nhớ phần cứng.
Cách hoạt động của Attention tuyến tính#
Trong attention tiêu chuẩn, mạng neural xử lý ba vector chính: Truy vấn (Q), Khóa (K) và Giá trị (V). Công thức kinh điển tính độ tương đồng giữa tất cả các Truy vấn và Khóa bằng hàm softmax, tạo ra một ma trận N x N khổng lồ trước khi nhân ma trận đó với các Giá trị.
Attention tuyến tính bỏ qua bước tạo ma trận trung gian khổng lồ này. Thay vào đó, phương pháp này dựa trên tính chất kết hợp của phép nhân ma trận. Bằng cách loại bỏ hoặc xấp xỉ lớp softmax bằng các hàm kernel chuyên biệt, model thay đổi cách nhóm các phép nhân. Trước tiên, model nhân Khóa với Giá trị để tạo ma trận ngữ cảnh có kích thước cố định, sau đó nhân các Truy vấn với ma trận nén mới này. Việc sắp xếp lại đơn giản này giúp giảm đáng kể độ phức tạp tính toán, giải phóng phần cứng như GPU (bộ xử lý đồ họa) để xử lý trực tiếp các đầu vào dài hơn nhiều.
Những phát triển gần đây và DeltaNet#
Cộng đồng nghiên cứu AI, với sự dẫn dắt của các tổ chức như Đại học Stanford và các tập đoàn công nghệ lớn như Google DeepMind, không ngừng đổi mới các công thức tuyến tính nhằm nâng cao độ chính xác. Trong năm 2024 và 2025, các nhà nghiên cứu đã giới thiệu DeltaNet, một kiến trúc mới thay thế các cập nhật cộng tiêu chuẩn trong Transformer tuyến tính bằng "Quy tắc Delta". Cách này cho phép mạng cập nhật bộ nhớ nội bộ dựa trên những gì đã được lưu trữ, thay vì tính toán các giá trị tuyệt đối từ đầu.
Các cải tiến tiếp theo, chẳng hạn như kiến trúc Gated DeltaNet, bổ sung tốc độ suy giảm theo từng kênh, cho phép các model chủ động quên hoặc lưu giữ những đặc trưng quan trọng cụ thể theo thời gian. Những đổi mới tối ưu cho phần cứng này thu hẹp khoảng cách hiệu năng giữa Transformer tuyến tính và attention softmax truyền thống, đặc biệt trong các tác vụ truy xuất thông tin phức tạp theo ngữ cảnh.
Attention tuyến tính và các cơ chế attention khác#
Hiểu rõ kỹ thuật này khác biệt như thế nào so với các khái niệm liên quan trong nhóm cơ chế attention rộng hơn là điều thiết yếu đối với các kỹ sư AI đang tối ưu hóa mạng của họ:
- Tự chú ý: Cơ chế nền tảng sử dụng toàn bộ ma trận softmax O(N bình phương) tốn kém về mặt tính toán để nắm bắt ngữ cảnh toàn cục hoàn chỉnh.
- Flash Attention: Một phương pháp tối ưu hóa có xét đến hoạt động I/O, giúp tăng tốc phép toán self-attention chính xác với độ phức tạp O(N bình phương) bằng cách di chuyển dữ liệu hiệu quả giữa các tầng bộ nhớ GPU. Khác với attention tuyến tính, Flash Attention không thay đổi công thức toán học nền tảng.
- Attention thưa: Một phương pháp tiết kiệm bộ nhớ bằng cách buộc mạng chỉ xem xét một cửa sổ cục bộ gồm các token lân cận, trong khi attention tuyến tính nén toàn bộ góc nhìn toàn cục về mặt toán học thành một trạng thái có kích thước cố định.
Ứng dụng thực tế#
Bằng cách phá vỡ giới hạn về độ dài chuỗi, khả năng mở rộng tuyến tính mở ra những năng lực mạnh mẽ trong nhiều lĩnh vực AI:
- Xử lý ngôn ngữ tự nhiên (NLP): Các mô hình ngôn ngữ lớn (LLM) của những tổ chức như OpenAI có thể tiếp nhận dễ dàng các kho mã nguồn khổng lồ hoặc tài liệu pháp lý phức tạp. Khả năng mở rộng tuyến tính cho phép sử dụng cửa sổ ngữ cảnh khổng lồ cần thiết để suy luận tài liệu hiệu quả.
- Thị giác máy tính độ phân giải cao (CV): Với các tác vụ phức tạp như phân tích ảnh y tế hoặc phân tích ảnh vệ tinh, việc làm phẳng ảnh gigapixel tạo ra các chuỗi token khổng lồ. Attention tuyến tính cho phép model thực hiện phân đoạn ảnh chi tiết trực tiếp trên đầu vào có độ phân giải cao mà không cần giảm độ phân giải quá mức, vốn làm mất các chi tiết thiết yếu.
Ví dụ mã#
Các framework hiện đại như PyTorch và TensorFlow giúp triển khai các khái niệm toán học này một cách đơn giản. Dưới đây là đoạn mã PyTorch mang tính khái niệm, minh họa cách attention tuyến tính thay đổi thứ tự phép nhân ma trận để đạt hiệu quả O(N).
import torch
import torch.nn as nn
import torch.nn.functional as F
class SimpleLinearAttention(nn.Module):
def __init__(self, dim):
super().__init__()
self.qkv = nn.Linear(dim, dim * 3)
def forward(self, x):
# x shape: (Batch, Sequence Length, Channels)
q, k, v = self.qkv(x).chunk(3, dim=-1)
# Apply an activation function as a kernel approximation (replaces softmax)
q = F.elu(q) + 1.0
k = F.elu(k) + 1.0
# Associative trick: Multiply Key and Value first (O(N) complexity)
# k^T @ v yields a fixed (Batch, Channels, Channels) matrix
kv_context = torch.matmul(k.transpose(-2, -1), v)
# Multiply Query by the fixed context matrix to get the final output
return torch.matmul(q, kv_context)
# Example: Processing a sequence of 1024 tokens
model = SimpleLinearAttention(dim=64)
dummy_input = torch.randn(1, 1024, 64)
output = model(dummy_input)
print(f"Output shape: {output.shape}")Mặc dù các model cộng đồng thử nghiệm có thể tích hợp nhiều lớp attention tuyến tính hoặc thưa khác nhau, các model này thường gặp tình trạng tốc độ CPU chậm hoặc huấn luyện thiếu ổn định. Đối với các triển khai thị giác máy tính đáng tin cậy, sẵn sàng đưa vào sản xuất, Ultralytics YOLO26 là lựa chọn tiêu chuẩn được khuyến nghị. Model này có kiến trúc tối ưu cao, end-to-end nguyên bản, giúp tối đa hóa tốc độ và độ chính xác cho các tác vụ quan trọng như phát hiện đối tượng mà không cần đến các lớp attention nặng. Nhà phát triển có thể dễ dàng gán nhãn tập dữ liệu, huấn luyện, triển khai và giám sát các model hàng đầu này bằng Ultralytics Platform toàn diện.









