YOLO Vision 2026:
Quay lại Bảng thuật ngữ Ultralytics

Linear Attention

Khám phá cách linear attention tối ưu hóa các model deep learning bằng cách giảm độ phức tạp của Transformer xuống O(N). Tìm hiểu cách nó mở rộng hiệu suất cho các ứng dụng AI.

Linear attention là một kỹ thuật tối ưu hóa nền tảng được thiết kế để cải thiện đáng kể computational efficiency của các mô hình deep learning (DL) hiện đại. Trong các Transformer architectures truyền thống, các cơ chế attention tiêu chuẩn xử lý các chuỗi bằng cách so sánh từng token với mọi token khác. Điều này tạo ra một nút thắt cổ chai về tính toán và bộ nhớ nghiêm trọng được gọi là quadratic time complexity, hay O(N bình phương), trong đó N là độ dài chuỗi. Linear attention thay đổi phép toán cơ bản này để nó tỷ lệ tuyến tính, hoặc O(N). Bước đột phá này cho phép các mô hình trong lĩnh vực artificial intelligence (AI) xử lý các tập dữ liệu lớn, chẳng hạn như toàn bộ sách hoặc hình ảnh gigapixel, mà không làm cạn kiệt bộ nhớ phần cứng.

Cách thức hoạt động của Linear Attention#

Trong attention tiêu chuẩn, các mạng neural xử lý ba vectơ chính: Queries (Q), Keys (K) và Values (V). Công thức cổ điển tính toán độ tương đồng giữa tất cả các Queries và Keys bằng cách sử dụng hàm softmax, tạo ra một ma trận N x N lớn trước khi nhân nó với các Values.

Linear attention bỏ qua việc tạo ra ma trận trung gian lớn này. Thay vào đó, nó dựa vào associative property of matrix multiplication. Bằng cách loại bỏ hoặc xấp xỉ hóa lớp softmax bằng các hàm kernel chuyên biệt, mô hình nhóm phép nhân theo cách khác. Nó nhân các Keys và Values lại với nhau trước để tạo ra một ma trận ngữ cảnh có kích thước cố định, sau đó nhân các Queries với ma trận nén mới này. Sự sắp xếp lại đơn giản này làm giảm đáng kể độ phức tạp tính toán, giải phóng phần cứng như GPU (Graphics Processing Unit) để xử lý các đầu vào dài hơn nhiều một cách nguyên bản.

Những phát triển gần đây và DeltaNet#

Cộng đồng nghiên cứu AI, dẫn đầu bởi các tổ chức như Stanford University và các gã khổng lồ công nghệ như Google DeepMind, liên tục đổi mới các công thức tuyến tính để tăng độ chính xác. Vào năm 2024 và 2025, các nhà nghiên cứu đã giới thiệu DeltaNet, một kiến trúc mới lạ thay thế các bản cập nhật cộng tiêu chuẩn trong các linear transformer bằng "Quy tắc Delta". Điều này cho phép mạng cập nhật bộ nhớ trong của nó tương ứng với những gì đã được lưu trữ, thay vì tính toán các giá trị tuyệt đối từ đầu.

Các tiến bộ tiếp theo, chẳng hạn như các kiến trúc Gated DeltaNet architectures, giới thiệu tỷ lệ suy giảm theo kênh (channel-wise decay rates), cho phép các mô hình quên đi hoặc giữ lại có chọn lọc các tính năng khóa cụ thể theo thời gian. Những đổiσ mới hiệu quả về phần cứng này thu hẹp khoảng cách hiệu suất giữa các linear transformer và attention softmax truyền thống, đặc biệt trong các tác vụ truy xuất trong ngữ cảnh phức tạp.

So sánh Linear Attention với các cơ chế Attention khác#

Hiểu cách kỹ thuật này khác biệt với các khái niệm liên quan trong họ attention mechanism rộng lớn hơn là rất quan trọng đối với các kỹ sư AI đang tối ưu hóa mạng của họ:

  • Self-Attention: Cơ chế nền tảng sử dụng toàn bộ ma trận softmax O(N bình phương) tốn kém về mặt tính toán để nắm bắt bối cảnh toàn cục hoàn hảo.
  • Flash Attention: Một kỹ thuật tối ưu hóa nhận thức IO giúp tăng tốc toán học self-attention O(N bình phương) chính xác bằng cách di chuyển hiệu quả dữ liệu giữa các tầng bộ nhớ GPU. Không giống như linear attention, Flash Attention không làm thay đổi công thức toán học cơ bản.
  • Sparse Attention: Một phương pháp tiết kiệm bộ nhớ bằng cách ép mạng chỉ nhìn vào một cửa sổ cục bộ gồm các token láng giềng, trong khi linear attention nén một cách toán học toàn bộ góc nhìn toàn cục thành một trạng thái cố định.

Các ứng dụng trong thực tế#

Bằng cách phá vỡ rào cản về độ dài chuỗi, quy mô tuyến tính mở ra các khả năng mạnh mẽ trong nhiều lĩnh vực AI:

  • Natural Language Processing (NLP): Các Large Language Models (LLMs) từ các tổ chức như OpenAI có thể tiếp nhận các cơ sở mã nguồn lớn hoặc tài liệu pháp lý phức tạp một cách liền mạch. Việc mở rộng quy mô tuyến tính cho phép tạo ra các context windows lớn cần thiết cho việc suy luận tài liệu mạnh mẽ.
  • Độ phân giải cao Computer Vision (CV): Đối với các tác vụ phức tạp như medical image analysis hoặc satellite image analysis, việc làm phẳng hình ảnh gigapixel tạo ra các chuỗi token khổng lồ. Linear attention cho phép các mô hình thực hiện image segmentation chi tiết trực tiếp trên các đầu vào độ phân giải cao mà không phải dựa vào việc thu nhỏ hình ảnh quá mức làm phá hủy các chi tiết quan trọng.

Ví dụ về mã#

Các framework hiện đại như PyTorchTensorFlow giúp việc triển khai các khái niệm toán học này trở nên trực quan. Dưới đây là đoạn mã PyTorch mang tính khái niệm minh họa cách linear attention thay đổi thứ tự phép nhân ma trận để đạt được hiệu quả O(N).

import torch
import torch.nn as nn
import torch.nn.functional as F


class SimpleLinearAttention(nn.Module):
    def __init__(self, dim):
        super().__init__()
        self.qkv = nn.Linear(dim, dim * 3)

    def forward(self, x):
        # x shape: (Batch, Sequence Length, Channels)
        q, k, v = self.qkv(x).chunk(3, dim=-1)

        # Apply an activation function as a kernel approximation (replaces softmax)
        q = F.elu(q) + 1.0
        k = F.elu(k) + 1.0

        # Associative trick: Multiply Key and Value first (O(N) complexity)
        # k^T @ v yields a fixed (Batch, Channels, Channels) matrix
        kv_context = torch.matmul(k.transpose(-2, -1), v)

        # Multiply Query by the fixed context matrix to get the final output
        return torch.matmul(q, kv_context)


# Example: Processing a sequence of 1024 tokens
model = SimpleLinearAttention(dim=64)
dummy_input = torch.randn(1, 1024, 64)
output = model(dummy_input)
print(f"Output shape: {output.shape}")

Mặc dù các mô hình cộng đồng thử nghiệm có thể kết hợp các lớp linear hoặc sparse attention khác nhau, chúng thường có thể gặp phải tốc độ CPU chậm hoặc sự không ổn định trong quá trình huấn luyện. Đối với các triển khai computer vision sẵn sàng cho sản xuất và mạnh mẽ, Ultralytics YOLO26 là tiêu chuẩn được khuyến nghị. Nó có kiến trúc end-to-end được tối ưu hóa cao, tối đa hóa tốc độ và độ chính xác cho các tác vụ quan trọng như object detection mà không cần dựa vào các lớp attention nặng nề. Các nhà phát triển có thể chú thích tập dữ liệu, huấn luyện, triển khai và giám sát các mô hình hàng đầu này một cách liền mạch bằng cách sử dụng Ultralytics Platform toàn diện.

Explore solutions

Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning