Transformer
Khám phá kiến trúc Transformer và cơ chế tự chú ý (self-attention). Tìm hiểu cách chúng hỗ trợ các mô hình AI như RT-DETR và Ultralytics YOLO26 để đạt độ chính xác vượt trội.
Transformer là một kiến trúc deep learning dựa trên cơ chế được gọi là self-attention để xử lý dữ liệu đầu vào tuần tự, chẳng hạn như ngôn ngữ tự nhiên hoặc các đặc trưng thị giác. Được giới thiệu lần đầu bởi các nhà nghiên cứu của Google trong bài báo mang tính bước ngoặt Attention Is All You Need, Transformer đã cách mạng hóa lĩnh vực trí tuệ nhân tạo (AI) bằng cách loại bỏ các giới hạn xử lý tuần tự của các Mạng thần kinh hồi tiếp (RNN) trước đó. Thay vào đó, Transformer phân tích toàn bộ chuỗi dữ liệu đồng thời, cho phép xử lý song song quy mô lớn và thời gian huấn luyện nhanh hơn đáng kể trên phần cứng hiện đại như GPU.
Cách thức hoạt động của Transformers#
Đổi mới cốt lõi của Transformer là cơ chế self-attention. Điều này cho phép model đánh giá tầm quan trọng của các phần khác nhau trong dữ liệu đầu vào tương đối với nhau. Ví dụ, trong một câu, model có thể học được rằng từ "bank" liên quan chặt chẽ hơn đến "money" thay vì "river" dựa trên ngữ cảnh xung quanh.
Kiến trúc này thường bao gồm hai thành phần chính:
- Encoder: Xử lý dữ liệu đầu vào thành một biểu diễn số phong phú hoặc embedding.
- Decoder: Sử dụng kết quả đầu ra của encoder để tạo ra kết quả cuối cùng, chẳng hạn như một câu đã dịch hoặc một khung bao (bounding box) được dự đoán.
Trong lĩnh vực computer vision (CV), các model thường sử dụng một biến thể gọi là Vision Transformer (ViT). Thay vì xử lý các token văn bản, hình ảnh được chia thành các patch có kích thước cố định (ví dụ: 16x16 pixel). Các patch này được làm phẳng và xử lý như một chuỗi, cho phép model nắm bắt "bối cảnh toàn cục"—hiểu được mối quan hệ giữa các phần xa nhau của hình ảnh—hiệu quả hơn so với Mạng thần kinh tích chập (CNN) tiêu chuẩn.
Transformers so với các khái niệm liên quan#
Điều quan trọng là phải phân biệt kiến trúc Transformer với các thuật ngữ liên quan:
- Attention Mechanism: Đây là khái niệm chung về việc tập trung vào các phần cụ thể của dữ liệu. Transformer là một kiến trúc cụ thể được xây dựng hoàn toàn xung quanh các attention layer, trong khi các model khác có thể sử dụng attention chỉ như một phần bổ sung nhỏ.
- Large Language Model (LLM): Các thuật ngữ như "GPT" đề cập đến các model cụ thể được huấn luyện trên lượng lớn văn bản. Hầu như tất cả các LLM hiện đại đều sử dụng kiến trúc Transformer làm cỗ máy nền tảng.
Các ứng dụng trong thực tế#
Tính linh hoạt của Transformers đã dẫn đến việc áp dụng chúng trong nhiều ngành công nghiệp:
-
Chẩn đoán hình ảnh y tế: Trong AI in Healthcare, Transformer được sử dụng cho các tác vụ phức tạp như medical image analysis. Khả năng hiểu các mối quan hệ không gian toàn cục của chúng giúp phát hiện các bất thường tinh tế trong các bản quét MRI hoặc CT độ phân giải cao mà các CNN tập trung vào đặc trưng cục bộ có thể bỏ sót.
-
Hệ thống tự hành: Đối với autonomous vehicles, việc hiểu quỹ đạo của người đi bộ và các phương tiện khác là rất quan trọng. Transformer xuất sắc trong việc video understanding bằng cách theo dõi các đối tượng qua các khung hình thời gian, dự đoán các chuyển động trong tương lai để đảm bảo điều hướng an toàn.
Phát hiện đối tượng với Transformers#
Mặc dù CNN truyền thống chiếm ưu thế trong việc phát hiện đối tượng, các model dựa trên Transformer như Real-Time Detection Transformer (RT-DETR) đã nổi lên như những giải pháp thay thế mạnh mẽ. RT-DETR kết hợp tốc độ của các phần thân CNN với độ chính xác của các phần đầu giải mã Transformer.
Tuy nhiên, các model Transformer thuần túy có thể nặng về tính toán. Đối với nhiều ứng dụng biên, các model lai được tối ưu hóa cao như YOLO26—tích hợp các cơ chế attention hiệu quả với quá trình xử lý tích chập nhanh chóng—mang lại sự cân bằng vượt trội về tốc độ và độ chính xác. Bạn có thể quản lý việc huấn luyện và triển khai các model này một cách dễ dàng thông qua Ultralytics Platform, giúp hợp lý hóa quy trình từ chú thích tập dữ liệu đến xuất model.
Ví dụ Python: Sử dụng RT-DETR#
Ví dụ sau đây minh họa cách thực hiện suy luận bằng cách sử dụng model dựa trên Transformer trong gói ultralytics. Đoạn mã này tải một model RT-DETR đã được huấn luyện trước và phát hiện các đối tượng trong một hình ảnh.
from ultralytics import RTDETR
# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")
# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results with bounding boxes
results[0].show()Để đọc thêm về nền tảng toán học, PyTorch documentation on Transformer layers cung cấp độ sâu kỹ thuật, trong khi IBM's guide to Transformers mang lại góc nhìn kinh doanh cấp cao.






