Transformer
Khám phá kiến trúc Transformer và cơ chế self-attention. Tìm hiểu cách chúng hỗ trợ các model AI như RT-DETR và Ultralytics YOLO26 đạt độ chính xác vượt trội.
Transformer là một kiến trúc deep learning dựa trên cơ chế gọi là self-attention để xử lý dữ liệu đầu vào tuần tự, chẳng hạn như ngôn ngữ tự nhiên hoặc các đặc trưng hình ảnh. Ban đầu được các nhà nghiên cứu của Google giới thiệu trong bài báo mang tính đột phá Attention Is All You Need, Transformer đã cách mạng hóa lĩnh vực trí tuệ nhân tạo (AI) bằng cách loại bỏ các hạn chế về xử lý tuần tự của những Mạng nơ-ron hồi quy (RNNs) trước đó. Thay vào đó, Transformer phân tích đồng thời toàn bộ chuỗi dữ liệu, cho phép song song hóa ở quy mô lớn và rút ngắn đáng kể thời gian training trên phần cứng hiện đại như GPU.
Cách Transformer hoạt động#
Đổi mới cốt lõi của Transformer là cơ chế self-attention. Cơ chế này cho phép model đánh giá mức độ quan trọng của các phần khác nhau trong dữ liệu đầu vào so với nhau. Ví dụ, trong một câu, model có thể học rằng từ "bank" liên quan đến "money" nhiều hơn "river" dựa trên ngữ cảnh xung quanh.
Kiến trúc này thường gồm hai thành phần chính:
- Encoder: Xử lý dữ liệu đầu vào thành một biểu diễn số phong phú hoặc một embedding.
- Decoder: Sử dụng đầu ra của encoder để tạo kết quả cuối cùng, chẳng hạn như một câu được dịch hoặc một bounding box được dự đoán.
Trong lĩnh vực thị giác máy tính (CV), các model thường sử dụng một biến thể có tên là Vision Transformer (ViT). Thay vì xử lý các token văn bản, hình ảnh được chia thành các patch có kích thước cố định (ví dụ: 16x16 pixel). Các patch này được làm phẳng và xử lý như một chuỗi, giúp model nắm bắt "ngữ cảnh toàn cục"—hiểu mối quan hệ giữa các phần cách xa nhau trong hình ảnh—hiệu quả hơn so với Mạng nơ-ron tích chập (CNN) tiêu chuẩn.
Transformer và các khái niệm liên quan#
Điều quan trọng là phân biệt kiến trúc Transformer với các thuật ngữ liên quan:
- Cơ chế Attention: Đây là khái niệm tổng quát về việc tập trung vào các phần dữ liệu cụ thể. Transformer là một kiến trúc cụ thể được xây dựng hoàn toàn xung quanh các lớp attention, trong khi những model khác có thể chỉ sử dụng attention như một phần bổ sung nhỏ.
- Mô hình ngôn ngữ lớn (LLM): Các thuật ngữ như "GPT" đề cập đến những model cụ thể được training trên lượng văn bản khổng lồ. Hầu hết LLM hiện đại đều sử dụng kiến trúc Transformer làm engine nền tảng.
Các ứng dụng trong thực tế#
Tính linh hoạt của Transformer đã dẫn đến việc chúng được áp dụng trong nhiều ngành khác nhau:
-
Chẩn đoán hình ảnh y khoa: Trong AI trong chăm sóc sức khỏe, Transformer được sử dụng cho các tác vụ phức tạp như phân tích hình ảnh y khoa. Khả năng hiểu các mối quan hệ không gian toàn cục giúp chúng phát hiện những bất thường tinh vi trong ảnh chụp MRI hoặc CT độ phân giải cao mà các CNN tập trung vào đặc trưng cục bộ có thể bỏ sót.
-
Hệ thống tự hành: Đối với xe tự hành, việc hiểu quỹ đạo của người đi bộ và các phương tiện khác là rất quan trọng. Transformer đặc biệt hiệu quả trong tìm hiểu video bằng cách theo dõi các object qua nhiều khung hình, dự đoán chuyển động trong tương lai để đảm bảo điều hướng an toàn.
Phát hiện object bằng Transformer#
Mặc dù CNN từ lâu đã chiếm ưu thế trong phát hiện object, các model dựa trên Transformer như Transformer Phát hiện Thời gian thực (RT-DETR) đã nổi lên như những lựa chọn thay thế mạnh mẽ. RT-DETR kết hợp tốc độ của backbone CNN với độ chính xác của các head decoder Transformer.
Tuy nhiên, các model Transformer thuần túy có thể tiêu tốn nhiều tài nguyên tính toán. Đối với nhiều ứng dụng edge, các model hybrid được tối ưu hóa cao như YOLO26—tích hợp các cơ chế attention hiệu quả với quá trình xử lý tích chập nhanh—mang lại sự cân bằng vượt trội giữa tốc độ và độ chính xác. Bạn có thể dễ dàng quản lý việc training và deployment các model này thông qua Nền tảng Ultralytics, giúp tinh gọn workflow từ gán nhãn dataset đến export model.
Ví dụ Python: Sử dụng RT-DETR#
Ví dụ sau minh họa cách thực hiện inference bằng một model dựa trên Transformer trong package ultralytics. Đoạn code này load một model RT-DETR đã được pre-trained và phát hiện object trong một hình ảnh.
from ultralytics import RTDETR
# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")
# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results with bounding boxes
results[0].show()Để đọc thêm về các nền tảng toán học, tài liệu PyTorch về các lớp Transformer cung cấp nội dung chuyên sâu về kỹ thuật, trong khi hướng dẫn về Transformer của IBM đưa ra góc nhìn kinh doanh ở cấp độ tổng quan.









