Ring Attention
Khám phá cách Ring Attention mở rộng Transformer đến độ dài sequence vô hạn. Tìm hiểu cách kỹ thuật này nâng cao LLM và Vision Transformer cho các tác vụ dữ liệu quy mô lớn.
Ring Attention là một kỹ thuật học máy (ML) tiên tiến, được thiết kế để mở rộng cửa sổ ngữ cảnh của các kiến trúc Transformer lên độ dài chuỗi gần như vô hạn. Bằng cách phân phối phép tính attention phức tạp trên một cụm GPU được kết nối theo topology vòng, kỹ thuật này chồng lấp hiệu quả hoạt động giao tiếp với tính toán. Bước đột phá về kiến trúc này cho phép Mô hình ngôn ngữ lớn (LLMs) và Transformer thị giác (ViT) xử lý các đầu vào khổng lồ—chẳng hạn như toàn bộ sách hoặc nhiều giờ video liên tục—vượt xa dung lượng bộ nhớ của bất kỳ thiết bị phần cứng đơn lẻ nào.
Vượt qua rào cản cửa sổ ngữ cảnh#
Trong các cơ chế self-attention tiêu chuẩn, mức tiêu thụ bộ nhớ tăng theo bình phương độ dài chuỗi đầu vào. Điều này tạo ra một nút thắt nghiêm trọng đối với các model deep learning (DL) cố gắng phân tích dữ liệu dạng dài. Để tìm hiểu thêm về cách cộng đồng AI giải quyết vấn đề này, bạn có thể xem công trình của Berkeley AI Research về các model ngữ cảnh lớn.
Ring Attention giải quyết nút thắt bậc hai này bằng cách chia các query, key và value thành những block nhỏ hơn. Mỗi GPU trong mạng phân tán sẽ tính toán một block, sau đó truyền key và value đến thiết bị lân cận trong vòng. Quá trình truyền theo chu kỳ này tiếp tục cho đến khi toàn bộ cơ chế attention được tính toán. Việc sử dụng các công cụ như gói giao tiếp phân tán của PyTorch cho phép developer xây dựng các pipeline training đa thiết bị phức tạp này.
Ring Attention so với Flash Attention#
Mặc dù cả hai kỹ thuật đều tối ưu hóa bộ nhớ, chúng hoạt động ở các cấp độ khác nhau. Flash Attention là một thuật toán nhận biết phần cứng, giúp giảm thiểu các thao tác đọc và ghi bộ nhớ tốn kém trong SRAM của một GPU. Ngược lại, Ring Attention là một thuật toán phân tán, tập trung vào việc mở rộng quy mô tính toán trên nhiều GPU. Trong các workflow AI tạo sinh tiên tiến, hai kỹ thuật này thường được kết hợp để đạt được cả hiệu quả phần cứng cục bộ lẫn khả năng mở rộng lớn trên nhiều thiết bị, như được trình bày chi tiết trong bài nghiên cứu Ring Attention gốc trên arXiv.
Các ứng dụng trong thực tế#
Khả năng xử lý đồng thời hàng triệu token mở ra những năng lực mạnh mẽ trong AI hiện đại:
-
Phân tích toàn diện tài liệu và codebase: Ring Attention cho phép các model tiếp nhận hàng triệu dòng code hoặc những bộ tài liệu pháp lý phức tạp trong một prompt duy nhất. Điều này cải thiện đáng kể các hệ thống dựa trên Tạo sinh tăng cường truy xuất (RAG), cho phép chúng tổng hợp ngữ cảnh mà không cắt ngắn thông tin quan trọng. Khái niệm này là nền tảng cho các model có ngữ cảnh khổng lồ như kiến trúc Gemini của Google.
-
Hiểu video mở rộng: Trong thị giác máy tính (CV), việc xử lý các chuỗi video độ phân giải cao thường đòi hỏi downsampling mạnh. Ring Attention cho phép các model phân tích các luồng video dài hàng giờ không nén. Điều này cải thiện khả năng nhận diện hành động và tracking đối tượng liên tục trong các hệ thống an ninh và xe tự hành, đồng thời duy trì nhận thức về thời gian trong những khoảng thời lượng dài.
Xử lý các chuỗi hình ảnh#
Trong khi các model attention phân tán quy mô lớn xử lý các ngữ cảnh vô hạn, những ứng dụng thực tế ưu tiên edge lại đòi hỏi các kiến trúc được tối ưu hóa cao. Đối với suy luận theo thời gian thực và xử lý chuỗi hình ảnh, Ultralytics YOLO26 cung cấp hiệu năng hàng đầu ngành mà không phải chịu chi phí tính toán cực lớn của các Transformer thuần dựa trên attention.
from ultralytics import YOLO
# Load the recommended YOLO26 model for high-speed object tracking
model = YOLO("yolo26n.pt")
# Perform robust multi-object tracking on a long video sequence
results = model.track(source="long_surveillance_feed.mp4", stream=True)
# Iterate through the stream to process temporal tracking data
for frame_result in results:
print(f"Tracked {len(frame_result.boxes)} objects in current frame.")Khi xây dựng và mở rộng các giải pháp phát hiện đối tượng và phân đoạn ảnh phức tạp này, việc quản lý điều phối phần cứng là yếu tố then chốt. Ultralytics Platform đơn giản hóa hoàn toàn quy trình này, cung cấp các công cụ cho training trên cloud liền mạch, gán nhãn dataset tự động và triển khai model chỉ bằng một cú nhấp trên nhiều môi trường phần cứng. Việc tận dụng các platform này đảm bảo các kỹ thuật mở rộng tiên tiến chuyển đổi suôn sẻ từ nghiên cứu sang các pipeline AI có khả năng mở rộng và sẵn sàng cho production.









