Token
Tìm hiểu cách token đóng vai trò là đơn vị thông tin cơ bản trong AI. Khám phá vai trò của token trong NLP, computer vision và phát hiện với vocabulary mở bằng YOLO26.
Trong kiến trúc tinh vi của trí tuệ nhân tạo hiện đại, token đại diện cho đơn vị thông tin cơ bản, nguyên tử mà một model xử lý. Trước khi một thuật toán có thể diễn giải một câu, phân tích một script phần mềm hoặc nhận diện các đối tượng trong ảnh, dữ liệu đầu vào thô phải được chia nhỏ thành những phần tử rời rạc, được chuẩn hóa này. Việc phân đoạn này là một bước then chốt trong tiền xử lý dữ liệu, chuyển đổi các đầu vào phi cấu trúc thành định dạng số mà mạng nơ-ron có thể tính toán hiệu quả. Trong khi con người cảm nhận ngôn ngữ như một dòng suy nghĩ liên tục hoặc hình ảnh như những cảnh quan thị giác liền mạch, các model tính toán cần những khối xây dựng chi tiết này để thực hiện các tác vụ như nhận dạng mẫu và phân tích ngữ nghĩa.
Token và Token hóa#
Để nắm được cơ chế của machine learning, cần phân biệt giữa đơn vị dữ liệu và quy trình được sử dụng để tạo ra đơn vị đó. Sự phân biệt này giúp tránh nhầm lẫn khi thiết kế các pipeline dữ liệu và chuẩn bị tài liệu huấn luyện trên Ultralytics Platform.
- Token hóa: Đây là quy trình thuật toán (động từ) để tách dữ liệu thô thành các phần. Đối với văn bản, quy trình này có thể sử dụng các thư viện như Bộ công cụ ngôn ngữ tự nhiên (NLTK) để xác định ranh giới giữa các đơn vị.
- Token: Đây là đầu ra thu được (danh từ). Đó là phần dữ liệu thực tế—chẳng hạn như một từ, một từ con hoặc một mảnh ảnh—cuối cùng được ánh xạ thành một vector số gọi là embedding.
Token trong các lĩnh vực AI khác nhau#
Bản chất của token thay đổi đáng kể tùy thuộc vào modality của dữ liệu được xử lý, đặc biệt là giữa các lĩnh vực văn bản và thị giác.
Token văn bản trong NLP#
Trong lĩnh vực Xử lý ngôn ngữ tự nhiên (NLP), token là đầu vào cho các mô hình ngôn ngữ lớn (LLMs). Các phương pháp ban đầu ánh xạ trực tiếp theo từng từ hoàn chỉnh, nhưng các kiến trúc hiện đại sử dụng các thuật toán từ con như Mã hóa cặp byte (BPE). Phương pháp này cho phép model xử lý các từ hiếm bằng cách chia chúng thành những âm tiết có ý nghĩa, cân bằng giữa kích thước từ vựng và độ bao phủ ngữ nghĩa. Ví dụ, từ "unhappiness" có thể được token hóa thành "un", "happi" và "ness".
Token thị giác trong Computer Vision#
Khái niệm token hóa đã mở rộng sang thị giác máy tính cùng với sự ra đời của Transformer thị giác (ViT). Không giống các mạng tích chập truyền thống xử lý pixel trong các cửa sổ trượt, các Transformer chia ảnh thành một lưới gồm các mảnh có kích thước cố định (ví dụ: 16x16 pixel). Mỗi mảnh được làm phẳng và được xem như một token thị giác riêng biệt. Cách tiếp cận này cho phép model sử dụng các cơ chế self-attention để hiểu mối quan hệ giữa những phần cách xa nhau trong ảnh, tương tự cách Google Research ban đầu áp dụng Transformer cho văn bản.
Các ứng dụng trong thực tế#
Token đóng vai trò cầu nối giữa dữ liệu của con người và trí tuệ máy trong vô số ứng dụng.
-
Phát hiện đối tượng với từ vựng mở: Các model tiên tiến như YOLO-World sử dụng phương pháp đa phương thức, trong đó token văn bản tương tác với các đặc trưng thị giác. Người dùng có thể nhập các prompt văn bản tùy chỉnh (ví dụ: "mũ bảo hiểm màu xanh dương"), sau đó model token hóa prompt và đối sánh với các đối tượng trong ảnh. Điều này cho phép học zero-shot, giúp phát hiện những đối tượng mà model chưa được huấn luyện rõ ràng.
-
AI tạo sinh: Trong các hệ thống tạo văn bản như chatbot, AI hoạt động bằng cách dự đoán xác suất của token tiếp theo trong một chuỗi. Bằng cách lặp lại việc chọn token tiếp theo có khả năng cao nhất, hệ thống xây dựng các câu và đoạn văn mạch lạc, cung cấp năng lực cho nhiều công cụ từ hỗ trợ khách hàng tự động đến trợ lý ảo.
Ví dụ Python: Sử dụng token văn bản để phát hiện#
Đoạn mã sau minh họa cách package ultralytics sử dụng token văn bản để hướng dẫn phát hiện đối tượng. Mặc dù YOLO26 tiên tiến nhất được khuyến nghị cho suy luận tốc độ cao với các lớp cố định, kiến trúc YOLO-World cho phép người dùng xác định các lớp dưới dạng token văn bản trong runtime.
from ultralytics import YOLO
# Load a pre-trained YOLO-World model capable of understanding text tokens
model = YOLO("yolov8s-world.pt")
# Define specific classes; these text strings are tokenized internally
# The model will look specifically for these "tokens" in the visual data
model.set_classes(["bus", "backpack"])
# Run prediction on an image using the defined tokens
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results showing only the tokenized classes
results[0].show()Hiểu về token là nền tảng để khám phá lĩnh vực AI tạo sinh và phân tích nâng cao. Dù giúp một chatbot trò chuyện trôi chảy hay hỗ trợ một hệ thống thị giác phân biệt giữa các lớp đối tượng tinh vi, token vẫn là đơn vị thiết yếu của trí tuệ máy được các framework như PyTorch và TensorFlow sử dụng.









