CLIP (Contrastive Language-Image Pre-training)
Khám phá CLIP (Tiền huấn luyện Ngôn ngữ-Hình ảnh Đối chiếu) để kết nối thị giác và ngôn ngữ. Tìm hiểu cách công nghệ này hỗ trợ zero-shot learning và thúc đẩy Ultralytics YOLO26.
CLIP (Tiền huấn luyện tương phản ngôn ngữ-hình ảnh) là một kiến trúc mạng nơ-ron đột phá do OpenAI phát triển, giúp thu hẹp khoảng cách giữa dữ liệu hình ảnh và ngôn ngữ tự nhiên. Không giống các hệ thống thị giác máy tính (CV) truyền thống cần gán nhãn dữ liệu thủ công tốn nhiều công sức cho một tập hợp danh mục cố định, CLIP học cách hiểu hình ảnh bằng cách huấn luyện trên hàng triệu cặp hình ảnh-văn bản được thu thập từ Internet. Phương pháp này cho phép model thực hiện học zero-shot, nghĩa là model có thể nhận diện các đối tượng, khái niệm hoặc phong cách mà chưa từng thấy trực tiếp trong quá trình huấn luyện, chỉ bằng cách đọc mô tả văn bản. Bằng cách ánh xạ thông tin hình ảnh và ngôn ngữ vào một không gian đặc trưng chung, CLIP hoạt động như một model nền tảng mạnh mẽ cho nhiều tác vụ downstream mà không cần tinh chỉnh chuyên biệt theo tác vụ trên quy mô lớn.
Kiến trúc Hoạt động Như thế nào#
Cơ chế cốt lõi của CLIP gồm hai bộ mã hóa song song: bộ mã hóa hình ảnh, thường dựa trên Transformer thị giác (ViT) hoặc ResNet, và một Transformer xử lý văn bản tương tự các Transformer được sử dụng trong những mô hình ngôn ngữ lớn (LLMs) hiện đại. Thông qua một quy trình được gọi là học tương phản, hệ thống được huấn luyện để dự đoán đoạn văn bản nào khớp với hình ảnh nào trong một batch.
Trong quá trình huấn luyện, model tối ưu các tham số để kéo các embedding vector của những cặp hình ảnh-văn bản tương ứng lại gần nhau, đồng thời đẩy các cặp không tương ứng ra xa. Điều này tạo ra một không gian tiềm ẩn đa phương thức, trong đó biểu diễn toán học của hình ảnh một "chó Golden Retriever" nằm gần về mặt không gian với embedding văn bản cho "một bức ảnh chụp một con chó". Bằng cách tính độ tương đồng cosine giữa các vector này, model có thể định lượng mức độ tương ứng giữa một hình ảnh và prompt ngôn ngữ tự nhiên, cho phép phân loại hình ảnh và truy xuất linh hoạt.
Các ứng dụng trong thực tế#
Khả năng liên kết thị giác và ngôn ngữ đã biến CLIP thành công nghệ nền tảng trong các ứng dụng AI hiện đại:
- Tìm kiếm ngữ nghĩa thông minh: CLIP cho phép người dùng tìm kiếm trong các cơ sở dữ liệu hình ảnh lớn bằng các truy vấn xử lý ngôn ngữ tự nhiên (NLP) phức tạp. Ví dụ, trong AI bán lẻ, người mua có thể tìm kiếm "váy mùa hè hoa phong cách vintage" và nhận được các kết quả trực quan chính xác mà không cần hình ảnh phải có những thẻ siêu dữ liệu cụ thể đó. Tính năng này thường được hỗ trợ bởi các cơ sở dữ liệu vector hiệu năng cao.
- Điều khiển AI tạo sinh: Các model như Stable Diffusion dựa vào CLIP để diễn giải prompt của người dùng và định hướng quá trình tạo sinh. CLIP hoạt động như một bộ chấm điểm, đánh giá mức độ đầu ra hình ảnh được tạo ra phù hợp với mô tả văn bản, đây là yếu tố thiết yếu để tổng hợp văn bản thành hình ảnh chất lượng cao.
- Phát hiện đối tượng với từ vựng mở: Các kiến trúc nâng cao như YOLO-World tích hợp embedding của CLIP để phát hiện đối tượng dựa trên đầu vào văn bản tùy ý. Điều này cho phép phát hiện linh hoạt trong các lĩnh vực như AI trong chăm sóc sức khỏe, nơi cần nhận diện thiết bị hoặc điểm bất thường mới mà không phải huấn luyện lại.
Sử dụng đặc trưng CLIP với Ultralytics#
Trong khi các bộ phát hiện đối tượng tiêu chuẩn bị giới hạn ở những lớp trong dữ liệu huấn luyện, việc sử dụng các đặc trưng dựa trên CLIP cho phép phát hiện với từ vựng mở. Đoạn mã Python sau đây minh họa cách sử dụng package ultralytics để phát hiện đối tượng bằng các prompt văn bản tùy chỉnh:
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model utilizing CLIP features
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])
# Run inference on an image to detect the text-defined objects
results = model.predict("travelers.jpg")
# Display the results
results[0].show()Phân biệt các khái niệm liên quan#
Để hiểu rõ tính hữu ích riêng của CLIP, việc phân biệt CLIP với các mô hình AI phổ biến khác là rất hữu ích:
- CLIP so với Học có giám sát: Các model có giám sát truyền thống yêu cầu định nghĩa chặt chẽ và các ví dụ đã gán nhãn cho từng danh mục (ví dụ: "mèo", "ô tô"). CLIP học từ các cặp văn bản-hình ảnh thô được tìm thấy trên web, mang lại sự linh hoạt cao hơn và loại bỏ nút thắt trong việc chú thích thủ công, vốn thường được quản lý bằng các công cụ như Ultralytics Platform.
- CLIP so với YOLO26: Trong khi CLIP cung cấp khả năng hiểu khái quát về các khái niệm, YOLO26 là bộ phát hiện đối tượng thời gian thực chuyên biệt, được tối ưu về tốc độ và khả năng định vị chính xác. CLIP thường được sử dụng làm bộ trích xuất đặc trưng hoặc bộ phân loại zero-shot, trong khi YOLO26 là engine cho suy luận thời gian thực tốc độ cao trong môi trường production.
- CLIP so với Học tương phản tiêu chuẩn: Các phương pháp như SimCLR thường so sánh hai góc nhìn đã được tăng cường của cùng một hình ảnh để học đặc trưng. CLIP đối chiếu một hình ảnh với một mô tả văn bản, kết nối hai phương thức dữ liệu riêng biệt thay vì chỉ một phương thức.









