Image Captioning
Mô tả ảnh tạo ra phần mô tả bằng ngôn ngữ tự nhiên cho ảnh bằng các model vision-language. Trình bày ứng dụng, hạn chế và cách grounding chú thích bằng YOLO.
Tạo chú thích ảnh là một tác vụ AI tự động tạo mô tả bằng ngôn ngữ tự nhiên cho hình ảnh. Ví dụ, với ảnh chụp đường phố, hệ thống có thể tạo câu: “Một chiếc xe buýt thành phố đang chạy ngang qua người đi bộ tại một giao lộ.” Tác vụ này kết hợp nhận thức thị giác với tạo ngôn ngữ, vì vậy model phải xác định nội dung quan trọng, hiểu mối quan hệ giữa các đối tượng và diễn đạt thông tin đó một cách rõ ràng.
Việc tạo chú thích thường được thực hiện bởi model thị giác-ngôn ngữ, hoạt động trên cả dữ liệu hình ảnh và văn bản. Khác với chú thích ảnh do con người viết, chú thích do AI tạo ra là một dự đoán dựa trên các mẫu đã học từ các cặp hình ảnh-văn bản.
Cách tạo chú thích ảnh hoạt động#
Hệ thống tạo chú thích ảnh thường có hai giai đoạn liên kết với nhau:
- Bộ mã hóa thị giác chuyển đổi pixel thành các biểu diễn đặc trưng mô tả đối tượng, kết cấu, vị trí và thông tin tổng quan hơn về cảnh.
- Bộ giải mã ngôn ngữ chuyển các đặc trưng thị giác đó thành một chuỗi từ.
Nhiều hệ thống sử dụng bộ giải mã transformer. Bộ giải mã bắt đầu bằng token bắt đầu, dự đoán token tiếp theo, thêm token đó vào chuỗi rồi lặp lại cho đến khi tạo ra token kết thúc hoặc đạt giới hạn độ dài. Quá trình từng token này được gọi là tạo sinh tự hồi quy.
Vòng lặp encoder-decoder đầy đủ như sau:
Cơ chế attention giúp bộ giải mã tập trung vào các vùng ảnh liên quan khi chọn từng từ. Khi tạo từ “xe buýt”, cơ chế này có thể nhấn mạnh phương tiện; khi tạo từ “đường phố”, cơ chế có thể chú ý đến con đường xung quanh. Một model tạo chú thích ảnh hoàn chỉnh kết hợp đặc trưng ảnh, tokenization, cross-attention và bộ giải mã văn bản.
Quá trình huấn luyện thường cần các hình ảnh đi kèm với một hoặc nhiều chú thích do con người viết. Nhiều chú thích rất hữu ích vì cùng một hình ảnh có thể được mô tả chính xác theo nhiều cách, chẳng hạn như “Một đứa trẻ đang chơi với chó” và “Một người trẻ ném bóng cho thú cưng”.
Khác biệt với các tác vụ thị giác liên quan#
Tạo chú thích ảnh có điểm giao với một số tác vụ AI nhưng tạo ra đầu ra khác biệt:
- Phân loại ảnh gán một hoặc nhiều nhãn cho toàn bộ ảnh, chẳng hạn “bãi biển”. Tạo chú thích sinh ra một câu có thể mô tả đối tượng, hành động, thuộc tính và ngữ cảnh.
- Phát hiện đối tượng xác định và định vị các đối tượng được định nghĩa trước bằng bounding box. Tạo chú thích có thể nhắc đến các đối tượng đó, đồng thời mô tả mối quan hệ giữa chúng, chẳng hạn “Hai người đi xe đạp bên cạnh một chiếc ô tô”.
- Nhận dạng ký tự quang học trích xuất chữ viết hiển thị trên biển báo, tài liệu hoặc bao bì. Chú thích tóm tắt cảnh thay vì sao chép toàn bộ văn bản.
- Hỏi đáp trực quan trả lời một câu hỏi cụ thể về hình ảnh. Tạo chú thích tạo ra mô tả tổng quát mà không cần câu hỏi.
- Văn bản thay thế: Văn bản này truyền đạt mục đích của hình ảnh trong một ngữ cảnh cụ thể. Chú thích tự động có thể cung cấp bản nháp, nhưng không mặc nhiên phù hợp làm văn bản thay thế vì hình ảnh trang trí, chức năng và phức tạp cần được xử lý khác nhau theo Hướng dẫn W3C về hình ảnh.
Ứng dụng thực tế#
-
Nội dung web có thể truy cập: Nền tảng xuất bản có thể tạo bản nháp mô tả cho ảnh mới tải lên. Với ảnh tin tức, chú thích có thể xác định những người chính, bối cảnh và hành động trước khi biên tập viên kiểm tra độ chính xác và mức độ liên quan. Sơ đồ phức tạp vẫn cần mô tả dài có cấu trúc thay vì bản tóm tắt hình ảnh chung chung.
-
Thư viện phương tiện có thể tìm kiếm: Nhà bán lẻ hoặc công ty truyền thông có thể tạo chú thích cho các bộ sưu tập hình ảnh lớn và lập chỉ mục văn bản được tạo ra. Người dùng có thể tìm kiếm các cụm từ như “ba lô đỏ cạnh lều” ngay cả khi các tệp chưa từng được gắn thẻ thủ công. Chú thích có thể bổ trợ cho embedding hình ảnh và metadata, cải thiện khả năng tìm kiếm trong các danh mục lớn.
Neo thông tin thực tế bằng Ultralytics YOLO#
Các hệ thống tạo chú thích có thể bịa ra chi tiết không được hỗ trợ, đặc biệt trong những cảnh đông đúc hoặc xa lạ. Một thiết kế thực tiễn là neo quá trình tạo bằng các quan sát có cấu trúc từ Ultralytics YOLO26. Quy trình dự đoán YOLO được tài liệu hóa dưới đây trích xuất tên các đối tượng được phát hiện để một thành phần ngôn ngữ ở bước sau sử dụng làm ngữ cảnh thị giác:
from ultralytics import YOLO
# Phát hiện các đối tượng có thể làm cơ sở thực tế cho hệ thống tạo chú thích ở bước sau
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Chuyển các kết quả phát hiện thành ngữ cảnh văn bản ngắn gọn
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)Quy trình này không tạo ra chú thích cuối cùng. Thay vào đó, quy trình cung cấp các nhãn đối tượng có thể xác minh để giới hạn phạm vi của model ngôn ngữ. Đối với các lĩnh vực tùy chỉnh, Ultralytics Platform hỗ trợ gán nhãn tập dữ liệu trên cloud, huấn luyện, triển khai và giám sát thành phần nhận thức trong quy trình tạo chú thích.
Hạn chế và đánh giá#
Chú thích có thể bỏ sót các đối tượng quan trọng, nhầm lẫn mối quan hệ, tái tạo thiên lệch dữ liệu hoặc tạo ra chi tiết không nhìn thấy trong ảnh. Điểm confidence, chẳng hạn điểm do API mô tả ảnh trả về, có thể giúp xếp hạng các mô tả ứng viên, nhưng một câu văn trôi chảy không nhất thiết là chính xác.
Do đó, quá trình đánh giá cần xem xét mức độ bao phủ đối tượng, độ xác thực của thông tin, khả năng đọc, thiên kiến và tính hữu ích đối với đối tượng người dùng dự kiến. Vì nhiều chú thích có thể đúng như nhau, các nhóm nên kết hợp phép đo tự động với đánh giá của con người, áp dụng các thông lệ như đánh giá AI tạo sinh và NIST AI Risk Management Framework rộng hơn. Việc con người phê duyệt vẫn đặc biệt quan trọng đối với nội dung về khả năng tiếp cận, y tế, an toàn trọng yếu hoặc hướng đến công chúng.










