Florence-2: Model ngôn ngữ-thị giác mới nhất của Microsoft
Hãy làm quen với Florence-2, model ngôn ngữ-thị giác của Microsoft, cung cấp khả năng phát hiện đối tượng, segmentation và zero-shot được cải thiện với hiệu suất cao.

Vào tháng 6 năm 2024, Microsoft giới thiệu Florence-2, một model ngôn ngữ-thị giác đa phương thức (VLM) được thiết kế để xử lý nhiều tác vụ, bao gồm phát hiện đối tượng, phân đoạn, tạo chú thích ảnh và grounding. Florence-2 thiết lập một chuẩn mới về hiệu năng zero-shot, nghĩa là model có thể thực hiện các tác vụ mà không cần được huấn luyện cụ thể trước đó, đồng thời có kích thước nhỏ hơn các model ngôn ngữ-thị giác tiên tiến khác.
Florence-2 không chỉ là một model khác; tính linh hoạt và hiệu năng được cải thiện của model có tiềm năng tạo ra tác động đáng kể đến nhiều ngành bằng cách nâng cao độ chính xác và giảm nhu cầu huấn luyện quy mô lớn. Trong bài viết này, chúng ta sẽ tìm hiểu các tính năng đổi mới của Florence-2, so sánh hiệu năng của model với các VLM khác và thảo luận về những ứng dụng tiềm năng.
Florence-2 là gì?#
Florence-2 có thể xử lý nhiều loại tác vụ trong một framework thống nhất duy nhất. Các khả năng ấn tượng của model một phần đến từ dataset huấn luyện khổng lồ có tên FLD-5B. FLD-5B bao gồm 5,4 tỷ annotation trên 126 triệu ảnh. Dataset toàn diện này được tạo riêng để cung cấp cho Florence-2 các khả năng cần thiết nhằm xử lý nhiều tác vụ thị giác với độ chính xác và hiệu quả cao.
Dưới đây là cái nhìn cụ thể hơn về các tác vụ mà Florence-2 hỗ trợ:
- Phát hiện đối tượng: Model có thể nhận diện và xác định vị trí các đối tượng trong ảnh với độ chính xác cao.
- Phân đoạn: Tác vụ này bao gồm việc chia ảnh thành các vùng có ý nghĩa để dễ phân tích và diễn giải hơn.
- Tạo chú thích ảnh: Florence-2 có khả năng tạo chú thích mô tả cho ảnh, cung cấp ngữ cảnh và thông tin chi tiết.
- Visual Grounding: Model có thể liên kết các cụm từ hoặc từ cụ thể trong chú thích với những vùng tương ứng trong ảnh.
- Hiệu năng zero-shot: Model có thể thực hiện các tác vụ mà không cần huấn luyện cụ thể.

Hình 1. Tìm hiểu cách Florence-2 được huấn luyện.
Model hỗ trợ cả các tác vụ dựa trên văn bản và dựa trên vùng. Các token vị trí đặc biệt được thêm vào vocabulary của model cho những tác vụ liên quan đến các vùng cụ thể trong ảnh. Các token này giúp model hiểu nhiều hình dạng khác nhau, chẳng hạn như hình chữ nhật bao quanh đối tượng (biểu diễn box), hình có bốn cạnh (biểu diễn quad box) và hình có nhiều cạnh (biểu diễn polygon). Model được huấn luyện bằng phương pháp có tên cross-entropy loss, giúp model học bằng cách so sánh các dự đoán với đáp án đúng và điều chỉnh các tham số bên trong tương ứng.
Tạo dataset FLD-5B#
Dataset FLD-5B bao gồm nhiều loại annotation: mô tả văn bản, các cặp vùng và văn bản, cùng các tổ hợp văn bản, cụm từ và vùng. Dataset được tạo thông qua quy trình hai bước gồm thu thập và annotation dữ liệu. Ảnh được lấy từ các dataset phổ biến như ImageNet-22k, Object 365, Open Images, Conceptual Captions và LAION. Các annotation trong dataset FLD-5B phần lớn là tổng hợp, nghĩa là được tự động tạo thay vì gán nhãn thủ công.

Hình 2. Tạo dataset FLD-5B.
Ban đầu, các model chuyên biệt thành thạo những tác vụ cụ thể như phát hiện đối tượng hoặc phân đoạn đã tạo các annotation này. Sau đó, quy trình lọc và tăng cường được sử dụng để bảo đảm annotation có đủ chi tiết và độ chính xác. Sau khi loại bỏ nhiễu, dataset trải qua quá trình tinh chỉnh lặp lại, trong đó đầu ra của Florence-2 được sử dụng để liên tục cập nhật và cải thiện annotation.
Tìm hiểu kiến trúc model của Florence-2#
Kiến trúc model của Florence-2 tuân theo phương pháp học sequence-to-sequence. Điều này có nghĩa là model xử lý một chuỗi đầu vào (chẳng hạn như ảnh kèm prompt văn bản) và tạo ra một chuỗi đầu ra (chẳng hạn như mô tả hoặc nhãn) theo từng bước. Trong framework sequence-to-sequence, mỗi tác vụ được xem như một bài toán dịch: model nhận một ảnh đầu vào và prompt dành riêng cho tác vụ, sau đó tạo ra đầu ra tương ứng.

Hình 3. Kiến trúc model ngôn ngữ-thị giác Florence-2.
Cốt lõi của kiến trúc model là một transformer encoder-decoder đa phương thức, kết hợp image encoder và encoder-decoder đa phương thức. Image encoder, có tên DaViT (Vision Transformer hiệu quả về dữ liệu), xử lý ảnh đầu vào bằng cách chuyển chúng thành các visual token embedding — những biểu diễn nhỏ gọn của ảnh, nắm bắt cả thông tin không gian (vị trí của sự vật) và ngữ nghĩa (bản chất của sự vật). Các visual token này sau đó được kết hợp với text embedding (biểu diễn của văn bản), cho phép model hợp nhất dữ liệu văn bản và hình ảnh một cách liền mạch.
So sánh Florence-2 với các VLM khác#
Florence-2 nổi bật so với các model ngôn ngữ-thị giác khác nhờ khả năng zero-shot ấn tượng. Không giống các model như PaliGemma, vốn phụ thuộc vào fine-tuning quy mô lớn để thích ứng với nhiều tác vụ, Florence-2 hoạt động tốt ngay sau khi cài đặt. Ngoài ra, Florence-2 có thể cạnh tranh với các model lớn hơn như GPT-4V và Flamingo, vốn thường có nhiều parameter hơn nhưng không phải lúc nào cũng đạt hiệu năng tương đương Florence-2. Ví dụ, Florence-2 đạt kết quả zero-shot tốt hơn Kosmos-2, dù Kosmos-2 có số lượng parameter nhiều hơn gấp đôi.
Trong các bài kiểm tra benchmark, Florence-2 cho thấy hiệu năng đáng chú ý ở những tác vụ như tạo chú thích trên COCO và hiểu biểu thức tham chiếu. Model vượt qua các model như PolyFormer và UNINEXT trong các tác vụ phát hiện đối tượng và phân đoạn trên dataset COCO. Đây là một lựa chọn có tính cạnh tranh cao cho các ứng dụng thực tế, nơi hiệu năng và hiệu quả tài nguyên đều đóng vai trò quan trọng.
Các ứng dụng của Florence-2#
Florence-2 có thể được sử dụng trong nhiều ngành khác nhau, chẳng hạn như giải trí, khả năng tiếp cận, giáo dục, v.v. Hãy cùng xem qua một vài ví dụ để hiểu rõ hơn.
Các ứng dụng của việc tạo chú thích ảnh#
Khi bạn truy cập một nền tảng streaming và đang cân nhắc nên xem gì, bạn có thể đọc phần tóm tắt bộ phim để đưa ra lựa chọn. Nếu nền tảng đó cũng có thể cung cấp mô tả chi tiết về poster phim thì sao? Florence-2 có thể thực hiện điều đó thông qua việc tạo chú thích ảnh, vốn tạo ra văn bản mô tả cho hình ảnh. Florence-2 có thể tạo mô tả chi tiết về poster phim, giúp các nền tảng streaming trở nên toàn diện hơn đối với người dùng khiếm thị. Bằng cách phân tích các yếu tố hình ảnh của poster, chẳng hạn như nhân vật, bối cảnh và văn bản, Florence-2 có thể tạo ra các mô tả chi tiết truyền tải nội dung và sắc thái của poster. Hình ảnh bên dưới cho thấy mức độ chi tiết mà Florence-2 có thể cung cấp trong phần mô tả.

Hình 4. Ví dụ về chú thích ảnh được Florence-2 tạo ra.
Dưới đây là một số ví dụ khác về những trường hợp tạo chú thích ảnh có thể hữu ích:
- Thương mại điện tử: Tạo chú thích ảnh có thể cung cấp mô tả chi tiết về ảnh sản phẩm, giúp khách hàng hiểu rõ hơn về các tính năng và thông tin chi tiết của sản phẩm.
- Du lịch và lữ hành: Công nghệ này có thể cung cấp mô tả chi tiết về các địa danh và điểm tham quan trong hướng dẫn và ứng dụng du lịch.
- Giáo dục: Tạo chú thích ảnh có thể gắn nhãn và mô tả các hình ảnh, sơ đồ giáo dục, hỗ trợ hoạt động giảng dạy và học tập.
- Bất động sản: Công nghệ này có thể cung cấp mô tả chi tiết về ảnh bất động sản, làm nổi bật các đặc điểm và tiện ích đối với người mua tiềm năng.
Sử dụng visual grounding khi nấu ăn#
Florence-2 cũng có thể được sử dụng để làm phong phú trải nghiệm nấu nướng. Chẳng hạn, một cookbook trực tuyến có thể sử dụng Florence-2 để thực hiện visual grounding và gắn nhãn các phần của một ảnh công thức phức tạp. Visual grounding hữu ích trong trường hợp này vì liên kết các phần cụ thể của ảnh với văn bản mô tả tương ứng. Mỗi nguyên liệu và bước thực hiện có thể được gắn nhãn và giải thích chính xác, giúp người nấu ăn tại nhà dễ làm theo công thức và hiểu vai trò của từng thành phần trong món ăn.

Hình 5. Ví dụ về visual grounding sử dụng Florence-2.
OCR dựa trên vùng cho tài liệu tài chính#
OCR với xử lý dựa trên vùng, tập trung trích xuất văn bản từ các khu vực cụ thể trong tài liệu, có thể hữu ích trong những lĩnh vực như kế toán. Các khu vực được chỉ định trong tài liệu tài chính có thể được phân tích để tự động trích xuất thông tin quan trọng như chi tiết giao dịch, số tài khoản và ngày đến hạn. Bằng cách giảm nhu cầu nhập dữ liệu thủ công, công nghệ này hạn chế lỗi và tăng tốc thời gian xử lý. Các tổ chức tài chính có thể sử dụng công nghệ này để tối ưu hóa những tác vụ như xử lý hóa đơn, đối soát biên lai và thanh toán séc, từ đó đẩy nhanh giao dịch và nâng cao dịch vụ khách hàng.

Hình 6. Ví dụ về trích xuất OCR theo vùng sử dụng Florence-2.
Phân đoạn dựa trên vùng trong các ứng dụng công nghiệp#
Phân đoạn dựa trên vùng, bao gồm việc chia ảnh thành các phần có ý nghĩa để phân tích tập trung và kiểm tra chi tiết, có thể thúc đẩy các ứng dụng công nghiệp nhằm cải thiện độ chính xác và hiệu quả trong nhiều quy trình. Bằng cách tập trung vào các khu vực cụ thể trong ảnh, công nghệ này cho phép kiểm tra và phân tích chi tiết các linh kiện và sản phẩm. Trong kiểm soát chất lượng, công nghệ có thể xác định các lỗi hoặc điểm không nhất quán trong vật liệu, chẳng hạn như vết nứt hoặc tình trạng lệch, bảo đảm chỉ những sản phẩm chất lượng cao nhất mới được đưa ra thị trường.

Hình 7. Ví dụ về phân đoạn dựa trên vùng sử dụng Florence-2.
Công nghệ này cũng cải thiện dây chuyền lắp ráp tự động bằng cách điều hướng các cánh tay robot đến những bộ phận cụ thể và tối ưu hóa vị trí cũng như quá trình lắp ráp linh kiện. Tương tự, trong quản lý hàng tồn kho, công nghệ giúp theo dõi và giám sát tình trạng cũng như vị trí của hàng hóa, mang lại hiệu quả logistics cao hơn và giảm thời gian ngừng hoạt động. Nhìn chung, phân đoạn dựa trên vùng nâng cao độ chính xác và năng suất, giúp tiết kiệm chi phí và cải thiện chất lượng sản phẩm trong môi trường công nghiệp.
Những điểm chính#
Chúng ta đang bắt đầu chứng kiến xu hướng các model AI trở nên nhẹ hơn nhưng vẫn duy trì hiệu năng cao. Florence-2 đánh dấu một bước tiến lớn đối với các model ngôn ngữ-thị giác. Model có thể xử lý nhiều tác vụ như phát hiện đối tượng, phân đoạn, tạo chú thích ảnh và grounding với hiệu năng zero-shot ấn tượng. Dù có kích thước nhỏ hơn, Florence-2 vẫn hiệu quả và đa chức năng, khiến model đặc biệt hữu ích cho các ứng dụng trong nhiều ngành khác nhau. Những model như Florence-2 đang mở ra nhiều khả năng hơn, mở rộng tiềm năng cho các đổi mới về AI.
Tìm hiểu thêm về AI bằng cách truy cập repository GitHub của chúng tôi và tham gia cộng đồng của chúng tôi. Hãy xem các trang giải pháp của chúng tôi để đọc về các ứng dụng AI trong sản xuất và nông nghiệp. 🚀









