PaliGemma 2 của Google: Những thông tin chuyên sâu về các model VLM tiên tiến
Hãy cùng tìm hiểu kỹ hơn về các vision language model mới của Google: PaliGemma 2. Các model này có thể hỗ trợ hiểu và phân tích cả hình ảnh lẫn văn bản.

Vào ngày 5 tháng 12 năm 2024, Google đã giới thiệu PaliGemma 2, phiên bản mới nhất của mô hình thị giác-ngôn ngữ (VLM) tiên tiến. PaliGemma 2 được thiết kế để xử lý các tác vụ kết hợp hình ảnh và văn bản, chẳng hạn như tạo chú thích, trả lời câu hỏi trực quan và phát hiện đối tượng trong hình ảnh.
Được phát triển dựa trên PaliGemma ban đầu, vốn đã là một công cụ mạnh cho việc tạo chú thích đa ngôn ngữ và nhận dạng đối tượng, PaliGemma 2 mang đến một số cải tiến quan trọng. Những cải tiến này bao gồm các kích thước model lớn hơn, hỗ trợ hình ảnh có độ phân giải cao hơn và hiệu năng tốt hơn trên các tác vụ trực quan phức tạp. Các nâng cấp này giúp model linh hoạt và hiệu quả hơn cho nhiều mục đích sử dụng.
Trong bài viết này, chúng ta sẽ tìm hiểu sâu hơn về PaliGemma 2, bao gồm cách thức hoạt động, các tính năng chính và những ứng dụng mà model này phát huy hiệu quả. Hãy bắt đầu!
Từ Gemma 2 đến PaliGemma 2#
PaliGemma 2 được xây dựng trên hai công nghệ chính: bộ mã hóa hình ảnh SigLIP và model ngôn ngữ Gemma 2. Bộ mã hóa SigLIP xử lý dữ liệu trực quan, chẳng hạn như hình ảnh hoặc video, rồi phân tách dữ liệu thành các đặc trưng mà model có thể phân tích. Trong khi đó, Gemma 2 xử lý văn bản, cho phép model hiểu và tạo ngôn ngữ đa ngôn ngữ. Kết hợp với nhau, chúng tạo thành một VLM được thiết kế để diễn giải và kết nối thông tin hình ảnh với thông tin văn bản một cách liền mạch.
Điểm khiến PaliGemma 2 trở thành một bước tiến lớn là khả năng mở rộng và tính linh hoạt. Không giống phiên bản ban đầu, PaliGemma 2 có ba kích thước: 3 tỷ (3B), 10 tỷ (10B) và 28 tỷ (28B) tham số. Các tham số này giống như những thiết lập nội bộ của model, giúp model học và xử lý dữ liệu hiệu quả. Model cũng hỗ trợ nhiều độ phân giải hình ảnh khác nhau (ví dụ: 224 x 224 pixel cho các tác vụ nhanh và 896 x 896 cho phân tích chi tiết), nhờ đó có thể thích ứng với nhiều ứng dụng.

Hình 1. Tổng quan về PaliGemma 2.
Việc tích hợp các khả năng ngôn ngữ tiên tiến của Gemma 2 với khả năng xử lý hình ảnh của SigLIP giúp PaliGemma 2 trở nên thông minh hơn đáng kể. Model có thể xử lý các tác vụ như:
- Tạo chú thích cho hình ảnh hoặc video: Model có thể tạo các mô tả bằng văn bản chi tiết về nội dung trực quan, hữu ích cho việc tự động tạo chú thích.
- Trả lời câu hỏi trực quan: PaliGemma 2 có thể trả lời câu hỏi dựa trên hình ảnh, chẳng hạn như xác định các đối tượng, người hoặc hành động trong một cảnh.
- Nhận dạng đối tượng: Model xác định và gắn nhãn các đối tượng trong hình ảnh, chẳng hạn như phân biệt mèo, bàn hoặc ô tô trong một bức ảnh.
PaliGemma 2 không chỉ xử lý riêng lẻ hình ảnh và văn bản mà còn kết hợp chúng theo những cách có ý nghĩa. Ví dụ, model có thể hiểu các mối quan hệ trong một cảnh, chẳng hạn nhận biết rằng “Con mèo đang ngồi trên bàn”, hoặc xác định các đối tượng đồng thời bổ sung ngữ cảnh, chẳng hạn nhận ra một địa danh nổi tiếng.
Cách hoạt động của các model VLM PaliGemma 2 của Google#
Tiếp theo, chúng ta sẽ xem qua một ví dụ sử dụng biểu đồ trong hình bên dưới để hiểu rõ hơn cách PaliGemma 2 xử lý dữ liệu trực quan và văn bản. Giả sử bạn tải biểu đồ này lên và hỏi model: “Biểu đồ này biểu thị điều gì?”

Hình 2. Ví dụ về các khả năng của PaliGemma 2.
Quy trình bắt đầu với bộ mã hóa hình ảnh SigLIP của PaliGemma 2 để phân tích hình ảnh và trích xuất các đặc trưng chính. Đối với một biểu đồ, việc này bao gồm xác định các thành phần như trục, điểm dữ liệu và nhãn. Bộ mã hóa được huấn luyện để nắm bắt cả các mẫu tổng quát lẫn chi tiết nhỏ. Bộ mã hóa cũng sử dụng nhận dạng ký tự quang học (OCR) để phát hiện và xử lý mọi văn bản được nhúng trong hình ảnh. Các đặc trưng trực quan này được chuyển đổi thành các token, là những biểu diễn dạng số mà model có thể xử lý. Sau đó, các token được điều chỉnh bằng một lớp chiếu tuyến tính, một kỹ thuật đảm bảo chúng có thể được kết hợp liền mạch với dữ liệu văn bản.
Đồng thời, model ngôn ngữ Gemma 2 xử lý câu truy vấn đi kèm để xác định ý nghĩa và mục đích của câu hỏi. Văn bản trong câu truy vấn được chuyển đổi thành các token, sau đó kết hợp với các token trực quan từ SigLIP để tạo ra một biểu diễn đa phương thức, tức một định dạng thống nhất liên kết dữ liệu trực quan và dữ liệu văn bản.
Sử dụng biểu diễn tích hợp này, PaliGemma 2 tạo phản hồi từng bước thông qua giải mã tự hồi quy, một phương pháp trong đó model dự đoán từng phần của câu trả lời tại một thời điểm dựa trên ngữ cảnh đã xử lý trước đó.
Các khả năng chính của PaliGemma 2#
Sau khi đã hiểu cách thức hoạt động, hãy cùng khám phá các tính năng chính giúp PaliGemma 2 trở thành một model thị giác-ngôn ngữ đáng tin cậy:
- Tính linh hoạt khi fine-tune: Dễ dàng thích ứng với các dataset và tác vụ cụ thể, hoạt động hiệu quả trong những ứng dụng như tạo chú thích hình ảnh, suy luận không gian và chẩn đoán hình ảnh y khoa.
- Dữ liệu huấn luyện đa dạng: Được huấn luyện trên các dataset như WebLI và OpenImages, mang lại khả năng nhận dạng đối tượng mạnh mẽ và khả năng tạo đầu ra đa ngôn ngữ.
- Tích hợp OCR: Bao gồm khả năng nhận dạng ký tự quang học để trích xuất và diễn giải văn bản từ hình ảnh, rất phù hợp cho việc phân tích tài liệu và các tác vụ dựa trên văn bản khác.
- Đầu ra đa ngôn ngữ: Tạo chú thích và phản hồi bằng nhiều ngôn ngữ, lý tưởng cho các ứng dụng toàn cầu.
- Tích hợp với các công cụ: Tương thích với các framework như Hugging Face Transformers, PyTorch và Keras, giúp dễ dàng triển khai và thử nghiệm.
So sánh PaliGemma 2 và PaliGemma: Những cải tiến là gì?#
Xem xét kiến trúc của phiên bản PaliGemma đầu tiên là một cách hữu ích để thấy được những cải tiến của PaliGemma 2. Một trong những thay đổi đáng chú ý nhất là thay thế model ngôn ngữ Gemma ban đầu bằng Gemma 2, mang lại những cải tiến đáng kể cả về hiệu năng lẫn hiệu quả.
Gemma 2, có các kích thước 9B và 27B tham số, được thiết kế để mang lại độ chính xác và tốc độ hàng đầu trong phân khúc đồng thời giảm chi phí triển khai. Model đạt được điều này nhờ kiến trúc được thiết kế lại và tối ưu cho hiệu quả suy luận trên nhiều cấu hình phần cứng, từ GPU mạnh mẽ đến những cấu hình dễ tiếp cận hơn.

Hình 3. Nhìn lại phiên bản PaliGemma 2 đầu tiên.
Kết quả là PaliGemma 2 trở thành một model có độ chính xác cao. Phiên bản 10B của PaliGemma 2 đạt điểm Non-Entailment Sentence (NES) thấp hơn là 20.3, so với 34.3 của model ban đầu, nghĩa là có ít lỗi thực tế hơn trong đầu ra. Những tiến bộ này giúp PaliGemma 2 có khả năng mở rộng, độ chính xác và tính thích ứng cao hơn cho nhiều ứng dụng, từ tạo chú thích chi tiết đến trả lời câu hỏi trực quan.
Các ứng dụng của PaliGemma 2: Những cách sử dụng thực tế của các model VLM#
PaliGemma 2 có tiềm năng định hình lại các ngành bằng cách kết hợp liền mạch khả năng hiểu hình ảnh và ngôn ngữ. Ví dụ, trong lĩnh vực khả năng tiếp cận, model có thể tạo các mô tả chi tiết về đối tượng, cảnh và mối quan hệ không gian, mang đến sự hỗ trợ thiết yếu cho người khiếm thị. Khả năng này giúp người dùng hiểu rõ hơn về môi trường xung quanh, từ đó có thêm tính độc lập khi thực hiện các tác vụ hằng ngày.

Hình 4. PaliGemma 2 có thể giúp thế giới trở nên dễ tiếp cận hơn.
Bên cạnh khả năng tiếp cận, PaliGemma 2 đang tạo ra tác động trong nhiều ngành khác nhau, bao gồm:
- Thương mại điện tử: Model cải thiện việc phân loại sản phẩm bằng cách phân tích và mô tả các mặt hàng trong hình ảnh, qua đó đơn giản hóa việc quản lý hàng tồn kho và nâng cao trải nghiệm tìm kiếm cho người dùng.
- Chăm sóc sức khỏe: Model hỗ trợ các chuyên gia y tế bằng cách diễn giải hình ảnh y khoa, chẳng hạn như ảnh X-quang và MRI, cùng với ghi chú lâm sàng để đưa ra chẩn đoán chính xác và có cơ sở hơn.
- Giáo dục: PaliGemma 2 giúp các nhà giáo dục tạo tài liệu học tập giàu mô tả và dễ tiếp cận bằng cách tạo chú thích và cung cấp thông tin theo ngữ cảnh cho hình ảnh.
- Tạo nội dung: Model tự động hóa quy trình tạo chú thích và mô tả trực quan cho nội dung đa phương tiện, giúp người sáng tạo tiết kiệm thời gian.
Tự mình trải nghiệm: PaliGemma 2#
Để trải nghiệm PaliGemma 2, bạn có thể bắt đầu với bản demo tương tác của Hugging Face. Bản demo cho phép bạn khám phá các khả năng của model trong những tác vụ như tạo chú thích hình ảnh và trả lời câu hỏi trực quan. Chỉ cần tải hình ảnh lên, đặt câu hỏi về hình ảnh cho model hoặc yêu cầu model mô tả cảnh.

Hình 5. Bản demo của PaliGemma 2 (Nguồn: Hugging Face).
Nếu muốn tìm hiểu sâu hơn, dưới đây là cách bạn có thể bắt tay vào thực hành:
- Các model được huấn luyện trước: Bạn có thể truy cập các model được huấn luyện trước và mã nguồn từ những nền tảng như Hugging Face và Kaggle. Các tài nguyên này cung cấp mọi thứ cần thiết để bắt đầu làm việc với model.
- Notebook: Có tài liệu toàn diện và các notebook mẫu giúp bạn làm quen với PaliGemma 2. Bạn có thể bắt đầu bằng các ví dụ suy luận và thử nghiệm fine-tune model trên dataset của riêng mình cho các tác vụ cụ thể.
- Tích hợp: PaliGemma 2 tương thích với các framework được sử dụng rộng rãi như Hugging Face Transformers, Keras, PyTorch, JAX và Gemma.cpp, cho phép bạn dễ dàng tích hợp model vào các workflow hiện có.
Ưu và nhược điểm của PaliGemma 2 của Google#
Sau khi đã hiểu cách bắt đầu với PaliGemma 2, hãy cùng xem xét kỹ hơn những điểm mạnh và hạn chế chính cần lưu ý khi sử dụng các model này.
Dưới đây là những điểm khiến PaliGemma 2 nổi bật như một model thị giác-ngôn ngữ:
- Cải thiện hiệu quả: Tận dụng kiến trúc được tối ưu hóa của Gemma 2, PaliGemma 2 mang lại hiệu năng cao đồng thời giảm thiểu chi phí triển khai.
- Tính năng an toàn nâng cao: PaliGemma 2 bao gồm những cải tiến đáng kể về tính an toàn trong quy trình huấn luyện, chẳng hạn như lọc mạnh mẽ dữ liệu tiền huấn luyện để giảm thiên kiến và đánh giá nghiêm ngặt dựa trên các benchmark an toàn.
- Độ trễ thấp với các cấu hình nhỏ hơn: Model 3B mang lại thời gian suy luận nhanh hơn, phù hợp với những trường hợp sử dụng đòi hỏi tốc độ, chẳng hạn như gợi ý sản phẩm thương mại điện tử hoặc các hệ thống hỗ trợ trực tiếp.
Trong khi đó, dưới đây là một số khía cạnh mà PaliGemma 2 có thể gặp hạn chế:
- Độ trễ: Mặc dù mạnh mẽ, các model lớn hơn có thể gặp vấn đề về độ trễ, đặc biệt khi được triển khai cho những tác vụ yêu cầu phản hồi tức thời, chẳng hạn như các hệ thống AI tương tác theo thời gian thực.
- Phụ thuộc vào dataset lớn: Hiệu năng của PaliGemma 2 gắn chặt với chất lượng và tính đa dạng của các dataset huấn luyện, điều này có thể hạn chế hiệu quả của model trong những lĩnh vực ít được đại diện hoặc các ngôn ngữ không có trong dữ liệu huấn luyện.
- Yêu cầu tài nguyên cao: Mặc dù đã được tối ưu hóa, các phiên bản 10B và 28B tham số đòi hỏi năng lực tính toán đáng kể, khiến chúng khó tiếp cận hơn đối với các tổ chức nhỏ có nguồn lực hạn chế.
Những điểm chính#
PaliGemma 2 là một bước tiến đáng chú ý trong lĩnh vực model thị giác-ngôn ngữ, mang lại khả năng mở rộng, tính linh hoạt khi fine-tune và độ chính xác được cải thiện. Model có thể trở thành công cụ hữu ích cho các ứng dụng từ giải pháp hỗ trợ khả năng tiếp cận và thương mại điện tử đến chẩn đoán y tế và giáo dục.
Mặc dù vẫn có những hạn chế như yêu cầu về năng lực tính toán và sự phụ thuộc vào dữ liệu chất lượng cao, các điểm mạnh của model khiến PaliGemma 2 trở thành lựa chọn thực tế để xử lý những tác vụ phức tạp kết hợp dữ liệu trực quan và văn bản. PaliGemma 2 có thể cung cấp nền tảng vững chắc để các nhà nghiên cứu và developer khám phá, mở rộng tiềm năng của AI trong các ứng dụng đa phương thức.
Hãy tham gia cuộc thảo luận về AI bằng cách xem repository GitHub và cộng đồng của chúng tôi. Tìm hiểu cách AI đang tạo ra những bước tiến trong nông nghiệp và chăm sóc sức khỏe! 🚀









