Google'ın PaliGemma 2 modeli: Gelişmiş VLM modellerine dair içgörüler
Google'ın yeni görü dil modelleri PaliGemma 2'ye yakından bakarken bize katıl. Bu modeller hem görüntüleri hem de metinleri anlama ve analiz etmeye yardımcı olabilir.

5 Aralık 2024'te Google, en son gelişmiş vision-language model (VLM) sürümü olan PaliGemma 2'yi tanıttı. PaliGemma 2, görsellerde nesne tespiti yapma, görsel soruları yanıtlama ve açıklama metinleri oluşturma gibi görüntüleri ve metinleri birleştiren görevleri ele almak için tasarlanmıştır.
Çok dilli altyazı oluşturma ve nesne tanıma için zaten güçlü bir araç olan orijinal PaliGemma'yı temel alan PaliGemma 2, birkaç temel iyileştirme getiriyor. Bunlar arasında daha büyük model boyutları, daha yüksek çözünürlüklü görseller için destek ve karmaşık görsel görevlerde better performance yer alıyor. Bu yükseltmeler, modeli çok çeşitli kullanımlar için daha da esnek ve etkili hale getiriyor.
Bu makalede PaliGemma 2'ye, nasıl çalıştığına, temel özelliklerine ve öne çıktığı uygulamalara daha yakından bakacağız. Haydi başlayalım!
Gemma 2'den PaliGemma 2'ye#
PaliGemma 2 iki temel teknoloji üzerine kurulmuştur: SigLIP görüntü kodlayıcı ve Gemma 2 dil modeli. SigLIP kodlayıcı, resimler veya videolar gibi visual data işler ve bunu modelin analiz edebileceği özelliklere ayırır. Bu sırada Gemma 2 metni işleyerek modelin çok dilli dili anlamasını ve üretmesini sağlar. Birlikte, görsel ve metin bilgilerini sorunsuz bir şekilde yorumlamak ve bağdaştırmak için tasarlanmış bir VLM oluştururlar.
PaliGemma 2'yi ileriye doğru atılmış büyük bir adım yapan şey, ölçeklenebilirliği ve çok yönlülüğüdür. Orijinal sürümden farklı olarak PaliGemma 2, 3 milyar (3B), 10 milyar (10B) ve 28 milyar (28B) parametre olmak üzere üç boyutta gelir. Bu parametreler, verileri etkili bir şekilde öğrenmesine ve işlemesine yardımcı olan modelin iç ayarları gibidir. Ayrıca farklı görüntü çözünürlüklerini (örneğin, hızlı görevler için 224 x 224 piksel ve ayrıntılı analiz için 896 x 896) destekleyerek çeşitli uygulamalar için uyarlanabilir hale gelir.

Fig 1. PaliGemma 2'ye Genel Bakış.
Gemma 2'nin gelişmiş dil yeteneklerini SigLIP'in görüntü işleme becerisiyle entegre etmek, PaliGemma 2'yi önemli ölçüde daha zeki kılar. Şu gibi görevleri yerine getirebilir:
- Captioning images or videos: Model, görsellerin ayrıntılı metinsel açıklamalarını üretebilir ve bu da otomatik olarak altyazı oluşturmak için faydalı olmasını sağlar.
- Görsel soru cevaplama: PaliGemma 2; bir sahnedeki nesneleri, kişileri veya eylemleri tanımlamak gibi görüntülere dayalı soruları yanıtlayabilir.
- Object recognition: Bir fotoğraftaki kedi, masa veya araba arasındaki ayrımı yapmak gibi bir görüntü içindeki nesneleri tanımlar ve etiketler.
PaliGemma 2, görüntüleri ve metni ayrı ayrı işlemenin ötesine geçer; onları anlamlı yollarla bir araya getirir. Örneğin, bir sahnedeki ilişkileri anlayabilir; "Kedi masanın üzerinde oturuyor" gibi çıkarımlar yapabilir veya ünlü bir simgeyi tanımak gibi bağlam ekleyerek nesneleri tanımlayabilir.
Google PaliGemma 2 VLM modelleri nasıl çalışır?#
Sırada, PaliGemma 2'nin görsel ve metinsel verileri nasıl işlediğini daha iyi anlamak için aşağıdaki görselde gösterilen grafiği kullanan bir örnekten geçeceğiz. Diyelim ki bu grafiği yükledin ve modele "Bu grafik neyi temsil ediyor?" diye sordun.

Fig 2. PaliGemma 2 yeteneklerine bir örnek.
İşlem, görüntüleri analiz etmek ve extract key features için PaliGemma 2'nin SigLIP görüntü kodlayıcısıyla başlar. Bir grafik için bu, eksenler, veri noktaları ve etiketler gibi öğelerin tanımlanmasını içerir. Kodlayıcı, hem geniş kalıpları hem de ince detayları yakalamak için eğitilmiştir. Ayrıca görüntüye gömülü herhangi bir metni tespit etmek ve işlemek için optical character recognition (OCR) kullanır. Bu görsel özellikler, modelin işleyebileceği sayısal temsiller olan token'lara dönüştürülür. Bu token'lar daha sonra, metinsel verilerle sorunsuz bir şekilde birleştirilebilmelerini sağlayan bir teknik olan doğrusal bir projeksiyon katmanı kullanılarak ayarlanır.
Aynı zamanda Gemma 2 dil modeli, anlamını ve amacını belirlemek için beraberindeki sorguyu işler. Sorgudaki metin token'lara dönüştürülür ve bunlar, görsel ve metinsel verileri birbirine bağlayan birleşik bir biçim olan bir multimodal representation oluşturmak için SigLIP'in görsel token'larıyla birleştirilir.
Bu entegre temsili kullanan PaliGemma 2, modelin cevabın bir kısmını zaten işlediği bağlama göre tahmin ettiği bir yöntem olan autoregressive çözme yoluyla adım adım bir yanıt üretir.
PaliGemma 2'nin temel yetenekleri#
Nasıl çalıştığını anladığımıza göre, PaliGemma 2'yi güvenilir bir görüntü-dil modeli yapan temel özellikleri keşfedelim:
- Fine-tuning flexibility: Belirli veri setlerine ve görevlere kolayca uyum sağlar; görüntü açıklaması, uzamsal akıl yürütme ve medical imaging gibi uygulamalarda iyi performans gösterir.
- Diverse training data: WebLI ve OpenImages gibi veri setleri üzerinde eğitilmiştir, bu da ona güçlü nesne tanıma yetenekleri ve çok dilli çıktı yetenekleri kazandırır.
- OCR entegrasyonu: Görüntülerden metinleri ayıklamak ve yorumlamak için optik karakter tanıma özelliğini içerir, bu da onu belge analizi ve diğer metin tabanlı görevler için ideal kılar.
- Çok dilli çıktılar: Küresel uygulamalar için ideal olan, birden fazla dilde altyazı ve yanıt üretir.
- Integration with tools: Hugging Face Transformers, PyTorch ve Keras gibi framework'lerle uyumludur, bu da kolay dağıtım ve deneme olanağı sağlar.
PaliGemma 2 ve PaliGemma karşılaştırması: Neler iyileştirildi?#
PaliGemma'nın ilk sürümünün mimarisine bakmak, PaliGemma 2'deki geliştirmeleri görmenin iyi bir yoludur. En dikkat çekici değişikliklerden biri, orijinal Gemma dil modelinin hem performans hem de verimlilik açısından önemli iyileştirmeler getiren Gemma 2 ile değiştirilmesidir.
9B ve 27B parametre boyutlarında sunulan Gemma 2, deployment costs azaltırken sınıfının en iyisi doğruluk ve hız sunmak üzere tasarlanmıştır. Bunu, güçlü GPUs daha erişilebilir konfigürasyonlara kadar çeşitli donanım kurulumlarında çıkarım verimliliği için optimize edilmiş yeniden tasarlanmış bir mimari aracılığıyla başarır.

Fig 3. PaliGemma 2'nin İlk Sürümüne Geri Bakış.
Sonuç olarak PaliGemma 2 oldukça accurate bir modeldir. PaliGemma 2'nin 10B sürümü, orijinal modelin 34.3'lük puanına kıyasla daha düşük bir Non-Entailment Sentence (NES) skoru olan 20.3 elde ediyor; bu da çıktılarında daha az olgusal hata olduğu anlamına geliyor. Bu ilerlemeler PaliGemma 2'yi daha ölçeklenebilir, hassas ve ayrıntılı altyazılamadan görsel soru yanıtlamaya kadar çok daha geniş bir uygulama yelpazesine uyarlanabilir hale getiriyor.
PaliGemma 2 uygulamaları: VLM modelleri için gerçek dünya kullanımları#
PaliGemma 2, görsel ve dil anlayışını sorunsuz bir şekilde birleştirerek sektörleri yeniden tanımlama potansiyeline sahiptir. Örneğin, accessibility ile ilgili olarak, nesnelerin, sahnelerin ve uzamsal ilişkilerin ayrıntılı açıklamalarını üretebilir ve görme engelli bireylere çok önemli bir destek sağlayabilir. Bu yetenek, kullanıcıların çevrelerini daha iyi anlamalarına yardımcı olur ve günlük görevler söz konusu olduğunda daha fazla bağımsızlık sunar.

Fig 4. PaliGemma 2 dünyayı daha erişilebilir bir yer haline getirebilir.
Erişilebilirliğin yanı sıra PaliGemma 2, aşağıdakiler dahil olmak üzere çeşitli endüstrilerde etki yaratmaktadır:
- E-commerce: Model, görüntülerdeki öğeleri analiz ederek ve açıklayarak ürün kategorizasyonunu geliştirir; bu da envanter yönetimini basitleştirir ve kullanıcılar için arama deneyimini iyileştirir.
- Healthcare: Daha doğru ve bilinçli teşhisler sağlamak için röntgen ve MR gibi tıbbi görüntülemeleri klinik notlarla birlikte yorumlayarak sağlık profesyonellerini destekler.
- Education: PaliGemma 2, açıklamalar üreterek ve görüntüler için bağlamsal bilgi sağlayarak eğitimcilerin açıklayıcı ve erişilebilir öğrenme materyalleri oluşturmasına yardımcı olur.
- Content Creation: Model, multimedya içeriği için altyazı ve görsel açıklama oluşturma sürecini otomatikleştirerek içerik oluşturucuların zamandan tasarruf etmesini sağlar.
Kendin dene: PaliGemma 2#
PaliGemma 2'yi denemek için Hugging Face'in etkileşimli demosundan başlayabilirsin. Bu demo, görüntü altyazılama ve görsel soru cevaplama gibi görevlerdeki yeteneklerini keşfetmeni sağlar. Sadece bir görsel yükle ve modele onunla ilgili sorular sor veya sahnenin açıklanmasını iste.

Şekil 5. PaliGemma 2 Demosu (Kaynak: Hugging Face).
Daha derinlemesine dalmak istiyorsan, işte uygulamalı olarak nasıl başlayabileceğin:
- Pre-trained models: Hugging Face ve Kaggle gibi platformlardan önceden eğitilmiş modellere ve koda erişebilirsin. Bu kaynaklar, modelle çalışmaya başlamak için ihtiyacın olan her şeyi sağlar.
- Notebooks: PaliGemma 2'yi yakından tanıman için kapsamlı belgeler ve örnek notebook'lar bulunmaktadır. Çıkarım örnekleriyle başlayabilir ve belirli görevler için modeli kendi veri setin üzerinde ince ayar (fine-tuning) yaparak deneyebilirsin.
- Entegrasyonlar: PaliGemma 2; Hugging Face Transformers, Keras, PyTorch, JAX ve Gemma.cpp gibi yaygın olarak kullanılan çerçevelerle uyumludur ve onu mevcut iş akışlarına zahmetsizce entegre etmeni sağlar.
Google PaliGemma 2'nin artıları ve eksileri#
PaliGemma 2 ile nasıl başlayacağını anladığına göre, bu modelleri kullanırken aklında bulundurman gereken temel güçlü ve zayıf yönlerine daha yakından bakalım.
İşte PaliGemma 2'yi bir görüntü-dil modeli olarak öne çıkaran özellikler:
- Verimlilik kazanımları: Gemma 2'nin optimize edilmiş mimarisinden yararlanan PaliGemma 2, dağıtım maliyetlerini en aza indirirken yüksek performans sunar.
- Enhanced safety features: PaliGemma 2, önyargıları azaltmak için ön eğitim verilerinin sağlam bir şekilde filtrelenmesi ve güvenlik benchmark'larına karşı titiz bir değerlendirme gibi eğitim sürecinde önemli güvenlik iyileştirmeleri içerir.
- Daha küçük konfigürasyonlar için düşük gecikme: 3B model, e-commerce product recommendations veya canlı destek sistemleri gibi hızın kritik olduğu kullanım senaryoları için uygun hale getiren daha hızlı çıkarım süreleri sunar.
Bu sırada, PaliGemma 2'nin sınırlamalarla karşılaşabileceği bazı alanlar şunlardır:
- Gecikme: Güçlü olsalar da, daha büyük modeller, özellikle gerçek zamanlı etkileşimli yapay zeka sistemleri gibi anında yanıt gerektiren görevler için dağıtıldığında gecikme sorunlarıyla karşılaşabilir.
- Büyük veri kümelerine bağımlılık: PaliGemma 2'nin performansı, eğitim veri kümelerinin kalitesi ve çeşitliliği ile yakından bağlantılıdır; bu da onun eksik temsil edilen alanlardaki veya eğitim verilerine dahil edilmeyen dillerdeki etkinliğini sınırlayabilir.
- Yüksek kaynak gereksinimleri: Optimizasyonlara rağmen, 10B ve 28B parametre sürümleri significant computational power gerektirir ve bu da onları sınırlı kaynaklara sahip küçük kuruluşlar için daha az erişilebilir kılar.
Öne çıkanlar#
PaliGemma 2, geliştirilmiş ölçeklenebilirlik, ince ayar esnekliği ve doğruluk sunan, görüntü-dil modellemede büyüleyici bir ilerlemedir. Erişilebilirlik çözümleri ve e-ticaretten sağlık teşhisleri ve eğitime kadar uzanan uygulamalar için değerli bir araç görevi görebilir.
Hesaplama gereksinimleri ve yüksek kaliteli verilere bağımlılık gibi sınırlamaları olsa da, güçlü yönleri onu görsel ve metinsel verileri entegre eden karmaşık görevleri ele almak için pratik bir seçim haline getirir. PaliGemma 2, araştırmacıların ve geliştiricilerin yapay zekanın çok modlu uygulamalardaki potansiyelini keşfetmeleri ve genişletmeleri için sağlam bir temel sağlayabilir.
GitHub repository ve community göz atarak AI sohbetinin bir parçası ol. AI'ın agriculture ve healthcare alanında nasıl büyük ilerlemeler kaydettiğini oku! 🚀






