Google’ın PaliGemma 2’si: Gelişmiş VLM modellerine ilişkin içgörüler
Google’ın yeni görsel dil modelleri olan PaliGemma 2’ye daha yakından bakarken bize katıl. Bu modeller hem görüntüleri hem de metinleri anlamaya ve analiz etmeye yardımcı olabilir.

5 Aralık 2024'te Google, en son teknoloji ürünü görsel-dil modeli (VLM) olan PaliGemma 2'yi tanıttı. PaliGemma 2; açıklama oluşturma, görsel soruları yanıtlama ve görsellerdeki nesneleri tespit etme gibi görüntüleri ve metinleri birleştiren görevleri gerçekleştirmek üzere tasarlanmıştır.
Çok dilli açıklama oluşturma ve nesne tanıma konusunda zaten güçlü bir araç olan orijinal PaliGemma'nın temelini alan PaliGemma 2, birkaç önemli iyileştirme sunuyor. Bunlar arasında daha büyük model boyutları, daha yüksek çözünürlüklü görüntü desteği ve karmaşık görsel görevlerde daha iyi performans yer alıyor. Bu yükseltmeler, onu çok çeşitli kullanım alanları için daha esnek ve etkili hale getiriyor.
Bu makalede PaliGemma 2'yi, nasıl çalıştığı, temel özellikleri ve öne çıktığı uygulamalar dahil olmak üzere daha yakından inceleyeceğiz. Hadi başlayalım!
Gemma 2'den PaliGemma 2'ye#
PaliGemma 2 iki temel teknoloji üzerine kuruludur: SigLIP görsel kodlayıcısı ve Gemma 2 dil modeli. SigLIP kodlayıcısı, görüntü veya video gibi görsel verileri işler ve bunları modelin analiz edebileceği özelliklere dönüştürür. Bu sırada Gemma 2 metinleri işler ve modelin çok dilli dili anlamasını ve üretmesini sağlar. Birlikte, görsel ve metinsel bilgileri sorunsuz bir şekilde yorumlayıp ilişkilendirmek üzere tasarlanmış bir VLM oluştururlar.
PaliGemma 2'yi önemli bir ilerleme haline getiren özellikleri ölçeklenebilirliği ve çok yönlülüğüdür. Orijinal sürümün aksine PaliGemma 2 üç boyutta sunulur: 3 milyar (3B), 10 milyar (10B) ve 28 milyar (28B) parametre. Bu parametreler, modelin verileri etkili bir şekilde öğrenmesine ve işlemesine yardımcı olan dahili ayarlar gibidir. Ayrıca farklı görüntü çözünürlüklerini (ör. hızlı görevler için 224 x 224 piksel ve ayrıntılı analiz için 896 x 896) destekleyerek çeşitli uygulamalara uyum sağlar.

Şekil 1. PaliGemma 2'ye genel bakış.
Gemma 2'nin gelişmiş dil yeteneklerini SigLIP'in görüntü işleme özellikleriyle birleştirmek, PaliGemma 2'yi önemli ölçüde daha akıllı hale getirir. Şu tür görevleri gerçekleştirebilir:
- Görüntü veya videolara açıklama oluşturma: Model, görsellerin ayrıntılı metinsel açıklamalarını oluşturabilir ve bu da onu otomatik olarak açıklama oluşturmada kullanışlı kılar.
- Görsel soru yanıtlama: PaliGemma 2, bir sahnedeki nesneleri, kişileri veya eylemleri tanımlamak gibi görüntülere dayalı soruları yanıtlayabilir.
- Nesne tanıma: Bir görüntüdeki nesneleri tanımlar ve etiketler; örneğin bir fotoğrafta kedi, masa veya araba arasındaki farkı belirler.
PaliGemma 2, görüntüleri ve metinleri ayrı ayrı işlemekle kalmaz; bunları anlamlı şekillerde bir araya getirir. Örneğin bir sahnedeki ilişkileri anlayabilir; “Kedi masanın üzerinde oturuyor.” ifadesini kavrayabilir veya nesneleri tanımlarken ünlü bir simge yapıyı tanımak gibi bağlamlar ekleyebilir.
Google'ın PaliGemma 2 VLM modelleri nasıl çalışır?#
Sonraki bölümde, PaliGemma 2'nin görsel ve metinsel verileri nasıl işlediğini daha iyi anlamak için aşağıdaki görüntüde gösterilen grafiği kullanan bir örneği adım adım inceleyeceğiz. Diyelim ki bu grafiği yüklüyor ve modele “Bu grafik neyi temsil ediyor?” diye soruyorsun.

Şekil 2. PaliGemma 2'nin yeteneklerine bir örnek.
Süreç, PaliGemma 2'nin görüntüleri analiz eden ve temel özellikleri çıkaran SigLIP görsel kodlayıcısıyla başlar. Bir grafik için bu işlem eksenler, veri noktaları ve etiketler gibi öğelerin belirlenmesini içerir. Kodlayıcı, hem genel örüntüleri hem de ince ayrıntıları yakalamak üzere eğitilmiştir. Ayrıca görüntüye gömülü metinleri tespit edip işlemek için optik karakter tanımayı (OCR) kullanır. Bu görsel özellikler, modelin işleyebileceği sayısal temsiller olan belirteçlere dönüştürülür. Ardından bu belirteçler, metinsel verilerle sorunsuz biçimde birleştirilebilmelerini sağlayan doğrusal projeksiyon katmanı kullanılarak ayarlanır.
Aynı anda Gemma 2 dil modeli, anlamını ve amacını belirlemek için eşlik eden sorguyu işler. Sorgudaki metin belirteçlere dönüştürülür ve bunlar SigLIP'ten gelen görsel belirteçlerle birleştirilerek görsel ve metinsel verileri birbirine bağlayan birleşik bir format olan çok modlu bir temsil oluşturulur.
Bu bütünleşik temsili kullanan PaliGemma 2, daha önce işlediği bağlama dayanarak yanıtın bir bölümünü her seferinde tahmin ettiği bir yöntem olan otoregresif kod çözme yoluyla adım adım yanıt üretir.
PaliGemma 2'nin temel yetenekleri#
Nasıl çalıştığını anladığımıza göre, PaliGemma 2'yi güvenilir bir görsel-dil modeli yapan temel özellikleri inceleyelim:
- İnce ayar esnekliği: Belirli veri kümelerine ve görevlere kolayca uyum sağlar; görüntü açıklama oluşturma, uzamsal akıl yürütme ve tıbbi görüntüleme gibi uygulamalarda iyi performans gösterir.
- Çeşitli eğitim verileri: WebLI ve OpenImages gibi veri kümeleri üzerinde eğitilmiştir; güçlü nesne tanıma yetenekleri ve çok dilli çıktı kapasitesi sunar.
- OCR entegrasyonu: Görüntülerden metin çıkarmak ve bu metinleri yorumlamak için optik karakter tanımayı içerir; bu da onu belge analizi ve metin tabanlı diğer görevler için ideal hale getirir.
- Çok dilli çıktılar: Birden fazla dilde açıklamalar ve yanıtlar üretir; küresel uygulamalar için idealdir.
- Araçlarla entegrasyon: Hugging Face Transformers, PyTorch ve Keras gibi çerçevelerle uyumludur ve kolay dağıtım ile denemeyi mümkün kılar.
PaliGemma 2 ve PaliGemma karşılaştırması: Neler iyileştirildi?#
PaliGemma'nın ilk sürümünün mimarisine göz atmak, PaliGemma 2'deki geliştirmeleri görmenin iyi bir yoludur. En dikkat çekici değişikliklerden biri, orijinal Gemma dil modelinin performans ve verimlilikte önemli iyileştirmeler sağlayan Gemma 2 ile değiştirilmesidir.
9B ve 27B parametre boyutlarında sunulan Gemma 2, dağıtım maliyetlerini azaltırken sınıfının en iyi doğruluk ve hızını sunacak şekilde tasarlanmıştır. Bunu, güçlü GPU'lar gibi donanımlardan daha erişilebilir yapılandırmalara kadar çeşitli donanım kurulumlarında çıkarım verimliliği için optimize edilmiş yeniden tasarlanmış bir mimariyle başarır.

Şekil 3. PaliGemma 2'nin ilk sürümüne bakış.
Sonuç olarak PaliGemma 2 oldukça doğru bir modeldir. PaliGemma 2'nin 10B sürümü, orijinal modelin 34,3'lük skoruna kıyasla 20,3'lük daha düşük bir Bağdaşmayan Cümle (NES) skoruna ulaşır; bu da çıktılarında daha az olgusal hata olduğu anlamına gelir. Bu gelişmeler, PaliGemma 2'yi ayrıntılı açıklama oluşturmadan görsel soru yanıtlamaya kadar daha geniş bir uygulama yelpazesi için daha ölçeklenebilir, hassas ve uyarlanabilir hale getirir.
PaliGemma 2'nin uygulamaları: VLM modellerinin gerçek dünyadaki kullanım alanları#
PaliGemma 2, görsel ve dil anlayışını sorunsuz biçimde birleştirerek sektörleri yeniden şekillendirme potansiyeline sahiptir. Örneğin erişilebilirlik bağlamında nesnelerin, sahnelerin ve uzamsal ilişkilerin ayrıntılı açıklamalarını oluşturarak görme engelli kişilere önemli destek sağlayabilir. Bu yetenek, kullanıcıların çevrelerini daha iyi anlamalarına yardımcı olur ve günlük görevlerinde daha fazla bağımsızlık sunar.

Şekil 4. PaliGemma 2 dünyayı daha erişilebilir bir yer haline getirebilir.
Erişilebilirliğin yanı sıra PaliGemma 2, aşağıdakiler dahil olmak üzere çeşitli sektörlerde de etki yaratıyor:
- E-ticaret: Model, görüntülerdeki ürünleri analiz edip açıklayarak ürün kategorilendirmesini geliştirir; bu da envanter yönetimini kolaylaştırır ve kullanıcıların arama deneyimini iyileştirir.
- Sağlık: X-ışınları ve MRI gibi tıbbi görüntüleri klinik notlarla birlikte yorumlayarak sağlık profesyonellerini destekler ve daha doğru, bilgiye dayalı tanılar sunar.
- Eğitim: PaliGemma 2, görüntüler için açıklamalar oluşturarak ve bağlamsal bilgiler sağlayarak eğitimcilerin betimleyici ve erişilebilir öğrenme materyalleri hazırlamasına yardımcı olur.
- İçerik oluşturma: Model, multimedya içeriği için açıklama ve görsel betimleme oluşturma sürecini otomatikleştirerek içerik üreticilerinin zaman kazanmasını sağlar.
Kendin dene: PaliGemma 2#
PaliGemma 2'yi denemek için Hugging Face'in etkileşimli demosuyla başlayabilirsin. Bu demo, görüntü açıklama oluşturma ve görsel soru yanıtlama gibi görevlerde modelin yeteneklerini keşfetmeni sağlar. Bir görüntü yükleyip modele görüntü hakkında sorular sorabilir veya sahnenin açıklamasını isteyebilirsin.

Şekil 5. PaliGemma 2 demosu (Kaynak: Hugging Face).
Daha derinlemesine incelemek istersen, uygulamalı olarak başlamak için yapabileceklerin şunlar:
- Önceden eğitilmiş modeller: Önceden eğitilmiş modellere ve kodlara Hugging Face ve Kaggle gibi platformlardan erişebilirsin. Bu kaynaklar, modelle çalışmaya başlamak için ihtiyacın olan her şeyi sağlar.
- Not defterleri: PaliGemma 2'yi tanıman için kapsamlı belgeler ve örnek not defterleri bulunur. Çıkarım örnekleriyle başlayabilir ve belirli görevler için modeli kendi veri kümen üzerinde ince ayarlamayı deneyebilirsin.
- Entegrasyonlar: PaliGemma 2, Hugging Face Transformers, Keras, PyTorch, JAX ve Gemma.cpp gibi yaygın olarak kullanılan çerçevelerle uyumludur ve mevcut iş akışlarına zahmetsizce entegre etmene olanak tanır.
Google'ın PaliGemma 2'sinin artıları ve eksileri#
PaliGemma 2'yi kullanmaya nasıl başlayacağını anladığına göre, bu modelleri kullanırken göz önünde bulundurman gereken temel güçlü ve zayıf yönlerine daha yakından bakalım.
PaliGemma 2'yi bir görsel-dil modeli olarak öne çıkaran özellikler şunlardır:
- Verimlilik kazanımları: Gemma 2'nin optimize edilmiş mimarisinden yararlanan PaliGemma 2, dağıtım maliyetlerini en aza indirirken yüksek performans sunar.
- Geliştirilmiş güvenlik özellikleri: PaliGemma 2, önyargıları azaltmak için eğitim öncesi verilerin güçlü biçimde filtrelenmesi ve güvenlik kıyaslamalarına karşı titiz değerlendirme gibi, eğitim sürecinde önemli güvenlik iyileştirmeleri içerir.
- Daha küçük yapılandırmalar için düşük gecikme süresi: 3B model daha hızlı çıkarım süreleri sunar ve bu da onu hızın kritik olduğu e-ticaret ürün önerileri veya canlı destek sistemleri gibi kullanım alanları için uygun kılar.
Buna karşılık, PaliGemma 2'nin sınırlamalarla karşılaşabileceği bazı alanlar şunlardır:
- Gecikme süresi: Güçlü olmalarına rağmen daha büyük modeller, gerçek zamanlı etkileşimli AI sistemleri gibi anında yanıt gerektiren görevler için dağıtıldıklarında özellikle gecikme sorunları yaşayabilir.
- Büyük veri kümelerine bağımlılık: PaliGemma 2'nin performansı, eğitim veri kümelerinin kalitesi ve çeşitliliğiyle yakından ilişkilidir; bu durum, yeterince temsil edilmeyen alanlarda veya eğitim verilerine dahil edilmeyen dillerdeki etkinliğini sınırlayabilir.
- Yüksek kaynak gereksinimleri: Optimizasyonlara rağmen 10B ve 28B parametreli sürümler önemli miktarda hesaplama gücü gerektirir ve bu da sınırlı kaynaklara sahip küçük kuruluşlar için erişilebilirliklerini azaltır.
Önemli çıkarımlar#
PaliGemma 2, görsel-dil modellemesinde ölçeklenebilirlik, ince ayar esnekliği ve doğruluk alanlarında iyileştirmeler sunan etkileyici bir ilerlemedir. Erişilebilirlik çözümleri ve e-ticaretten sağlık tanılamaları ve eğitime kadar çeşitli uygulamalar için değerli bir araç olabilir.
Hesaplama gereksinimleri ve yüksek kaliteli verilere bağımlılık gibi sınırlamaları olsa da güçlü yönleri, onu görsel ve metinsel verileri birleştiren karmaşık görevlerin üstesinden gelmek için pratik bir seçenek haline getirir. PaliGemma 2, araştırmacılar ve geliştiriciler için çok modlu uygulamalarda AI potansiyelini keşfetmek ve geliştirmek üzere sağlam bir temel sağlayabilir.
GitHub depomuzu ve topluluğumuzu inceleyerek AI sohbetinin bir parçası ol. AI'ın tarım ve sağlık alanlarında nasıl ilerleme kaydettiğini oku! 🚀









