Florence-2: Microsoft'un en yeni görsel dil modeli
Microsoft'un geliştirilmiş nesne algılama, segmentasyon ve harika verimlilikle sıfır vuruş (zero-shot) performansı sunan görsel dil modeli Florence-2 ile tanış.

Haziran 2024'te Microsoft, nesne tespiti, segmentasyon, görüntü altyazılama ve konumlandırma dahil geniş bir görev yelpazesini ele almak üzere tasarlanmış çok modlu bir görsel dil modeli (VLM) olan Florence-2'yi tanıttı. Florence-2, sıfır-atış performansında yeni bir standart belirliyor; yani daha önce özel bir eğitim almadan görevleri yerine getirebiliyor ve diğer son teknoloji görsel-dil modellerinden daha küçük bir model boyutuna sahip.
Sadece bir başka modelden fazlası olan Florence-2'nin çok yönlülüğü ve geliştirilmiş performansı, doğruluğu artırarak ve kapsamlı eğitim ihtiyacını azaltarak çeşitli sektörleri önemli ölçüde etkileme potansiyeline sahip. Bu makalede, Florence-2'nin yenilikçi özelliklerini keşfedecek, performansını diğer VLM'lerle karşılaştıracak ve potansiyel uygulamalarını tartışacağız.
Florence-2 nedir?#
Florence-2, tek bir birleşik çerçeve içinde çeşitli görevleri yerine getirebilir. Modelin etkileyici yetenekleri, kısmen FLD-5B adlı devasa eğitim veri setine borçludur. FLD-5B, 126 milyon görüntüde 5,4 milyar açıklama içerir. Bu kapsamlı veri seti, Florence-2'ye çok çeşitli görsel görevleri yüksek doğruluk ve verimlilikle yerine getirmek için gereken yetenekleri kazandırmak amacıyla özel olarak oluşturulmuştur.
İşte Florence-2'nin desteklediği görevlere daha yakından bir bakış:
- Nesne Tespiti: Görüntüler içindeki nesneleri yüksek hassasiyetle tanımlayabilir ve konumlandırabilir.
- Segmentasyon: Bu görev, daha kolay analiz ve yorumlama için bir görüntünün anlamlı bölümlere ayrılmasını içerir.
- Görüntü Alt Yazısı Oluşturma: Florence-2, görüntüler için bağlam ve ayrıntı sağlayan açıklayıcı alt yazılar oluşturabilir.
- Görsel Temellendirme: Model, bir alt yazıdaki belirli ifadeleri veya kelimeleri görüntüdeki karşılık gelen bölgelerle ilişkilendirebilir.
- Sıfır-Atış (Zero-shot) Performansı: Özel bir eğitim olmadan görevleri yerine getirebilir.

Şekil 1. Florence-2'nin Nasıl Eğitildiğini Anlamak.
Model hem metin tabanlı hem de bölge tabanlı görevleri destekler. Görüntünün belirli bölgelerini içeren görevler için modelin sözlüğüne özel konum belirteçleri eklenir. Bu belirteçler modelin, nesnelerin etrafındaki dikdörtgenler (kutu gösterimi), dört kenarlı şekiller (dörtlü kutu gösterimi) ve çok kenarlı şekiller (poligon gösterimi) gibi farklı şekilleri anlamasına yardımcı olur. Model, tahminlerini doğru cevaplarla karşılaştırıp iç parametrelerini buna göre ayarlayarak öğrenmesine yardımcı olan çapraz entropi kaybı (cross-entropy loss) adı verilen bir yöntem kullanılarak eğitilir.
FLD-5B veri setini oluşturma#
FLD-5B veri seti farklı türde etiketler içerir: metin açıklamaları, bölge ve metin çiftleri ile metin, ifade ve bölge kombinasyonları. veri toplama ve etiketleme içeren iki aşamalı bir süreçle oluşturulmuştur. Görüntüler ImageNet-22k, Object 365, Open Images, Conceptual Captions ve LAION gibi popüler veri setlerinden alınmıştır. FLD-5B veri setindeki etiketler çoğunlukla sentetiktir; yani manuel olarak etiketlenmek yerine otomatik olarak oluşturulmuştur.

Şekil 2. FLD-5B Veri Setini Oluşturmak.
Başlangıçta, nesne algılama veya segmentasyon gibi belirli görevlerde uzmanlaşmış modeller bu açıklamaları oluşturdu. Daha sonra, açıklamaların ayrıntılı ve doğru olduğundan emin olmak için bir filtreleme ve geliştirme süreci kullanıldı. Gürültü giderildikten sonra, veri seti, Florence-2'nin çıktılarının açıklamaları sürekli olarak güncellemek ve iyileştirmek için kullanıldığı yinelemeli bir iyileştirmeden geçti.
Florence-2'nin model mimarisini anlama#
Florence-2'nin model mimarisi, diziden diziye (sequence-to-sequence) öğrenme yaklaşımını izler. Bu, modelin bir girdi dizisini (metin istemi içeren bir görüntü gibi) işlediği ve bir çıktı dizisini (bir açıklama veya etiket gibi) adım adım oluşturduğu anlamına gelir. Diziden diziye çerçevesinde, her görev bir çeviri problemi olarak ele alınır: model bir girdi görüntüsü ve göreve özel bir istem alır ve ilgili çıktıyı üretir.

Şekil 3. Florence-2'nin Görsel-Dil Modeli Mimarisi.
Model mimarisinin merkezinde, bir görüntü kodlayıcı ile çok modlu bir kodlayıcı-kod çözücü (encoder-decoder) birleştiren çok modlu bir kodlayıcı-kod çözücü Transformer yer alır. DaViT (Data-efficient Vision Transformer) adlı görüntü kodlayıcı, girdi görüntülerini görsel belirteç yerleştirmelerine (visual token embeddings) dönüştürerek işler - bunlar, görüntünün hem uzamsal (şeylerin nerede olduğu) hem de anlamsal (şeylerin ne olduğu) bilgilerini yakalayan kompakt temsillerdir. Bu görsel belirteçler daha sonra metin yerleştirmeleriyle (metnin temsilleri) birleştirilerek modelin metinsel ve görsel verileri sorunsuz bir şekilde birleştirmesine olanak tanır.
Florence-2'yi diğer VLM'lerle karşılaştırma#
Florence-2, etkileyici sıfır-atış yetenekleri sayesinde diğer görsel dil modellerinden ayrılır. Çeşitli görevlere uyum sağlamak için kapsamlı ince ayara (fine-tuning) dayanan PaliGemma gibi modellerin aksine, Florence-2 kutudan çıktığı gibi iyi çalışır. Ayrıca Florence-2, genellikle çok daha fazla parametreye sahip olan ancak her zaman Florence-2'nin performansına ulaşamayan GPT-4V ve Flamingo gibi daha büyük modellerle rekabet edebilir. Örneğin Florence-2, Kosmos-2'nin parametre sayısının iki katından fazlasına sahip olmasına rağmen, Kosmos-2'den daha iyi sıfır-atış sonuçları elde eder.
Karşılaştırma testlerinde Florence-2, COCO altyazılama ve atıfta bulunulan ifadeyi anlama gibi görevlerde dikkat çekici bir performans göstermiştir. COCO veri seti üzerindeki nesne tespiti ve segmentasyon görevlerinde PolyFormer ve UNINEXT gibi modelleri geride bırakmıştır. Hem performansın hem de kaynak verimliliğinin çok önemli olduğu gerçek dünya uygulamaları için son derece rekabetçi bir seçenektir.
Florence-2'nin uygulamaları#
Florence-2; eğlence, erişilebilirlik, eğitim vb. gibi birçok farklı sektörde kullanılabilir. Daha iyi anlamak için birkaç örneği inceleyelim.
Görüntü alt yazısı oluşturmanın uygulamaları#
Bir yayın platformunda ne izleyeceğinize karar vermeye çalışırken, seçiminize yardımcı olması için bir filmin özetini okuyabilirsiniz. Peki ya platform aynı zamanda film posterinin ayrıntılı bir açıklamasını da sunabilseydi? Florence-2, görüntüler için açıklayıcı metinler oluşturan görüntü alt yazısı oluşturma özelliğiyle bunu mümkün kılabilir. Florence-2, film posterlerinin ayrıntılı açıklamalarını oluşturarak yayın platformlarını görme engelli kullanıcılar için daha kapsayıcı hale getirebilir. Karakterler, manzara ve metin gibi posterin görsel öğelerini analiz ederek, Florence-2 posterin içeriğini ve havasını yansıtan ayrıntılı açıklamalar oluşturabilir. Aşağıdaki görüntü, Florence-2'nin açıklamasında sağlayabileceği ayrıntı düzeyini göstermektedir.

Şekil 4. Florence-2 tarafından oluşturulan bir görüntü altyazısı örneği.
Görüntü alt yazısı oluşturmanın yararlı olabileceği diğer bazı örnekler şunlardır:
- E-ticaret: Görüntü altyazılama, ürün görsellerinin ayrıntılı açıklamalarını sağlayarak müşterilerin ürün özelliklerini ve detaylarını daha net anlamasına yardımcı olabilir.
- Seyahat ve Turizm: Seyahat rehberlerinde ve uygulamalarında önemli yerlerin ve cazibe merkezlerinin ayrıntılı açıklamalarını sağlayabilir.
- Eğitim: Görüntü alt yazısı oluşturma, eğitici görselleri ve diyagramları etiketleyebilir ve tanımlayabilir, böylece öğretme ve öğrenmeye yardımcı olabilir.
- Gayrimenkul: Potansiyel alıcılar için özelliklerini ve olanaklarını vurgulayan ayrıntılı mülk görüntüsü açıklamaları sağlayabilir.
Yemek yaparken görsel temellendirmeyi kullanma#
Florence-2 ayrıca mutfak deneyimlerini zenginleştirmek için de kullanılabilir. Örneğin, çevrimiçi bir yemek kitabı, karmaşık bir tarif görüntüsünün bölümlerini görsel olarak temellendirmek ve etiketlemek için Florence-2'yi kullanabilir. Görsel temellendirme burada, görüntünün belirli kısımlarını ilgili açıklayıcı metinle ilişkilendirerek yardımcı olur. Her malzeme ve adım doğru bir şekilde etiketlenip açıklanabilir, bu da ev aşçılarının tarifi takip etmesini ve her bileşenin yemekteki rolünü anlamasını kolaylaştırır.

Şekil 5. Florence-2 kullanan görsel konumlandırma örneği.
Finansal belgeler için bölge tabanlı OCR#
Bir belge içindeki belirli alanlardan metin çıkarmaya odaklanan bölge tabanlı işleme sahip OCR, muhasebe gibi alanlarda işe yarayabilir. Finansal belgelerin belirlenmiş alanları, işlem ayrıntıları, hesap numaraları ve son ödeme tarihleri gibi önemli bilgileri otomatik olarak çıkarmak için analiz edilebilir. Manuel veri girişi ihtiyacını azaltarak hataları en aza indirir ve işlem sürelerini hızlandırır. Finansal kuruluşlar bunu fatura işleme, makbuz mutabakatı ve çek takası gibi görevleri düzene sokmak için kullanabilir, bu da daha hızlı işlemler ve daha iyi müşteri hizmeti sağlar.

Şekil 6. Florence-2 kullanarak bölgeli OCR çıkarma örneği.
Endüstriyel uygulamalarda bölge tabanlı segmentasyon#
Odaklanmış analiz ve ayrıntılı inceleme için bir görüntünün anlamlı parçalara bölünmesini içeren bölge tabanlı segmentasyon, çeşitli süreçlerde hassasiyeti ve verimliliği artıran endüstriyel uygulamalara güç verebilir. Bu teknoloji, bir görüntü içindeki belirli alanlara odaklanarak bileşenlerin ve ürünlerin ayrıntılı olarak incelenmesine ve analiz edilmesine olanak tanır. Kalite kontrolü açısından, çatlaklar veya hizalama bozuklukları gibi malzemelerdeki kusurları veya tutarsızlıkları belirleyerek yalnızca en yüksek kalitedeki ürünlerin pazara ulaşmasını sağlayabilir.

Şekil 7. Florence-2 kullanılarak bölgelere dayalı segmentasyon örneği.
Ayrıca robotik kolları belirli parçalara yönlendirerek ve bileşenlerin yerleşimini ve montajını optimize ederek otomatik montaj hatlarını iyileştirir. Benzer şekilde, envanter yönetimi alanında malların durumunu ve konumunu takip edip izlemeye yardımcı olarak daha verimli lojistik ve daha az arıza süreleri sağlar. Genel olarak bölge tabanlı segmentasyon doğruluğu ve üretkenliği artırarak endüstriyel ortamlarda maliyet tasarrufu ve daha yüksek ürün kalitesi sağlar.
Öne çıkanlar#
AI modellerinin yüksek performansı korurken daha hafif hale geldiği bir eğilim görmeye başlıyoruz. Florence-2, görsel dil modelleri açısından büyük bir ileri adımı temsil ediyor. Nesne algılama, segmentasyon, görüntü alt yazısı oluşturma ve temellendirme gibi çeşitli görevleri etkileyici bir sıfır-atış performansıyla yerine getirebilir. Daha küçük boyutuna rağmen Florence-2 verimli ve çok işlevlidir, bu da onu farklı sektörlerdeki uygulamalar açısından son derece kullanışlı kılar. Florence-2 gibi modeller masaya daha fazla olanak getirerek AI inovasyonları için potansiyeli genişletiyor.
GitHub deponuzu ziyaret ederek ve topluluğumuza katılarak Yapay Zeka hakkında daha fazlasını keşfet. İmalat ve tarım alanlarındaki Yapay Zeka uygulamaları hakkında bilgi edinmek için çözüm sayfalarımıza göz at. 🚀






