Florence-2: Microsoft'un en yeni görsel-dil modeli
Gelişmiş nesne algılama, segmentasyon ve sıfır atış performansını yüksek verimlilikle sunan Microsoft'un görsel dil modeli Florence-2 ile tanış.

Haziran 2024'te Microsoft, Florence-2 adlı, nesne algılama, segmentasyon, görüntü açıklaması oluşturma ve görsel temellendirme dahil olmak üzere çok çeşitli görevleri yerine getirmek üzere tasarlanmış çok modlu bir görsel dil modelini (VLM) tanıttı. Florence-2, sıfır atış performansı için yeni bir ölçüt belirler; yani önceden belirli bir eğitim almadan görevleri gerçekleştirebilir ve diğer son teknoloji görsel dil modellerine kıyasla daha küçük bir model boyutuna sahiptir.
Florence-2 yalnızca başka bir modelden ibaret değil; çok yönlülüğü ve geliştirilmiş performansı, doğruluğu artırıp kapsamlı eğitim ihtiyacını azaltarak çeşitli sektörleri önemli ölçüde etkileme potansiyeline sahip. Bu makalede Florence-2'nin yenilikçi özelliklerini inceleyecek, performansını diğer VLM'lerle karşılaştıracak ve olası uygulamalarını ele alacağız.
Florence-2 nedir?#
Florence-2, tek bir birleşik çerçeve içinde çeşitli görevleri yerine getirebilir. Modelin etkileyici yetenekleri kısmen FLD-5B adlı devasa eğitim veri kümesine borçludur. FLD-5B, 126 milyon görüntü genelinde 5,4 milyar ek açıklama içerir. Bu kapsamlı veri kümesi, Florence-2'nin çok çeşitli görsel görevleri yüksek doğruluk ve verimlilikle yerine getirmek için gereken yeteneklere sahip olmasını sağlamak amacıyla özel olarak oluşturulmuştur.
Florence-2'nin desteklediği görevlere daha yakından bakalım:
- Nesne Algılama: Görüntülerdeki nesneleri yüksek hassasiyetle tanımlayıp konumlandırabilir.
- Segmentasyon: Bu görev, daha kolay analiz ve yorumlama için bir görüntünün anlamlı bölümlere ayrılmasını içerir.
- Görüntü Açıklaması Oluşturma: Florence-2, görüntülere bağlam ve ayrıntı sağlayan açıklayıcı alt yazılar oluşturabilir.
- Görsel Temellendirme: Model, bir açıklamadaki belirli ifadeleri veya sözcükleri görüntüdeki karşılık gelen bölgelerle ilişkilendirebilir.
- Sıfır Atış Performansı: Belirli bir eğitim almadan görevleri gerçekleştirebilir.

Şekil 1. Florence-2'nin Nasıl Eğitildiğini Anlama.
Model, hem metin tabanlı hem de bölge tabanlı görevleri destekler. Görüntünün belirli bölgelerini içeren görevler için modelin kelime dağarcığına özel konum belirteçleri eklenir. Bu belirteçler, modelin nesnelerin etrafındaki dikdörtgenler (kutu gösterimi), dört kenarlı şekiller (dörtgen kutu gösterimi) ve çok kenarlı şekiller (poligon gösterimi) gibi farklı şekilleri anlamasına yardımcı olur. Model, tahminlerini doğru yanıtlarla karşılaştırıp iç parametrelerini buna göre ayarlayarak öğrenmesine yardımcı olan çapraz entropi kaybı adı verilen bir yöntemle eğitilir.
FLD-5B veri kümesini oluşturma#
FLD-5B veri kümesi farklı türlerde ek açıklamalar içerir: metin açıklamaları, bölge ve metin çiftleri ile metin, ifade ve bölge birleşimleri. Veri kümesi, veri toplama ve ek açıklama aşamalarını içeren iki adımlı bir süreçle oluşturulmuştur. Görüntüler ImageNet-22k, Object 365, Open Images, Conceptual Captions ve LAION gibi popüler veri kümelerinden alınmıştır. FLD-5B veri kümesindeki ek açıklamalar çoğunlukla sentetiktir; yani elle etiketlenmek yerine otomatik olarak oluşturulmuştur.

Şekil 2. FLD-5B Veri Kümesinin Oluşturulması.
Başlangıçta, nesne algılama veya segmentasyon gibi belirli görevlerde uzmanlaşmış modeller bu ek açıklamaları oluşturdu. Ardından, ek açıklamaların ayrıntılı ve doğru olmasını sağlamak için bir filtreleme ve iyileştirme süreci uygulandı. Gürültü kaldırıldıktan sonra veri kümesi, Florence-2'nin çıktılarının ek açıklamaları sürekli olarak güncellemek ve geliştirmek için kullanıldığı yinelemeli bir iyileştirme sürecinden geçirildi.
Florence-2'nin model mimarisini anlama#
Florence-2'nin model mimarisi, diziden diziye öğrenme yaklaşımını izler. Bu, modelin bir giriş dizisini (metin istemi içeren bir görüntü gibi) işleyip adım adım bir çıkış dizisi (açıklama veya etiket gibi) oluşturduğu anlamına gelir. Diziden diziye çerçevesinde her görev bir çeviri problemi olarak ele alınır: model bir giriş görüntüsü ve göreve özgü bir istem alır ve karşılık gelen çıktıyı oluşturur.

Şekil 3. Florence-2'nin Görsel Dil Modeli Mimarisi.
Model mimarisinin merkezinde, bir görüntü kodlayıcı ile çok modlu bir kodlayıcı-kod çözücüyü birleştiren çok modlu bir kodlayıcı-kod çözücü Transformer bulunur. DaViT (Verimli Veri Kullanan Görsel Transformer) adı verilen görüntü kodlayıcı, giriş görüntülerini hem uzamsal (nesnelerin nerede olduğu) hem de anlamsal (nesnelerin ne olduğu) bilgileri yakalayan görsel belirteç gömmelerine, yani görüntünün sıkıştırılmış temsillerine dönüştürerek işler. Bu görsel belirteçler daha sonra metin gömmeleriyle (metin temsilleriyle) birleştirilir ve modelin metinsel ve görsel verileri sorunsuzca bir araya getirmesine olanak tanır.
Florence-2'nin diğer VLM'lerle karşılaştırılması#
Florence-2, etkileyici sıfır atış yetenekleri sayesinde diğer görsel dil modellerinden ayrılır. Çeşitli görevlere uyum sağlamak için kapsamlı ince ayara dayanan PaliGemma gibi modellerin aksine Florence-2, kutudan çıktığı hâliyle iyi çalışır. Ayrıca Florence-2, genellikle çok daha fazla parametreye sahip olan ancak her zaman Florence-2'nin performansına ulaşamayan GPT-4V ve Flamingo gibi daha büyük modellerle rekabet edebilir. Örneğin Florence-2, Kosmos-2'nin iki katından fazla parametreye sahip olmasına rağmen Kosmos-2'den daha iyi sıfır atış sonuçları elde eder.
Kıyaslama testlerinde Florence-2, COCO alt yazı oluşturma ve gönderimli ifade anlama gibi görevlerde dikkat çekici bir performans sergilemiştir. COCO veri kümesi üzerindeki nesne algılama ve segmentasyon görevlerinde PolyFormer ve UNINEXT gibi modellerden daha iyi sonuç vermiştir. Hem performansın hem de kaynak verimliliğinin kritik olduğu gerçek dünya uygulamaları için son derece rekabetçi bir seçenektir.
Florence-2'nin uygulamaları#
Florence-2; eğlence, erişilebilirlik, eğitim ve diğerleri gibi çok farklı sektörlerde kullanılabilir. Daha iyi anlamak için birkaç örneği inceleyelim.
Görüntü açıklaması oluşturma uygulamaları#
Bir yayın platformunda ne izleyeceğine karar vermeye çalışırken seçimine yardımcı olması için bir filmin özetini okuyabilirsin. Peki platform film afişinin ayrıntılı bir açıklamasını da sağlayabilseydi? Florence-2, görüntüler için açıklayıcı metinler oluşturan görüntü açıklaması oluşturma özelliğiyle bunu mümkün kılabilir. Florence-2, film afişlerinin ayrıntılı açıklamalarını oluşturarak yayın platformlarını görme engelli kullanıcılar için daha kapsayıcı hâle getirebilir. Florence-2; karakterler, manzara ve metin gibi bir afişin görsel unsurlarını analiz ederek afişin içeriğini ve havasını aktaran ayrıntılı açıklamalar oluşturabilir. Aşağıdaki görüntü, Florence-2'nin açıklamasında sağlayabileceği ayrıntı düzeyini gösterir.

Şekil 4. Florence-2 tarafından oluşturulan bir görüntü açıklaması örneği.
Görüntü açıklaması oluşturmanın yararlı olabileceği diğer bazı alanlar şunlardır:
- E-ticaret: Görüntü açıklaması oluşturma, müşterilerin ürün özelliklerini ve ayrıntılarını daha net anlamasına yardımcı olmak için ürün görüntülerinin ayrıntılı açıklamalarını sağlayabilir.
- Seyahat ve Turizm: Seyahat rehberlerinde ve uygulamalarında önemli yapıların ve turistik yerlerin ayrıntılı açıklamalarını sağlayabilir.
- Eğitim: Görüntü açıklaması oluşturma, eğitim görüntülerini ve diyagramlarını etiketleyip açıklayarak öğretme ve öğrenme süreçlerine yardımcı olabilir.
- Gayrimenkul: Potansiyel alıcılar için özellikleri ve olanakları öne çıkaran mülk görüntülerinin ayrıntılı açıklamalarını sağlayabilir.
Yemek pişirirken görsel temellendirme kullanma#
Florence-2, yemek pişirme deneyimlerini zenginleştirmek için de kullanılabilir. Örneğin çevrim içi bir yemek kitabı, karmaşık bir tarif görüntüsünün bölümlerini görsel olarak temellendirmek ve etiketlemek için Florence-2'yi kullanabilir. Görsel temellendirme, görüntünün belirli bölümlerini karşılık gelen açıklayıcı metinlerle ilişkilendirerek yardımcı olur. Her malzeme ve adım doğru şekilde etiketlenip açıklanabilir; böylece evde yemek yapanların tarifi takip etmesi ve her bileşenin yemekteki rolünü anlaması kolaylaşır.

Şekil 5. Florence-2 kullanılarak görsel temellendirme örneği.
Finansal belgeler için bölge tabanlı OCR#
Belge içindeki belirli alanlardan metin çıkarmaya odaklanan bölge tabanlı işleme kullanan OCR, muhasebe gibi alanlarda oldukça yararlı olabilir. Finansal belgelerin belirlenmiş alanları analiz edilerek işlem ayrıntıları, hesap numaraları ve vade tarihleri gibi önemli bilgiler otomatik olarak çıkarılabilir. Manuel veri girişi ihtiyacını azaltarak hataları en aza indirir ve işleme sürelerini kısaltır. Finans kuruluşları bunu fatura işleme, makbuz mutabakatı ve çek takası gibi görevleri kolaylaştırmak için kullanabilir; bu da daha hızlı işlemler ve daha iyi müşteri hizmeti sağlar.

Şekil 6. Florence-2 kullanılarak bölge içeren OCR çıkarma örneği.
Endüstriyel uygulamalarda bölge tabanlı segmentasyon#
Bir görüntüyü odaklanmış analiz ve ayrıntılı inceleme için anlamlı bölümlere ayırmayı içeren bölge tabanlı segmentasyon, çeşitli süreçlerde hassasiyeti ve verimliliği artıran endüstriyel uygulamaları destekleyebilir. Görüntü içindeki belirli alanlara odaklanan bu teknoloji, bileşenlerin ve ürünlerin ayrıntılı şekilde incelenip analiz edilmesini sağlar. Kalite kontrolü açısından, çatlaklar veya hizalama bozuklukları gibi malzeme kusurlarını ya da tutarsızlıklarını tespit ederek yalnızca en kaliteli ürünlerin pazara ulaşmasını sağlayabilir.

Şekil 7. Florence-2 kullanılarak bölgeler tabanlı segmentasyon örneği.
Ayrıca robotik kolları belirli parçalara yönlendirip bileşenlerin yerleştirilmesini ve montajını optimize ederek otomatik montaj hatlarını iyileştirir. Benzer şekilde envanter yönetiminde ürünlerin durumunu ve konumunu izlemeye yardımcı olarak daha verimli lojistik ve daha az duruş süresi sağlar. Genel olarak bölge tabanlı segmentasyon doğruluğu ve üretkenliği artırır; bu da endüstriyel ortamlarda maliyet tasarrufu ve daha yüksek ürün kalitesi sağlar.
Önemli çıkarımlar#
Yüksek performansı korurken yapay zeka modellerinin hafiflediği bir eğilimi görmeye başlıyoruz. Florence-2, görsel dil modelleri açısından ileriye doğru atılmış büyük bir adımı temsil eder. Nesne algılama, segmentasyon, görüntü açıklaması oluşturma ve görsel temellendirme gibi çeşitli görevleri etkileyici bir sıfır atış performansıyla yerine getirebilir. Daha küçük boyutuna rağmen Florence-2 verimli ve çok işlevlidir; bu da onu farklı sektörlerdeki uygulamalar açısından son derece kullanışlı kılar. Florence-2 gibi modeller daha fazla olasılık sunarak yapay zeka yenilikleri için potansiyeli genişletiyor.
GitHub depomuzu ziyaret ederek ve topluluğumuza katılarak yapay zeka hakkında daha fazlasını keşfet. Üretim ve tarım alanlarındaki yapay zeka uygulamaları hakkında bilgi edinmek için çözümler sayfalarımıza göz at. 🚀









