Ultralytics YOLO27:
Görüntü Yapay Zekâsı

Florence-2: Microsoft'un en yeni görsel-dil modeli

Gelişmiş nesne algılama, segmentasyon ve sıfır atış performansını yüksek verimlilikle sunan Microsoft'un görsel dil modeli Florence-2 ile tanış.

ABAbirami Vina7 min read
Microsoft'un Florence-2 görsel-dil modeli

Haziran 2024'te Microsoft, Florence-2 adlı, nesne algılama, segmentasyon, görüntü açıklaması oluşturma ve görsel temellendirme dahil olmak üzere çok çeşitli görevleri yerine getirmek üzere tasarlanmış çok modlu bir görsel dil modelini (VLM) tanıttı. Florence-2, sıfır atış performansı için yeni bir ölçüt belirler; yani önceden belirli bir eğitim almadan görevleri gerçekleştirebilir ve diğer son teknoloji görsel dil modellerine kıyasla daha küçük bir model boyutuna sahiptir.

Florence-2 yalnızca başka bir modelden ibaret değil; çok yönlülüğü ve geliştirilmiş performansı, doğruluğu artırıp kapsamlı eğitim ihtiyacını azaltarak çeşitli sektörleri önemli ölçüde etkileme potansiyeline sahip. Bu makalede Florence-2'nin yenilikçi özelliklerini inceleyecek, performansını diğer VLM'lerle karşılaştıracak ve olası uygulamalarını ele alacağız.

Florence-2 nedir?#

Florence-2, tek bir birleşik çerçeve içinde çeşitli görevleri yerine getirebilir. Modelin etkileyici yetenekleri kısmen FLD-5B adlı devasa eğitim veri kümesine borçludur. FLD-5B, 126 milyon görüntü genelinde 5,4 milyar ek açıklama içerir. Bu kapsamlı veri kümesi, Florence-2'nin çok çeşitli görsel görevleri yüksek doğruluk ve verimlilikle yerine getirmek için gereken yeteneklere sahip olmasını sağlamak amacıyla özel olarak oluşturulmuştur.

Florence-2'nin desteklediği görevlere daha yakından bakalım:

  • Nesne Algılama: Görüntülerdeki nesneleri yüksek hassasiyetle tanımlayıp konumlandırabilir.
  • Segmentasyon: Bu görev, daha kolay analiz ve yorumlama için bir görüntünün anlamlı bölümlere ayrılmasını içerir.
  • Görüntü Açıklaması Oluşturma: Florence-2, görüntülere bağlam ve ayrıntı sağlayan açıklayıcı alt yazılar oluşturabilir.
  • Görsel Temellendirme: Model, bir açıklamadaki belirli ifadeleri veya sözcükleri görüntüdeki karşılık gelen bölgelerle ilişkilendirebilir.
  • Sıfır Atış Performansı: Belirli bir eğitim almadan görevleri gerçekleştirebilir.

Florence-2'nin nasıl eğitildiğini gösteren diyagram

Şekil 1. Florence-2'nin Nasıl Eğitildiğini Anlama.

Model, hem metin tabanlı hem de bölge tabanlı görevleri destekler. Görüntünün belirli bölgelerini içeren görevler için modelin kelime dağarcığına özel konum belirteçleri eklenir. Bu belirteçler, modelin nesnelerin etrafındaki dikdörtgenler (kutu gösterimi), dört kenarlı şekiller (dörtgen kutu gösterimi) ve çok kenarlı şekiller (poligon gösterimi) gibi farklı şekilleri anlamasına yardımcı olur. Model, tahminlerini doğru yanıtlarla karşılaştırıp iç parametrelerini buna göre ayarlayarak öğrenmesine yardımcı olan çapraz entropi kaybı adı verilen bir yöntemle eğitilir.

FLD-5B veri kümesini oluşturma#

FLD-5B veri kümesi farklı türlerde ek açıklamalar içerir: metin açıklamaları, bölge ve metin çiftleri ile metin, ifade ve bölge birleşimleri. Veri kümesi, veri toplama ve ek açıklama aşamalarını içeren iki adımlı bir süreçle oluşturulmuştur. Görüntüler ImageNet-22k, Object 365, Open Images, Conceptual Captions ve LAION gibi popüler veri kümelerinden alınmıştır. FLD-5B veri kümesindeki ek açıklamalar çoğunlukla sentetiktir; yani elle etiketlenmek yerine otomatik olarak oluşturulmuştur.

FLD-5B veri kümesinin oluşturulmasını gösteren diyagram

Şekil 2. FLD-5B Veri Kümesinin Oluşturulması.

Başlangıçta, nesne algılama veya segmentasyon gibi belirli görevlerde uzmanlaşmış modeller bu ek açıklamaları oluşturdu. Ardından, ek açıklamaların ayrıntılı ve doğru olmasını sağlamak için bir filtreleme ve iyileştirme süreci uygulandı. Gürültü kaldırıldıktan sonra veri kümesi, Florence-2'nin çıktılarının ek açıklamaları sürekli olarak güncellemek ve geliştirmek için kullanıldığı yinelemeli bir iyileştirme sürecinden geçirildi.

Florence-2'nin model mimarisini anlama#

Florence-2'nin model mimarisi, diziden diziye öğrenme yaklaşımını izler. Bu, modelin bir giriş dizisini (metin istemi içeren bir görüntü gibi) işleyip adım adım bir çıkış dizisi (açıklama veya etiket gibi) oluşturduğu anlamına gelir. Diziden diziye çerçevesinde her görev bir çeviri problemi olarak ele alınır: model bir giriş görüntüsü ve göreve özgü bir istem alır ve karşılık gelen çıktıyı oluşturur.

Florence-2 görsel dil modeli mimarisinin diyagramı

Şekil 3. Florence-2'nin Görsel Dil Modeli Mimarisi.

Model mimarisinin merkezinde, bir görüntü kodlayıcı ile çok modlu bir kodlayıcı-kod çözücüyü birleştiren çok modlu bir kodlayıcı-kod çözücü Transformer bulunur. DaViT (Verimli Veri Kullanan Görsel Transformer) adı verilen görüntü kodlayıcı, giriş görüntülerini hem uzamsal (nesnelerin nerede olduğu) hem de anlamsal (nesnelerin ne olduğu) bilgileri yakalayan görsel belirteç gömmelerine, yani görüntünün sıkıştırılmış temsillerine dönüştürerek işler. Bu görsel belirteçler daha sonra metin gömmeleriyle (metin temsilleriyle) birleştirilir ve modelin metinsel ve görsel verileri sorunsuzca bir araya getirmesine olanak tanır.

Florence-2'nin diğer VLM'lerle karşılaştırılması#

Florence-2, etkileyici sıfır atış yetenekleri sayesinde diğer görsel dil modellerinden ayrılır. Çeşitli görevlere uyum sağlamak için kapsamlı ince ayara dayanan PaliGemma gibi modellerin aksine Florence-2, kutudan çıktığı hâliyle iyi çalışır. Ayrıca Florence-2, genellikle çok daha fazla parametreye sahip olan ancak her zaman Florence-2'nin performansına ulaşamayan GPT-4V ve Flamingo gibi daha büyük modellerle rekabet edebilir. Örneğin Florence-2, Kosmos-2'nin iki katından fazla parametreye sahip olmasına rağmen Kosmos-2'den daha iyi sıfır atış sonuçları elde eder.

Kıyaslama testlerinde Florence-2, COCO alt yazı oluşturma ve gönderimli ifade anlama gibi görevlerde dikkat çekici bir performans sergilemiştir. COCO veri kümesi üzerindeki nesne algılama ve segmentasyon görevlerinde PolyFormer ve UNINEXT gibi modellerden daha iyi sonuç vermiştir. Hem performansın hem de kaynak verimliliğinin kritik olduğu gerçek dünya uygulamaları için son derece rekabetçi bir seçenektir.

Florence-2'nin uygulamaları#

Florence-2; eğlence, erişilebilirlik, eğitim ve diğerleri gibi çok farklı sektörlerde kullanılabilir. Daha iyi anlamak için birkaç örneği inceleyelim.

Görüntü açıklaması oluşturma uygulamaları#

Bir yayın platformunda ne izleyeceğine karar vermeye çalışırken seçimine yardımcı olması için bir filmin özetini okuyabilirsin. Peki platform film afişinin ayrıntılı bir açıklamasını da sağlayabilseydi? Florence-2, görüntüler için açıklayıcı metinler oluşturan görüntü açıklaması oluşturma özelliğiyle bunu mümkün kılabilir. Florence-2, film afişlerinin ayrıntılı açıklamalarını oluşturarak yayın platformlarını görme engelli kullanıcılar için daha kapsayıcı hâle getirebilir. Florence-2; karakterler, manzara ve metin gibi bir afişin görsel unsurlarını analiz ederek afişin içeriğini ve havasını aktaran ayrıntılı açıklamalar oluşturabilir. Aşağıdaki görüntü, Florence-2'nin açıklamasında sağlayabileceği ayrıntı düzeyini gösterir.

Florence-2 tarafından oluşturulan görüntü açıklaması örneği

Şekil 4. Florence-2 tarafından oluşturulan bir görüntü açıklaması örneği.

Görüntü açıklaması oluşturmanın yararlı olabileceği diğer bazı alanlar şunlardır:

  • E-ticaret: Görüntü açıklaması oluşturma, müşterilerin ürün özelliklerini ve ayrıntılarını daha net anlamasına yardımcı olmak için ürün görüntülerinin ayrıntılı açıklamalarını sağlayabilir.
  • Seyahat ve Turizm: Seyahat rehberlerinde ve uygulamalarında önemli yapıların ve turistik yerlerin ayrıntılı açıklamalarını sağlayabilir.
  • Eğitim: Görüntü açıklaması oluşturma, eğitim görüntülerini ve diyagramlarını etiketleyip açıklayarak öğretme ve öğrenme süreçlerine yardımcı olabilir.
  • Gayrimenkul: Potansiyel alıcılar için özellikleri ve olanakları öne çıkaran mülk görüntülerinin ayrıntılı açıklamalarını sağlayabilir.

Yemek pişirirken görsel temellendirme kullanma#

Florence-2, yemek pişirme deneyimlerini zenginleştirmek için de kullanılabilir. Örneğin çevrim içi bir yemek kitabı, karmaşık bir tarif görüntüsünün bölümlerini görsel olarak temellendirmek ve etiketlemek için Florence-2'yi kullanabilir. Görsel temellendirme, görüntünün belirli bölümlerini karşılık gelen açıklayıcı metinlerle ilişkilendirerek yardımcı olur. Her malzeme ve adım doğru şekilde etiketlenip açıklanabilir; böylece evde yemek yapanların tarifi takip etmesi ve her bileşenin yemekteki rolünü anlaması kolaylaşır.

Florence-2 kullanılarak görsel temellendirme örneği

Şekil 5. Florence-2 kullanılarak görsel temellendirme örneği.

Finansal belgeler için bölge tabanlı OCR#

Belge içindeki belirli alanlardan metin çıkarmaya odaklanan bölge tabanlı işleme kullanan OCR, muhasebe gibi alanlarda oldukça yararlı olabilir. Finansal belgelerin belirlenmiş alanları analiz edilerek işlem ayrıntıları, hesap numaraları ve vade tarihleri gibi önemli bilgiler otomatik olarak çıkarılabilir. Manuel veri girişi ihtiyacını azaltarak hataları en aza indirir ve işleme sürelerini kısaltır. Finans kuruluşları bunu fatura işleme, makbuz mutabakatı ve çek takası gibi görevleri kolaylaştırmak için kullanabilir; bu da daha hızlı işlemler ve daha iyi müşteri hizmeti sağlar.

Florence-2 kullanılarak bölge içeren OCR örneği

Şekil 6. Florence-2 kullanılarak bölge içeren OCR çıkarma örneği.

Endüstriyel uygulamalarda bölge tabanlı segmentasyon#

Bir görüntüyü odaklanmış analiz ve ayrıntılı inceleme için anlamlı bölümlere ayırmayı içeren bölge tabanlı segmentasyon, çeşitli süreçlerde hassasiyeti ve verimliliği artıran endüstriyel uygulamaları destekleyebilir. Görüntü içindeki belirli alanlara odaklanan bu teknoloji, bileşenlerin ve ürünlerin ayrıntılı şekilde incelenip analiz edilmesini sağlar. Kalite kontrolü açısından, çatlaklar veya hizalama bozuklukları gibi malzeme kusurlarını ya da tutarsızlıklarını tespit ederek yalnızca en kaliteli ürünlerin pazara ulaşmasını sağlayabilir.

Florence-2 kullanılarak bölge tabanlı segmentasyon örneği

Şekil 7. Florence-2 kullanılarak bölgeler tabanlı segmentasyon örneği.

Ayrıca robotik kolları belirli parçalara yönlendirip bileşenlerin yerleştirilmesini ve montajını optimize ederek otomatik montaj hatlarını iyileştirir. Benzer şekilde envanter yönetiminde ürünlerin durumunu ve konumunu izlemeye yardımcı olarak daha verimli lojistik ve daha az duruş süresi sağlar. Genel olarak bölge tabanlı segmentasyon doğruluğu ve üretkenliği artırır; bu da endüstriyel ortamlarda maliyet tasarrufu ve daha yüksek ürün kalitesi sağlar.

Önemli çıkarımlar#

Yüksek performansı korurken yapay zeka modellerinin hafiflediği bir eğilimi görmeye başlıyoruz. Florence-2, görsel dil modelleri açısından ileriye doğru atılmış büyük bir adımı temsil eder. Nesne algılama, segmentasyon, görüntü açıklaması oluşturma ve görsel temellendirme gibi çeşitli görevleri etkileyici bir sıfır atış performansıyla yerine getirebilir. Daha küçük boyutuna rağmen Florence-2 verimli ve çok işlevlidir; bu da onu farklı sektörlerdeki uygulamalar açısından son derece kullanışlı kılar. Florence-2 gibi modeller daha fazla olasılık sunarak yapay zeka yenilikleri için potansiyeli genişletiyor.

GitHub depomuzu ziyaret ederek ve topluluğumuza katılarak yapay zeka hakkında daha fazlasını keşfet. Üretim ve tarım alanlarındaki yapay zeka uygulamaları hakkında bilgi edinmek için çözümler sayfalarımıza göz at. 🚀

Explore solutions

Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin

Yapay zekânın geleceğini birlikte inşa edelim!

Makine öğreniminin geleceğiyle yolculuğuna başla