SAM 3’ü Keşfetme: Meta AI’ın yeni Segment Anything Model modeli
Meta AI’ın yeni Segment Anything Model modeli SAM 3’ün gerçek dünyadaki görüntü ve videolardaki nesneleri algılamayı, segmentlere ayırmayı ve takip etmeyi nasıl kolaylaştırdığını öğren.

19 Kasım 2025’te Meta AI, Segment Anything Model 3 modelini, diğer adıyla SAM 3’ü yayımladı. Segment Anything Model’in bu en yeni sürümü, metin istemlerini, görsel istemleri ve görüntü örneklerini kullanarak gerçek dünyadaki görüntü ve videolarda nesneleri algılamak, segmentlere ayırmak ve takip etmek için yeni yollar sunuyor.
SAM 3 modeli SAM ve SAM 2 üzerine inşa edilerek kavram segmentasyonu, açık kelime dağarcığı algılama ve gerçek zamanlı video takibi gibi yeni geliştirmeler ve özellikler sunuyor. Kısa isim öbeklerini anlayabiliyor, nesneleri kareler boyunca takip edebiliyor ve önceki modellerin tutarlı biçimde işleyemediği ince ayrıntılı veya nadir kavramları tanımlayabiliyor.
SAM 3 sürümünün bir parçası olarak Meta, SAM 3D’yi de tanıttı. Bu yeni nesil model paketi, nesneleri, sahneleri ve tam insan bedenlerini tek bir görüntüden yeniden oluşturuyor ve Segment Anything ekosistemini 3D anlayışına taşıyor. Bu eklemeler bilgisayarlı görü, robotik, medya düzenleme ve yaratıcı iş akışlarında yeni uygulamaların önünü açıyor.
Bu makalede SAM 3’ün ne olduğunu, onu SAM 2’den ayıran özellikleri, modelin nasıl çalıştığını ve gerçek dünyadaki uygulamalarını inceleyeceğiz. Hadi başlayalım!
SAM 3 nedir? Meta’nın Segment Anything Model 3’üne bir bakış#
SAM 3, basit talimatlara göre görüntü ve videolardaki nesneleri tanımlayabilen, ayırabilen ve takip edebilen son teknoloji bir bilgisayarlı görü modelidir. Sabit bir etiket listesine dayanmak yerine doğal dili ve görsel ipuçlarını anlayarak modele bulmasını istediğin şeyi kolayca söylemeni sağlar.
Örneğin SAM 3 ile “sarı okul otobüsü” veya “çizgili bir kedi” gibi kısa bir ifade yazabilir, bir nesneye tıklayabilir ya da görüntüdeki bir örneği vurgulayabilirsin. Model daha sonra eşleşen her nesneyi algılar ve temiz segmentasyon maskeleri (hangi piksellerin bir nesneye ait olduğunu tam olarak gösteren görsel bir sınır çizgisi) oluşturur. SAM 3 ayrıca bu nesneleri video kareleri boyunca takip ederek hareket ederken tutarlı kalmalarını sağlar.
SAM 3D, tek görüntülü 3D yeniden oluşturmayı mümkün kılıyor#
Meta AI’ın duyurusunun bir diğer dikkat çekici bölümü, Segment Anything projesini 3D anlayışına taşıyan SAM 3D’dir. SAM 3D, tek bir 2D görüntüyü alarak bir nesnenin veya insan bedeninin şeklini, pozunu ya da yapısını üç boyutlu olarak yeniden oluşturabilir. Başka bir deyişle model, yalnızca tek bir bakış açısı mevcut olsa bile bir şeyin uzayda nasıl yer kapladığını tahmin edebilir.
SAM 3D iki farklı model olarak yayımlandı: Geometri ve doku ile gündelik nesneleri yeniden oluşturan SAM 3D Objects ve tek bir görüntüden insan bedeninin şeklini ve pozunu tahmin eden SAM 3D Body. Her iki model de SAM 3’ün segmentasyon çıktısını kullanır ve ardından orijinal fotoğraftaki nesnenin görünümü ve konumuyla hizalanan bir 3D gösterim oluşturur.

Şekil 1. SAM 3D kullanımına bir örnek. (Kaynak: Meta AI’ın segment anything playground’ı kullanılarak oluşturulmuştur)
SAM 3: Algılama, segmentasyon ve takibi birleştiren yeni özellikler#
SAM 3’ün algılama, segmentasyon ve takibi tek bir birleşik modelde bir araya getirmek için sunduğu temel güncellemelerden bazıları şunlardır:
- Kavram segmentasyonu görevleri: SAM ve SAM 2’de nesne segmentasyonu, tıklamalar veya kutular gibi görsel istemlere bağlıydı. SAM 3, nesneleri kısa bir metin ifadesine veya görüntüden alınan örnek bir kırpmaya göre segmentlere ayırma özelliği ekliyor. Böylece model, her biri için ayrı ayrı tıklama gerektirmeden eşleşen tüm örnekleri tanımlayabiliyor.
- Açık kelime dağarcıklı metin istemleri: Önceki sürümlerin aksine SAM 3, kısa doğal dil ifadelerini yorumlayabiliyor. Bu, sabit bir etiket listesi gereksinimini ortadan kaldırıyor ve modelin daha özgül veya daha az yaygın kavramlarla çalışmasını mümkün kılıyor.
- Algılama, segmentasyon ve takip için tek model: SAM 3; nesneleri bulmak, segmentasyon maskeleri oluşturmak ve onları video kareleri boyunca takip etmek için ayrı sistemlere duyulan ihtiyacı ortadan kaldırarak algılama, segmentasyon ve takibi tek bir modelde birleştiriyor. Bu, hem görüntüler hem de videolar için daha tutarlı ve akıcı bir iş akışı oluşturuyor. SAM 2 de bazı takip özellikleri sunsa da SAM 3 çok daha güçlü ve güvenilir bir performans sağlıyor.
- Karmaşık sahnelerde daha kararlı sonuçlar: SAM 3, metni, örnek görüntüleri ve görsel istemleri birleştirebildiği için yalnızca görsel tıklamalara dayanan önceki sürümlere göre karmaşık veya tekrarlı sahneleri daha güvenilir biçimde işleyebiliyor.

Şekil 2. SAM 3, metin veya görüntü örnekleriyle kavram segmentasyonunu kullanıma sunuyor. (Kaynak)
SAM 3 ve SAM 2 ile SAM 1’in karşılaştırılması#
Bir safari videosu izlediğini, videoda birçok farklı hayvan bulunduğunu ve yalnızca filleri algılayıp segmentlere ayırmak istediğini düşünelim. Bu görev, SAM’in farklı sürümlerinde nasıl görünürdü?
SAM ile segmentasyon maskesi oluşturmak için her karede her filin üzerine manuel olarak tıklaman gerekirdi. Takip özelliği olmadığı için her yeni karede yeniden tıklaman gerekirdi.
SAM 2 ile bir filin üzerine bir kez tıklayıp maskesini alabilir ve modelin aynı fili video boyunca takip etmesini sağlayabilirdin. Ancak birden fazla fili (belirli nesneleri) segmentlere ayırmak isteseydin yine ayrı tıklamalar yapman gerekirdi; çünkü SAM 2, “fil” gibi kategorileri kendi başına anlayamaz.
SAM 3 ile iş akışı çok daha basit hale geliyor. Örnek sağlamak için “fil” yazabilir veya tek bir filin çevresine bir sınırlayıcı kutu çizebilirsin; model de videodaki tüm filleri otomatik olarak bulur, segmentlere ayırır ve kareler boyunca tutarlı biçimde takip eder. Önceki sürümlerde kullanılan tıklama ve kutu istemlerini desteklemeye devam eder; ancak artık SAM ve SAM 2’nin yapamadığı şekilde metin istemlerine ve örnek görüntülere de yanıt verebilir.
SAM 3 modeli nasıl çalışır?#
Şimdi SAM 3 modelinin nasıl çalıştığına ve nasıl eğitildiğine daha yakından bakalım.
SAM 3’ün model mimarisine genel bakış#
SAM 3, kavram istemlerini ve görsel istemleri tek bir sistemde desteklemek için çeşitli bileşenleri bir araya getiriyor. Modelin merkezinde, Meta’nın birleşik açık kaynaklı görüntü-metin kodlayıcısı olan Meta Perception Encoder bulunuyor.
Bu kodlayıcı hem görüntüleri hem de kısa isim öbeklerini işleyebiliyor. Basitçe söylemek gerekirse bu, SAM 3’ün dil ve görsel özellikleri Segment Anything Model’in önceki sürümlerine göre daha etkili biçimde ilişkilendirmesini sağlıyor.
Bu kodlayıcının üzerinde SAM 3, Transformer modellerinin DETR ailesini temel alan bir algılayıcı içeriyor. Bu algılayıcı görüntüdeki nesneleri tanımlıyor ve sistemin hangi nesnelerin kullanıcının istemiyle eşleştiğini belirlemesine yardımcı oluyor.
Özellikle video segmentasyonu için SAM 3, SAM 2’deki bellek bankası ve bellek kodlayıcısı üzerine inşa edilen bir takip bileşeni kullanıyor. Bu, modelin kareler boyunca nesnelerle ilgili bilgileri korumasını ve böylece nesneleri zaman içinde yeniden tanımlayıp takip etmesini sağlıyor.

Şekil 3. Kavramlarla her şeyi segmentlere ayırma nasıl çalışır (Kaynak: scontent)
Segment Anything Model 3’ün arkasındaki ölçeklenebilir veri motoru#
SAM 3’ü eğitmek için Meta’nın internette mevcut olandan çok daha fazla açıklamalı veriye ihtiyacı vardı. Yüksek kaliteli segmentasyon maskeleri ve metin etiketleri geniş ölçekte oluşturulması zor verilerdir; görüntü ve videolardaki bir kavramın her örneğinin sınırlarını tamamen çizmek de yavaş ve maliyetlidir.
Meta bu sorunu çözmek için SAM 3’ün kendisini, ek AI modellerini ve birlikte çalışan insan açıklayıcıları birleştiren yeni bir veri motoru oluşturdu. İş akışı, SAM 3 ve Llama tabanlı bir açıklama modeli de dahil olmak üzere bir AI sistemleri işlem hattıyla başlıyor.
Bu sistemler geniş görüntü ve video koleksiyonlarını tarıyor, açıklamalar oluşturuyor, bu açıklamaları metin etiketlerine dönüştürüyor ve ilk segmentasyon maskesi adaylarını üretiyor. İnsan ve AI açıklayıcılar daha sonra bu adayları inceliyor.
Maske kalitesini kontrol etme ve kavram kapsamını doğrulama gibi görevlerde insan doğruluğuna ulaşmak veya bunu aşmak üzere eğitilen AI açıklayıcılar, kolay durumları filtreliyor. İnsanlar yalnızca modelin hâlâ zorlanabileceği daha güç örneklerde devreye giriyor.

Şekil 4. SAM 3 veri motoru (Kaynak)
Bu yaklaşım, Meta’nın açıklama hızını önemli ölçüde artırıyor. AI açıklayıcıların kolay durumları ele almasına izin verildiğinde işlem hattı, ince ayrıntılı alanlarda negatif istemlerde yaklaşık beş kat, pozitif istemlerde ise %36 daha hızlı hale geliyor.
Bu verimlilik, veri kümesinin dört milyondan fazla benzersiz kavrama ölçeklenmesini mümkün kıldı. AI önerileri, insan düzeltmeleri ve güncellenmiş model tahminlerinden oluşan sürekli döngü, zaman içinde etiket kalitesini de artırıyor ve SAM 3’ün çok daha geniş bir görsel ve metin tabanlı kavram kümesini öğrenmesine yardımcı oluyor.
SAM 3’ün performans geliştirmeleri#
Performans açısından SAM 3, önceki modellere göre belirgin bir gelişme sunuyor. Açık kelime dağarcıklı kavram algılama ve segmentasyonu değerlendiren Meta’nın yeni SA-Co kıyaslamasında SAM 3, hem görüntülerde hem de videolarda önceki sistemlerin yaklaşık iki katı performans gösteriyor.
Ayrıca nokta-maskesi ve maske-maskecik gibi etkileşimli görsel görevlerde SAM 2 ile eşleşiyor veya onu aşıyor. Meta, zero-shot LVIS gibi daha zorlu değerlendirmelerde (modellerin eğitim örnekleri olmadan nadir kategorileri tanıması gerekir) ve nesne sayımında (bir nesnenin tüm örneklerinin algılanıp algılanmadığının ölçülmesi) ek kazanımlar bildiriyor. Bu da alanlar arasında daha güçlü bir genelleme yeteneğine işaret ediyor.
Bu doğruluk iyileştirmelerine ek olarak SAM 3 verimli çalışıyor; H200 GPU üzerinde 100’den fazla algılanan nesne içeren bir görüntüyü yaklaşık 30 milisaniyede işliyor ve videoda birden fazla nesneyi takip ederken gerçeğe yakın gerçek zamanlı hızlarını koruyor.
Segment Anything Model 3’ün uygulamaları#
Artık SAM 3’ü daha iyi anladığımıza göre, gelişmiş metin yönlendirmeli akıl yürütmeden bilimsel araştırmalara ve Meta’nın kendi ürünlerine kadar gerçek uygulamalarda nasıl kullanıldığına bakalım.
SAM 3 Agent ile karmaşık metin sorgularını işleme#
SAM 3, Meta’nın SAM 3 Agent adını verdiği daha büyük bir çok modlu dil modelinin içinde bir araç olarak da kullanılabilir. SAM 3’e “fil” gibi kısa bir ifade vermek yerine aracı, daha karmaşık bir soruyu SAM 3’ün anlayabileceği daha küçük istemlere ayırabilir.
Örneğin kullanıcı “Resimdeki hangi nesne bir atı kontrol etmek ve yönlendirmek için kullanılır?” diye sorarsa aracı farklı isim öbeklerini dener, bunları SAM 3’e gönderir ve hangi maskelerin anlamlı olduğunu kontrol eder. Doğru nesneyi bulana kadar sorguyu geliştirmeye devam eder.
Özel akıl yürütme veri kümeleriyle eğitilmemiş olmasına rağmen SAM 3 Agent, ReasonSeg ve OmniLabel gibi karmaşık metin sorguları için tasarlanmış kıyaslamalarda iyi performans gösteriyor. Bu, SAM 3’ün hem dil anlayışına hem de ince ayrıntılı görsel segmentasyona ihtiyaç duyan sistemleri destekleyebildiğini gösteriyor.
SAM 3’ün bilimsel ve koruma amaçlı uygulamaları#
İlginç biçimde SAM 3, ayrıntılı görsel etiketlerin önemli olduğu araştırma ortamlarında şimdiden kullanılıyor. Meta; 10.000’den fazla kamera tuzağı videosu içeren, kamuya açık bir yaban hayatı izleme veri kümesi olan SA-FARI’yi oluşturmak için Conservation X Labs ve Osa Conservation ile birlikte çalıştı.
Her karedeki her hayvan kutular ve segmentasyon maskeleriyle etiketleniyor; bunu elle açıklamak son derece zaman alıcı olurdu. Benzer şekilde okyanus araştırmalarında SAM 3, su altı görüntüleri için örnek segmentasyonu maskeleri oluşturmak ve yeni değerlendirme kıyaslamalarını desteklemek üzere FathomNet ve MBARI ile birlikte kullanılıyor.
Bu tür veri kümeleri, bilim insanlarının video görüntülerini daha verimli analiz etmesine ve genellikle geniş ölçekte takip edilmesi zor olan hayvanları ve yaşam alanlarını incelemesine yardımcı oluyor. Araştırmacılar bu kaynakları tür tanımlama, davranış analizi ve otomatik ekolojik izleme için kendi modellerini oluşturmak üzere de kullanabilir.
Meta SAM 3’ü ürünleri genelinde nasıl kullanıma sunuyor?#
Araştırma amaçlı kullanımının yanı sıra SAM 3, Meta’nın tüketici ürünleri genelinde yeni özelliklere ve kullanım alanlarına da güç veriyor. Şimdiden entegre edildiği yöntemlerden bazılarına göz atalım:
- Instagram düzenlemeleri: İçerik üreticiler, manuel olarak kare kare çalışmadan videodaki belirli bir kişiye veya nesneye efekt uygulayabiliyor.
- Meta AI uygulaması ve web üzerindeki meta.ai: SAM 3, görüntüleri ve videoları değiştirmek, iyileştirmek ve yeniden düzenlemek için yeni araçları destekliyor.
- Facebook Marketplace’in “Odada Görüntüle” özelliği: SAM 3, SAM 3D ile birlikte çalışarak insanların tek bir fotoğraf kullanarak mobilyaları veya dekorasyonu evlerinde önizlemesine olanak tanıyor.
- Aria Gen 2 araştırma gözlükleri: Segment Anything Model 3, elleri ve nesneleri birinci şahıs bakış açısından segmentlere ayırıp takip etmeye yardımcı olarak AR (Artırılmış Gerçeklik), robotik ve bağlamsal AI araştırmalarını destekliyor.
Önemli çıkarımlar#
SAM 3, segmentasyon için heyecan verici bir ileri adım. Kavram segmentasyonunu, açık kelime dağarcıklı metin istemlerini ve geliştirilmiş takibi kullanıma sunuyor. Hem görüntülerde hem de videolarda belirgin biçimde daha güçlü performans göstermesi ve SAM 3D’nin eklenmesiyle bu model paketi, görsel AI, yaratıcı araçlar, bilimsel araştırmalar ve gerçek dünyadaki ürünler için yeni olanakların önünü açıyor.
AI hakkında daha fazla bilgi edinmek için topluluğumuza katıl ve GitHub depomuzu keşfet. Kendi görsel AI projenı oluşturmak istiyorsan lisans seçeneklerimize göz at. Sağlık hizmetlerinde AI ve perakendede Vision AI gibi uygulamalar hakkında daha fazla bilgi edinmek için çözümler sayfalarımızı ziyaret et.









