Ultralytics YOLO11 ile küçük nesne algılamayı keşfetme
Ultralytics YOLO11'in gözetim ve robotik gibi gerçek dünya uygulamalarında hızlı ve doğru küçük nesne algılama sağladığını keşfet.

Görsel yapay zekâ ile entegre edilen dronlar yerden yüzlerce metre yüksekte uçabilir ve video akışlarında yalnızca birkaç piksel olarak görünen bir kişiyi algılamaları beklenebilir. Aslında bu, sistemlerin bir görüntü içindeki çok küçük nesneleri tanımlaması gereken robotik, gözetim ve uzaktan algılama gibi uygulamalarda yaygın bir zorluktur.
Ancak geleneksel nesne algılama modelleri bunu yapmakta zorlanabilir. Görüntülerdeki ve videolardaki küçük nesneler çok sınırlı görsel bilgi içerir. Basitçe söylemek gerekirse, bir model onlara baktığında öğreneceği veya tanıyacağı fazla ayrıntı yoktur.
Bu modeller, temel olarak evrişimli sinir ağı (CNN) tabanlı bir mimariye dayanır. Görüntüler ağın katmanlarından geçirilir ve ham pikseller yerine ilgili örüntüleri öne çıkaran özellik haritalarına veya basitleştirilmiş temsillere dönüştürülür.
Görüntü ağın daha derin katmanlarına ilerledikçe bu özellik haritaları küçülür. Bu, hesaplamayı hızlandırır; ancak ince ayrıntıların kaybolabileceği anlamına da gelir.
Bu ayrıntılar küçük nesneler için kritik öneme sahiptir. Ayrıntılar kaybolduğunda bir bilgisayarlı görü modeli nesneyi algılamakta zorlanabilir; bu da daha az doğru veya tutarsız sınırlayıcı kutulara yol açabilir.
Gerçek zamanlı uçtan uca bilgisayarlı görü sistemleri işi daha da zorlaştırır. Yüksek çözünürlüklü görüntüler ayrıntıların korunmasına yardımcı olur; ancak çıkarımı yavaşlatır ve daha fazla GPU gücü gerektirir. Daha düşük çözünürlükler daha hızlı çalışır, fakat küçük nesneleri algılamak daha da zorlaşır.
Hız, doğruluk ve donanım sınırlamaları arasında sürekli bir denge kurmak gerekir. Güncel teknolojik gelişmeler sayesinde Ultralytics YOLO11 gibi bilgisayarlı görü modelleri ve yakında çıkacak Ultralytics YOLO26, bu ödünleşimi daha etkili biçimde yönetmek üzere tasarlanmıştır.

Şekil 1. Hava görüntülerinde küçük nesneleri algılamak için YOLO11 kullanımı (Kaynak)
Bu makalede, küçük nesne algılamanın neden zor olduğunu ve Ultralytics YOLO11'in bunu nasıl kolaylaştırabileceğini inceleyeceğiz. Hadi başlayalım!
Küçük nesne algılama nedir ve neden önemlidir?#
Küçük nesne algılama, yapay zekânın bir dalı olan bilgisayarlı görüde, görüntünün çok küçük bir bölümünü kaplayan nesneleri tanımlamaya ve konumlandırmaya odaklanan bir görevdir. Bu nesneler görüntüde genellikle dijital görüntünün en küçük birimleri olan sınırlı sayıda piksel ile temsil edilir. Bu durum, onları daha büyük ve daha net hedeflere (genellikle daha fazla piksel içeren) kıyasla algılamayı zorlaştırır.
Örneğin hava görüntülerindeki araçlar, fabrika zeminindeki aletler veya geniş açılı gözetim kameraları tarafından görüntülenen kişiler, görüntü içinde küçük nesneler olarak görünebilir. Bunları algılamak önemlidir; çünkü genellikle kritik bilgiler taşırlar ve gözetim gibi birçok gerçek dünya uygulaması doğru şekilde çalışmak için bu algılamalara bağlıdır.
Küçük nesneler gözden kaçırıldığında sistem performansı ve karar verme süreçleri etkilenebilir. İnsansız hava aracı (UAV) izleme buna iyi bir örnektir; yerdeki küçük ve hareketli bir nesnenin gözden kaçırılması navigasyon veya takip doğruluğunu etkileyebilir.
Küçük nesneleri algılamayla ilgili zorluklar#
Önceki sistemler, yoğun veya değişken sahnelerde zorlanan elle tasarlanmış özellikleri ve geleneksel bilgisayarlı görü yöntemlerini kullanıyordu. Günümüzde derin öğrenme modelleri çok daha iyi performans gösterse de hedefler görüntünün yalnızca küçük bir bölümünü kapladığında küçük hedefleri algılamak hâlâ zordur.
Şimdi, küçük nesneleri algılarken farklı gerçek dünya senaryolarında ortaya çıkan yaygın zorluklardan bazılarına bakalım.
Boyut, pikseller ve bilgi kaybı#
Küçük nesneler çok az piksel içerir; bu da modelin özellik çıkarma gibi aşamalarda öğrenebileceği görsel ayrıntı miktarını sınırlar. Sonuç olarak kenarlar, şekiller ve dokular gibi örüntüleri algılamak zorlaşır ve küçük nesnelerin arka planla birleşme olasılığı artar.
Görüntüler bir sinir ağının evrişimli katmanlarından geçerken piksellerdeki görsel bilgi, özellik haritalarına kademeli olarak sıkıştırılır. Bu, modelin verimli kalmasına yardımcı olur; ancak ince ayrıntıların da giderek kaybolmasına neden olur.

Şekil 2. Özellik haritaları bir görüntüdeki görsel örüntüleri temsil eder (Kaynak)
Küçük hedeflerde önemli ipuçları, algılama ağı harekete geçme fırsatı bulamadan kaybolabilir. Bu olduğunda konumlandırma daha az güvenilir hâle gelir ve sınırlayıcı kutular kayabilir, üst üste binebilir veya hedef nesneleri tamamen ıskalayabilir.
Örtülme, ölçek değişkenliği ve bağlam#
Boyutla ilgili zorluklar genellikle örtülmeden de kaynaklanır. Örtülme, nesneler, özellikle de küçük olanlar, sahnedeki diğer nesneler tarafından kısmen gizlendiğinde meydana gelir.
Bu durum hedefin görünür alanını azaltır ve nesne algılayıcının kullanabileceği bilgiyi sınırlar. Özellikle düşük çözünürlüklü girişle birleştiğinde, küçük bir örtülme bile algılama ağlarının kafasını karıştırabilir. Bunun ilginç bir örneği, yayaların, bisikletlerin veya araçların binalar, ağaçlar ya da diğer hareketli nesneler tarafından kısmen engellenebildiği VisDrone gibi UAV veri kümelerinde görülebilir.

Şekil 3. Küçük nesneleri gösteren VisDrone veri kümesinden bir örnek (Kaynak)
Benzer şekilde ölçek değişkenliği, aynı nesnenin mesafeye ve kamera konumuna bağlı olarak çok küçük veya görece büyük görünmesiyle yeni bir zorluk katmanı oluşturur. Bu engellere rağmen algılama algoritmaları, doğruluğu kaybetmeden bu küçük nesneleri farklı ölçeklerde tanımalıdır.
Bağlam da algılamada önemli bir rol oynar. Örneğin büyük nesneler genellikle yararlı görsel ipuçları sağlayan net çevreleriyle birlikte görünür. Buna karşılık küçük hedefler çoğu zaman bu bağlamsal bilgiden yoksundur; bu da örüntü tanımayı zorlaştırır.
Küçük nesne algılamadaki gizli metrik sorunu#
Kesişim üzerinden Birleşim (IoU) gibi yaygın değerlendirme metrikleri, tahmin edilen sınırlayıcı kutunun gerçek referans kutusuyla ne ölçüde örtüştüğünü ölçer. IoU büyük nesnelerde iyi çalışsa da küçük nesnelerdeki davranışı oldukça farklıdır.
Küçük nesneler yalnızca birkaç piksel kapladığından, tahmin edilen kutudaki küçük bir kayma bile orantısal olarak büyük bir hata oluşturabilir ve IoU puanını ciddi biçimde düşürebilir. Bu, nesne görüntüde görünür olsa bile küçük nesnelerin bir tahmini doğru kabul etmek için kullanılan standart IoU eşiğini karşılayamamasına sıkça yol açar.
Sonuç olarak konumlandırma hatalarının yanlış pozitif veya yanlış negatif olarak sınıflandırılma olasılığı artar. Bu sınırlamalar, araştırmacıları nesne algılama sistemlerinin küçük ve algılanması zor hedefleri nasıl değerlendirdiğini ve ele aldığını yeniden düşünmeye yöneltmiştir.
Çok ölçekli özellikler: Gerçek zamanlı küçük nesne algılamanın anahtarı#
Araştırmacılar küçük nesne algılamayı geliştirmek için çalışırken görsel bilgiyi birden çok ölçekte korumanın ve temsil etmenin temel öneme sahip olduğu netleşti. Bu görüş, güncel arXiv araştırmalarında ve IEEE Uluslararası Konferansları ile Avrupa Bilgisayarlı Görü Derneği (ECCV) gibi etkinliklerde sunulan makalelerde de vurgulanmaktadır.
Görüntüler bir sinir ağında daha derin katmanlara ilerledikçe küçük nesneler ayrıntılarını kaybedebilir veya tamamen kaybolabilir. Bu nedenle Ultralytics YOLO11 gibi modern bilgisayarlı görü modelleri daha iyi özellik çıkarımına güçlü biçimde odaklanır. Şimdi, onları daha iyi anlamak için özellik haritalarının ve özellik piramidi ağlarının temel kavramlarını ele alalım.
Özellik haritaları ve ölçek temsili#
Uzaktan algılama görüntüsü gibi bir giriş görüntüsü sinir ağına girdiğinde kademeli olarak özellik haritalarına dönüştürülür. Bunlar, kenarlar, şekiller ve dokular gibi görsel örüntüleri öne çıkaran basitleştirilmiş görüntü temsilleridir.
Ağ derinleştikçe bu özellik haritalarının uzamsal boyutu küçülür. Bu azaltma, modelin verimli çalışmasına ve üst düzey bilgilere odaklanmasına yardımcı olur. Ancak küçülen ve derin özellik haritaları uzamsal ayrıntıyı da azaltır.

Şekil 4. Özellik çıkarımı küçük nesne algılama için kritik öneme sahiptir. (Kaynak)
Büyük nesneler doğru algılama için yeterli görsel bilgiyi korurken küçük hedefler yalnızca birkaç ağ katmanından sonra kritik ayrıntılarını kaybedebilir. Bu olduğunda model küçük bir nesnenin var olduğunu bile tanımakta zorlanabilir. Küçük nesnelerin derin nesne algılama modellerinde gözden kaçırılmasının başlıca nedenlerinden biri budur.
Özellik piramidi ağları ve çok ölçekli öğrenme#
Özellik piramidi ağları (FPN), uzamsal ayrıntı kaybını ele almak için geliştirilmiştir ve modellerin küçük nesneleri daha etkili algılayabilmesi amacıyla birden çok katmandan gelen bilgileri birleştiren destekleyici bir modül olarak çalışır. Bu süreç, özellik toplama ve özellik füzyonu olarak da bilinir.
Sığ katmanlar ince uzamsal ayrıntıları sağlarken daha derin katmanlar anlamsal bağlam ekler ve etkili çok ölçekli özellik öğrenmesine olanak tanır. Özellik haritalarını yalnızca büyüten naif üst örneklemenin aksine FPN anlamlı bilgileri korur ve küçük nesne algılamayı geliştirir.
Modern yaklaşımlar, küçük hedeflerin algılanmasını daha da geliştirmek için uyarlanabilir özellik füzyonu ve bağlam farkındalıklı tasarımlar kullanarak bu fikri ilerletir. Başka bir deyişle FPN, modellerin hem büyük resmi hem de küçük ayrıntıları aynı anda görmesine yardımcı olur. Nesneler küçük olduğunda bu optimizasyon kritik öneme sahiptir.
Nesne algılama modelleri küçük nesneleri ele alacak şekilde nasıl gelişti?#
Nesne algılama modellerinin çok küçük olanlar da dâhil olmak üzere farklı boyutlardaki nesneleri daha iyi algılamak için zaman içinde nasıl gelişip ilerlediğine kısaca göz atalım:
- İlk algılama yöntemleri: İlk nesne algılama yaklaşımları, klasik görüntü işlemeye dayanan elle tasarlanmış özelliklere ve kural tabanlı algoritmalara dayanıyordu. Bu özellikler sabit olduğundan farklı görüntülerde performans düşüyordu.
- Makine öğrenmesi ve derin öğrenmenin ortaya çıkışı: Makine öğrenmesi ve derin öğrenmenin benimsenmesi, nesne algılama araştırmalarında büyük bir değişime yol açtı. Sinir ağları, önceden tanımlanmış kurallara dayanmak yerine görsel temsilleri doğrudan eğitim verilerinden öğrendi ve farklı nesne boyutları ile sahnelere uyarlanabilirliği geliştirdi.
- Evrişimli ağlar: Bu sinir ağları görüntülerdeki örüntüleri görmeyi öğrenir. Her katman, basit kenarlar ve renklerle başlayıp şekillere ve sonunda nesnelerin tamamına uzanan farklı ayrıntıları yakalar; bu da onları modern bilgisayarlı görü için vazgeçilmez kılar.
- İki aşamalı nesne algılayıcılar: Girshick ve Ren tarafından tanıtılan Faster R-CNN gibi iki aşamalı algılayıcılar önce aday bölgeler oluşturur, ardından bunları sınıflandırır. Bu yaklaşım küçük nesnelerde doğruluğu artırdı; ancak hesaplama maliyetini yükseltti ve gerçek zamanlı performansı düşürdü.
- Tek aşamalı nesne algılayıcılar: SSD (Tek Geçişli Algılayıcı) ve YOLO (Yalnızca Bir Kez Bakarsın) ailesi; YOLOv3, Ultralytics YOLOv5 ve daha sonraki Ultralytics YOLOv8 gibi tek aşamalı algılayıcılar, algılamayı tek geçişte gerçekleştirir. Bu tasarım, rekabetçi doğruluğu korurken çıkarım hızını önemli ölçüde artırır.
- En güncel son teknoloji modeller: Daha yeni nesne algılama modelleri gerçek zamanlı performansa ve uç dağıtıma daha fazla odaklanır. Ultralytics YOLO11 ve yakında çıkacak Ultralytics YOLO26 gibi güncel Ultralytics YOLO model sürümleri, yüksek doğruluğu düşük gecikmeli çıkarımla dengeleyecek şekilde tasarlanmıştır. Bu da onları sınırlı hesaplama gücüne sahip cihazlarda küçük hedefler de dâhil olmak üzere her boyuttaki nesneyi algılamak için uygun hâle getirir.
Küçük nesne algılama kullanım alanlarında Ultralytics YOLO11 kullanımı#
Artık küçük nesne algılamanın nasıl çalıştığını daha iyi anladığımıza göre Ultralytics YOLO11'in uygulanabileceği birkaç gerçek dünya uygulamasına bakalım.
UAV ve hava görüntüleme#
Yoğun bir şehir caddesinin üzerinde yüksekten uçan bir drone hayal et. Bu yükseklikten arabalar, bisikletler ve hatta insanlar ekranda yalnızca birkaç piksele küçülür.
UAV ve hava görüntüleme modülleri, ilgi duyulan nesnelerin küçük olduğu ve karmaşık arka planlarla çevrelendiği bu tür sahneleri sıklıkla yakalar; bu da nesnelerin bilgisayarlı görü modelleri tarafından algılanmasını zorlaştırır.
Bu tür senaryolarda Ultralytics YOLO11 ideal bir model seçimi olabilir. Örneğin YOLO11 gibi bir modelle donatılmış bir drone, görüntüde her nesne yalnızca küçük bir bölüm kaplasa bile sahnede hareket eden araçları, bisikletlileri ve yayaları algılayarak trafiği gerçek zamanlı izleyebilir. Bu, trafik yönetimi, kamu güvenliği veya kentsel planlama gibi uygulamalarda daha hızlı karar vermeyi ve daha doğru içgörüler elde etmeyi sağlar.
Robotik ve otomasyon#
Robotlar genellikle doğruluk ve zamanlamanın kritik olduğu ortamlarda kullanılır. Depolar, fabrikalar ve çiftlikler gibi ortamlarda bir robotun montaj hattındaki bir parça, paketteki bir etiket veya tarladaki küçük bir bitki tomurcuğu gibi çok küçük nesneleri tanıması ve hızlı tepki vermesi gerekebilir.
Bu boyuttaki nesneleri algılamak, özellikle kamera akışında yalnızca birkaç piksel olarak göründüklerinde veya diğer nesneler tarafından kısmen örtüldüklerinde karmaşık olabilir. Bu küçük ayrıntıların gözden kaçırılması otomasyonu yavaşlatabilir veya robotun bir görevi tamamlama becerisini etkileyebilir.
Ultralytics YOLO11 bu durumlarda fark yaratabilir. Geliştirilmiş özellik çıkarımı ve hızlı çıkarım yeteneği, robotların küçük nesneleri gerçek zamanlı algılamasını ve hemen harekete geçmesini sağlar.
Ultralytics YOLO11 ayrıca örnek bölütlemeyi destekler. Bu, robotların yalnızca genel sınırlayıcı kutuları konumlandırmak yerine nesne sınırlarını ve kavrama noktalarını daha hassas biçimde anlamasına yardımcı olabilir. Örneğin YOLO11 ile entegre edilmiş bir robotik kol, taşıma bandındaki küçük bileşenleri fark edebilir, tam şekillerini bölütleyebilir ve erişim dışına çıkmadan önce onları alabilir; böylece sistemin verimli ve güvenilir kalmasına yardımcı olur.
Ultralytics YOLO11'i küçük nesne algılama için etkili kılan nedir?#
Günümüzde bu kadar çok bilgisayarlı görü modeli varken Ultralytics YOLO11'i öne çıkaran şeyin ne olduğunu merak ediyor olabilirsin.
Küçük nesnelerin algılanması gereken uygulamalarda Ultralytics YOLO11'in iyi bir seçenek olmasının birkaç nedeni şunlardır:
- Daha iyi özellik çıkarımı: YOLO11, özellik çıkarımını geliştirmek için iyileştirilmiş bir omurga ve boyun mimarisi kullanır ve daha hassas nesne algılamaya olanak tanır.
- Ekosistem ve kullanım kolaylığı: Ultralytics Python paketi, YOLO11 gibi modelleri yüklemek, eğitmek, doğrulamak ve dağıtmak için yerleşik işlevler sağlayan bir kitaplıktır. Bu iş akışları yalnızca birkaç satır kod gerektirdiğinden ekipler küçük nesne algılama için modelleri hızla deneyebilir ve ince ayar yapabilir.
- Uç dağıtım için optimize edilmiştir: Ultralytics YOLO11, NVIDIA Jetson, Raspberry Pi ve endüstriyel kamera sistemleri gibi uç cihazlarda verimli şekilde çalışabilir. Basitçe söylemek gerekirse cihaz üzerinde doğrudan gerçek zamanlı görsel yapay zekâ görevlerini mümkün kılar.
Ultralytics YOLO11 ile küçük nesneleri algılarken kullanılabilecek pratik stratejiler#
Ultralytics YOLO11 gibi bir model kullanmanın yanı sıra ek açıklamalarını hazırlama biçimin, genel veri kümen ve model eğitim prosedürün algılama performansında önemli bir fark yaratabilir.
Odaklanman gereken noktaların kısa bir özeti şöyle:
- Uygun veri artırma: Ölçekleme veya kırpma gibi hafif veri artırma yöntemleri, modelin yeni görüntülere genelleme yapmasına yardımcı olabilir. Ancak agresif, büyük ölçekli artırma küçük nesneleri bozabilir veya ortadan kaldırabilir ve modelin bunları öğrenmesini zorlaştırabilir.
- Başarısızlık durumlarını inceleme: Modelin nesneleri nerede kaçırdığını veya yanlış tanımladığını analiz etmek bir temel oluşturmaya ve sorunların veri kümesinden mi, özellik çıkarımı sırasında bilgi kaybından mı yoksa eğitim ayarlarının değiştirilmesi gereğinden mi kaynaklandığını ortaya çıkarmaya yardımcı olur.
- Veri kümesi bileşimi: Veri kümen, modelin anlamlı örüntüler öğrenebilmesi için yeterli sayıda küçük nesne örneği içermeli ve eğitim sırasında büyük nesnelerin küçük nesneleri gölgede bırakmaması için dengeli kalmalıdır.
Önemli çıkarımlar#
Küçük hedefler bir bilgisayarlı görü modelinden geçen görüntülerde ayrıntı kaybettiği için küçük nesne algılama zordur. Ultralytics YOLO11, bu ayrıntıların korunma biçimini geliştirerek gerçek zamanlı performanstan ödün vermeden küçük nesne algılamayı daha güvenilir hâle getirir. Bu denge, YOLO11'in gerçek dünya uygulamalarında doğru ve verimli algılamayı desteklemesini sağlar.
Büyüyen topluluğumuza katıl! Yapay zekâ hakkında daha fazla bilgi edinmek için GitHub depomuzu keşfet. Çözüm sayfalarımızı ziyaret ederek perakendede bilgisayarlı görü ve otomotiv sektöründe yapay zekâ gibi yenilikleri keşfet. Bilgisayarlı görüyle bugün geliştirmeye başlamak için lisanslama seçeneklerimize göz at.









