Nesne algılama ve Ultralytics' YOLO modellerinin evrimi
Nesne tespitinin evrimine birlikte göz atalım. YOLO (Yalnızca Bir Kez Bakarsın) modellerinin son yıllarda nasıl geliştiğine odaklanacağız.

Bilgisayarlı görü, makineleri insanların gerçek dünyayı algılama biçimine benzer şekilde görüntüleri ve videoları görmeyi ve anlamayı öğretmeye odaklanan bir yapay zekâ (AI) alt alanıdır. Nesneleri tanımak veya eylemleri belirlemek insanlar için doğal olsa da makineler söz konusu olduğunda bu görevler için özel ve uzmanlaşmış bilgisayarlı görü teknikleri gerekir. Örneğin, bilgisayarlı görüdeki temel görevlerden biri, görüntüler veya videolar içindeki nesneleri belirlemeyi ve konumlandırmayı içeren nesne algılamadır.
1960'lı yıllardan bu yana araştırmacılar, bilgisayarların nesneleri algılama biçimini geliştirmek için çalışıyor. Şablon eşleme gibi ilk yöntemlerde, eşleşmeleri bulmak için önceden tanımlanmış bir şablon görüntü üzerinde kaydırılıyordu. Yenilikçi olmalarına rağmen bu yaklaşımlar nesne boyutu ve yönündeki değişiklikler ile aydınlatma koşullarında zorlanıyordu. Günümüzde, kısmen gizlenmiş nesneler olarak bilinen küçük ve kısmen örtülü nesneleri bile etkileyici bir doğrulukla algılayabilen Ultralytics YOLO11 gibi gelişmiş modeller bulunuyor.
Bilgisayarlı görü gelişmeye devam ederken bu teknolojilerin nasıl geliştirildiğine bakmak önemlidir. Bu makalede nesne algılamanın evrimini inceleyecek ve YOLO (You Only Look Once) modellerinin dönüşümüne ışık tutacağız. Hadi başlayalım!
Bilgisayarlı görünün kökenleri#
Nesne algılamaya geçmeden önce bilgisayarlı görünün nasıl ortaya çıktığına bakalım. Bilgisayarlı görünün kökenleri, bilim insanlarının beynin görsel bilgiyi nasıl işlediğini araştırmaya başladığı 1950'lerin sonlarına ve 1960'ların başlarına uzanır. Kediler üzerinde yaptıkları deneylerde araştırmacılar David Hubel ve Torsten Wiesel, beynin kenarlar ve çizgiler gibi basit desenlere tepki verdiğini keşfetti. Bu keşif, görsel sistemlerin daha karmaşık desenlere geçmeden önce görüntülerdeki kenarlar gibi temel özellikleri algılayıp tanıdığı fikrine, yani özellik çıkarımı kavramına temel oluşturdu.

Şekil 1. Bir kedinin beyninin ışık çubuklarına nasıl tepki verdiğini öğrenmek, bilgisayarlı görmede özellik çıkarımının geliştirilmesine yardımcı oldu.
Aynı dönemde fiziksel görüntüleri dijital biçimlere dönüştürebilen yeni bir teknoloji ortaya çıktı ve makinelerin görsel bilgiyi nasıl işleyebileceğine yönelik ilgiyi artırdı. 1966'da Massachusetts Teknoloji Enstitüsü'nün (MIT) Summer Vision Project projesi bu çalışmaları daha ileri taşıdı. Proje tam anlamıyla başarılı olamasa da görüntülerde ön planı arka plandan ayırabilecek bir sistem oluşturmayı amaçladı. Görü yapay zekâsı topluluğundaki birçok kişi için bu proje, bilgisayarlı görünün bilimsel bir alan olarak resmî başlangıcını temsil eder.
Nesne algılamanın tarihini anlamak#
Bilgisayarlı görü 1990'ların sonlarında ve 2000'lerin başlarında ilerledikçe nesne algılama yöntemleri, şablon eşleme gibi temel tekniklerden daha gelişmiş yaklaşımlara geçti. Popüler yöntemlerden biri, yüz algılama gibi görevlerde yaygın olarak kullanılan Haar Cascade'di. Bu yöntem, görüntüleri kayan bir pencereyle tarayarak görüntünün her bölümünde kenarlar veya dokular gibi belirli özellikleri kontrol ediyor, ardından bu özellikleri birleştirerek yüzler gibi nesneleri algılıyordu. Haar Cascade önceki yöntemlerden çok daha hızlıydı.

Şekil 2. Yüz Algılama için Haar Cascade Kullanımı.
Bunlarla birlikte Yönlendirilmiş Gradyan Histogramı (HOG) ve Destek Vektör Makineleri (SVMs) gibi yöntemler de kullanıma sunuldu. HOG, görüntünün küçük bölümlerinde ışık ve gölgelerin nasıl değiştiğini analiz etmek için kayan pencere tekniğini kullanarak nesnelerin şekillerine göre belirlenmesine yardımcı oldu. Ardından SVMs, nesnenin kimliğini belirlemek için bu özellikleri sınıflandırdı. Bu yöntemler doğruluğu artırdı, ancak gerçek dünya ortamlarında hâlâ zorlanıyor ve günümüz tekniklerine kıyasla daha yavaş kalıyordu.
Gerçek zamanlı nesne algılama ihtiyacı#
2010'lu yıllarda derin öğrenmenin ve Evrişimli Sinir Ağlarının (CNNs) yükselişi, nesne algılamada büyük bir değişim yarattı. CNNs, bilgisayarların büyük miktarda veriden önemli özellikleri otomatik olarak öğrenmesini mümkün kıldı ve bu da algılama doğruluğunu büyük ölçüde artırdı.
R-CNN (Bölge tabanlı Evrişimli Sinir Ağları) gibi ilk modeller, kesinlikte büyük bir gelişme sağladı ve nesnelerin eski yöntemlere göre daha doğru belirlenmesine yardımcı oldu.
Ancak bu modeller görüntüleri birden fazla aşamada işlediği için yavaştı; bu da onları otonom araçlar veya video gözetimi gibi alanlardaki gerçek zamanlı uygulamalar için kullanışsız hâle getiriyordu.
Süreci hızlandırmaya odaklanılarak daha verimli modeller geliştirildi. Fast R-CNN ve Faster R-CNN gibi modeller, ilgi bölgelerinin seçilme biçimini iyileştirerek ve algılama için gereken adımların sayısını azaltarak yardımcı oldu. Bu, nesne algılamayı hızlandırsa da anında sonuç gerektiren birçok gerçek dünya uygulaması için hâlâ yeterince hızlı değildi. Gerçek zamanlı algılamaya yönelik artan talep, hız ile doğruluğu dengeleyebilen daha hızlı ve verimli çözümlerin geliştirilmesini teşvik etti.

Şekil 3. R-CNN, Fast R-CNN ve Faster R-CNN Hızlarının Karşılaştırılması.
YOLO (You Only Look Once) modelleri: Önemli bir dönüm noktası#
YOLO, görüntü ve videolardaki birden fazla nesnenin gerçek zamanlı olarak algılanmasını sağlayarak bilgisayarlı görüde yeni bir dönem başlatan ve önceki algılama yöntemlerinden oldukça farklılaşan bir nesne algılama modelidir. YOLO mimarisi, algılanan her nesneyi ayrı ayrı analiz etmek yerine nesne algılamayı tek bir görev olarak ele alır ve CNNs kullanarak nesnelerin hem konumunu hem de sınıfını tek seferde tahmin eder.
Model, bir görüntüyü her bölümün kendi alanındaki nesneleri algılamaktan sorumlu olduğu bir ızgaraya böler. Her bölüm için birden fazla tahmin üretir ve daha düşük güvene sahip sonuçları filtreleyerek yalnızca doğru olanları korur.

Şekil 4. YOLO'nun Nasıl Çalıştığına Genel Bakış.
YOLO'nun bilgisayarlı görü uygulamalarına sunulması, nesne algılamayı önceki modellere göre çok daha hızlı ve verimli hâle getirdi. Hızı ve doğruluğu sayesinde YOLO, üretim, sağlık hizmetleri ve robotik gibi sektörlerde gerçek zamanlı çözümler için kısa sürede popüler bir tercih oldu.
Dikkat edilmesi gereken bir diğer önemli nokta, YOLO açık kaynaklı olduğu için geliştiricilerin ve araştırmacıların onu sürekli olarak iyileştirebilmesi ve bunun daha gelişmiş sürümlerin ortaya çıkmasını sağlamasıdır.
YOLO'dan Ultralytics YOLO11'e giden yol#
YOLO modelleri, her sürümün geliştirmelerini temel alarak zaman içinde istikrarlı biçimde iyileşti. Bu geliştirmeler, daha iyi performansın yanı sıra modellerin farklı teknik deneyim düzeylerine sahip kişiler için kullanımını da kolaylaştırdı.
Örneğin Ultralytics YOLOv5 kullanıma sunulduğunda model dağıtımı, PyTorch ile daha basit hâle geldi ve daha geniş bir kullanıcı kitlesinin gelişmiş yapay zekâ ile çalışmasına olanak tanıdı. Doğruluk ile kullanılabilirliği bir araya getirerek daha fazla kişinin kodlama uzmanı olmasına gerek kalmadan nesne algılamayı uygulayabilmesini sağladı.

Şekil 5. YOLO Modellerinin Evrimi.
Ultralytics YOLOv8, örnek segmentasyonu gibi görevlere destek ekleyerek ve modelleri daha esnek hâle getirerek bu ilerlemeyi sürdürdü. YOLO'yu hem temel hem de daha karmaşık uygulamalarda kullanmak kolaylaştı ve model çeşitli senaryolarda yararlı hâle geldi.
En yeni model olan Ultralytics YOLO11 ile daha ileri optimizasyonlar yapıldı. Parametre sayısı azaltılırken doğruluk artırıldığı için model artık gerçek zamanlı görevlerde daha verimli. İster deneyimli bir geliştirici ister yapay zekâya yeni başlayan biri ol, YOLO11 kolayca erişilebilen gelişmiş bir nesne algılama yaklaşımı sunuyor.
Ultralytics YOLO11'i tanıma: Yeni özellikler ve geliştirmeler#
Ultralytics'in yıllık hibrit etkinliğinde kullanıma sunulan YOLO11, YOLO Vision 2024 (YV24), YOLOv8 ile aynı bilgisayarlı görü görevlerini destekler; bunlar arasında nesne algılama, örnek segmentasyonu, görüntü sınıflandırma ve poz tahmini bulunur. Böylece kullanıcılar iş akışlarını değiştirmelerine gerek kalmadan bu yeni modele kolayca geçebilir. Ayrıca YOLO11'in yükseltilmiş mimarisi, tahminleri daha da kesin hâle getirir. Hatta YOLO11m, COCO veri kümesinde YOLOv8m'den %22 daha az parametreyle daha yüksek ortalama hassasiyet (mAP) elde eder.
YOLO11, akıllı telefonlardan ve diğer uç cihazlardan daha güçlü bulut sistemlerine kadar çeşitli platformlarda verimli çalışacak şekilde tasarlanmıştır. Bu esneklik, gerçek zamanlı uygulamalar için farklı donanım yapılandırmalarında sorunsuz performans sağlar. Bunun yanı sıra YOLO11 daha hızlı ve verimlidir; hesaplama maliyetlerini azaltır ve çıkarım sürelerini kısaltır. İster Ultralytics Python paketini ister kodsuz Ultralytics HUB'ı kullanıyor ol, YOLO11'i mevcut iş akışlarına entegre etmek kolaydır.
YOLO modellerinin ve nesne algılamanın geleceği#
Gelişmiş nesne algılamanın gerçek zamanlı uygulamalar ve uç yapay zekâ üzerindeki etkisi, sektörler genelinde şimdiden hissediliyor. Petrol ve gaz, sağlık hizmetleri ve perakende gibi sektörler yapay zekâya giderek daha fazla güvenirken hızlı ve hassas nesne algılamaya yönelik talep de artmaya devam ediyor. Ultralytics YOLO11, sınırlı hesaplama gücüne sahip cihazlarda bile yüksek performanslı algılama sağlayarak bu talebi karşılamayı amaçlıyor.
Uç yapay zekâ geliştikçe Ultralytics YOLO11 gibi nesne algılama modellerinin, hız ve doğruluğun kritik olduğu ortamlarda gerçek zamanlı karar alma için daha da önemli hâle gelmesi muhtemeldir. Tasarım ve uyarlanabilirlik alanlarında süren geliştirmelerle nesne algılamanın geleceği, çeşitli uygulamalarda daha fazla yenilik getirecek gibi görünüyor.
Önemli çıkarımlar#
Nesne algılama, basit yöntemlerden bugün gördüğümüz gelişmiş derin öğrenme tekniklerine evrilerek uzun bir yol kat etti. YOLO modelleri bu ilerlemenin merkezinde yer alarak farklı sektörlerde daha hızlı ve doğru gerçek zamanlı algılama sağladı. Ultralytics YOLO11 bu mirası temel alır; verimliliği artırır, hesaplama maliyetlerini azaltır ve doğruluğu geliştirerek onu çeşitli gerçek zamanlı uygulamalar için güvenilir bir tercih hâline getirir. Yapay zekâ ve bilgisayarlı görü alanlarındaki süregelen ilerlemelerle nesne algılamanın geleceği parlak görünüyor; hız, kesinlik ve uyarlanabilirlik alanlarında daha da fazla gelişme için fırsat bulunuyor.
Yapay zekâyı merak ediyor musun? Öğrenmeye devam etmek için topluluğumuzla bağlantıda kal! Yapay zekâyı üretim ve sağlık hizmetleri gibi sektörlerde yenilikçi çözümler oluşturmak için nasıl kullandığımızı keşfetmek üzere GitHub depomuz sayfamıza göz at. 🚀









