Görüntü modellerinin bir geçmişi
Görüntü modellerinin geçmişini, başarılarını, zorluklarını ve gelecek yönelimlerini keşfet.

Bilgisayarlı görü nedir#
Bir kameranın yüzünü tanıdığı, ruh halini analiz ettiği ve tercihlerine göre uyarlanmış ürünler önerdiği bir mağazaya girdiğini hayal et; üstelik bunların hepsi gerçek zamanlı olarak gerçekleşiyor. Bu bir bilim kurgu değil, modern vision modelleri tarafından mümkün kılınan bir gerçektir. Fortune Business Insight raporuna göre, küresel bilgisayarlı görü pazar büyüklüğü 2023 yılında 20,31 milyar ABD doları olarak değerlenmiş olup 2024'te 25,41 milyar ABD dolarından 2032'ye kadar 175,72 milyar ABD dolarına çıkması öngörülmektedir; bu da bu teknolojinin çeşitli endüstrilerdeki hızlı ilerlemelerini ve artan benimsenme oranını yansıtmaktadır.
Bilgisayarlı görü alanı, bilgisayarların görüntülerdeki nesneleri algılamasını, tanımlamasını ve analiz etmesini sağlar. Diğer yapay zeka ile ilgili alanlara benzer şekilde, bilgisayarlı görü de son birkaç on yılda hızlı bir evrim geçirerek dikkate değer ilerlemeler kaydetti.
Bilgisayarlı görü tarihi oldukça uzundur. İlk yıllarında computer vision modelleri, basit şekilleri ve kenarları tespit edebiliyor; genellikle geometrik kalıpları tanımak veya açık ve koyu alanları ayırt etmek gibi temel görevlerle sınırlı kalıyordu. Ancak günümüzün modelleri; gerçek zamanlı nesne tespiti, yüz tanıma ve hatta yüz ifadelerinden duyguları yorumlama gibi karmaşık görevleri olağanüstü bir doğruluk ve verimlilikle gerçekleştirebilmektedir. Bu dramatik gelişim, hesaplama gücündeki inanılmaz adımları, algoritmik sofistikeleşmeyi ve eğitim için devasa miktarda verinin kullanılabilirliğini gözler önüne sermektedir.
Bu makalede, bilgisayarlı görünün evrimindeki temel dönüm noktalarını keşfedeceğiz. İlk başlangıçlarına yolculuk yapacak, Konvolüsyonel Sinir Ağlarının (CNN) dönüştürücü etkisini inceleyecek ve sonrasında gelen önemli gelişmeleri ele alacağız.
Bilgisayarlı görünün ilk başlangıçları#
Diğer yapay zeka alanlarında olduğu gibi, bilgisayarlı görü alanının ilk gelişimi temel araştırmalar ve teorik çalışmalarla başladı. Önemli bir dönüm noktası, Lawrence G. Roberts'ın 1960'ların başındaki "Machine Perception of Three-Dimensional Solids" başlıklı tezinde belgelenen 3D nesne tanıma üzerine çığır açan çalışmasıydı. Onun katkıları, alandaki gelecekteki gelişmelerin temelini attı.
İlk algoritmalar - kenar algılama#
Erken bilgisayarlı görü araştırmaları, kenar algılama ve öznitelik çıkarma gibi görüntü işleme tekniklerine odaklandı. 1960'ların sonunda geliştirilen Sobel operatörü gibi algoritmalar, görüntü yoğunluğunun gradyanını hesaplayarak kenarları algılayan ilk yöntemlerden biriydi.

Fig 1. Sol tarafın orijinal nesneyi, sağ tarafın ise kenar tespiti yapılmış versiyonunu gösterdiği kenar tespitini gösteren bir görsel.
Sobel ve Canny kenar dedektörleri gibi teknikler, görüntülerdeki sınırların tanımlanmasında hayati bir rol oynadı; bu sınırlar nesneleri tanımak ve sahneleri anlamak için gereklidir.
Makine öğrenimi ve bilgisayarlı görü#
Örüntü tanıma#
1970'lerde örüntü tanıma, bilgisayarlı görünün önemli bir alanı olarak ortaya çıktı. Araştırmacılar, görüntülerdeki şekilleri, dokuları ve nesneleri tanımak için yöntemler geliştirdiler; bu yöntemler daha karmaşık görü görevlerinin önünü açtı.

Şekil 2. Örüntü Tanıma.
Örüntü tanıma için kullanılan ilk yöntemlerden biri, bir görüntünün en iyi eşleşmeyi bulmak için bir şablon kümesiyle karşılaştırıldığı şablon eşleştirmesiydi. Bu yaklaşım, ölçek, döndürme ve gürültü değişimlerine karşı hassasiyeti nedeniyle sınırlıydı.

Fig 3. Sağdaki görselin içinde bulunan sol taraftaki bir şablon.
Erken bilgisayarlı görü sistemleri, zamanın sınırlı hesaplama gücüyle kısıtlıydı. 1960'lar ve 1970'lerdeki bilgisayarlar hantal, pahalı ve sınırlı işleme yeteneklerine sahipti.
Derin Öğrenme ile oyunun kurallarını değiştirmek#
Derin Öğrenme ve Konvolüsyonel Sinir Ağları#
Derin öğrenme ve Konvolüsyonel Sinir Ağları (CNN), bilgisayarlı görü alanında çok önemli bir anı işaret etti. Bu ilerlemeler, bilgisayarların görsel verileri yorumlama ve analiz etme şeklini çarpıcı biçimde değiştirdi ve daha önce imkansız olduğu düşünülen çok çeşitli uygulamaları mümkün kıldı.
CNN'ler nasıl çalışır?#

Fig 4. Evrişimli Sinir Ağının (CNN) Mimarisi.
- Evrişimli Katmanlar: CNN'ler, görüntüler veya diziler gibi yapılandırılmış ızgara benzeri verileri işlemek için tasarlanmış bir derin öğrenme modeli türü olan ve filtreler ya da çekirdekler kullanarak bir görüntüyü taramak amacıyla hiyerarşik kalıpları otomatik olarak öğrenen evrişimli katmanları kullanır. Bu filtreler, görüntü üzerinde kayarak ve nokta çarpımları hesaplayarak kenarlar, dokular ve renkler gibi çeşitli özellikleri tespit eder. Her filtre, görüntüdeki belirli kalıpları etkinleştirerek modelin hiyerarşik özellikleri öğrenmesini sağlar.
- Aktivasyon Fonksiyonları: Evrişimden sonra, sinir ağlarının verilerdeki doğrusal olmayan ilişkileri verimli bir şekilde öğrenmesine yardımcı olmak üzere, pozitif olması durumunda girdiyi doğrudan ve aksi takdirde sıfır döndüren popüler bir derin öğrenme aktivasyon fonksiyonu olan ReLU (Rectified Linear Unit) gibi aktivasyon fonksiyonları kullanılır. Bu, ağın karmaşık kalıpları ve temsilleri öğrenmesine yardımcı olur.
- Havuzlama katmanları, özellik haritasının boyutluluğunu azaltan bir alt örnekleme işlemi sağlayarak, hesaplama maliyetini ve aşırı uyumu (overfitting) azaltırken en ilgili özellikleri çıkarmaya yardımcı olur.
- Tam Bağlantılı (Fully Connected) Katmanlar: Bir CNN'in son katmanları, tahminler yapmak için konvolüsyonel ve havuzlama katmanları tarafından çıkarılan özellikleri yorumlayan tam bağlantılı katmanlardır. Bu katmanlar geleneksel sinir ağlarındakilere benzerdir.
CNN görüntü modellerinin evrimi#
Vision modellerinin yolculuğu oldukça kapsamlı olmuş ve en dikkate değer olanlardan bazılarına ev sahipliği yapmıştır:
-
LeNet (1989): LeNet, ilk CNN mimarilerinden biriydi ve öncelikle el yazısı çeklerdeki rakamları tanımak için kullanıldı. Başarısı, daha karmaşık CNN'ler için temel oluşturdu ve derin öğrenmenin görüntü işlemedeki potansiyelini kanıtladı.
-
AlexNet (2012): AlexNet, ImageNet yarışmasında mevcut modellerden önemli ölçüde daha iyi performans göstererek derin öğrenmenin gücünü ortaya koydu. Bu model ReLU aktivasyonlarını, dropout'u ve veri artırmayı kullanarak görüntü sınıflandırmada yeni standartlar belirledi ve CNN'lere karşı yaygın bir ilgi uyandırdı.
-
VGGNet (2014): Daha küçük konvolüsyonel filtreler (3x3) kullanarak VGGNet, görüntü sınıflandırma görevlerinde etkileyici sonuçlar elde etti ve daha yüksek doğruluk elde etmede ağ derinliğinin önemini pekiştirdi.
-
ResNet (2015): ResNet, kalıntı öğrenmeyi (residual learning) tanıtarak derin ağlardaki bozulma sorununu ele aldı. Bu yenilik, çok daha derin ağların eğitilmesine olanak tanıdı ve çeşitli bilgisayarlı görü görevlerinde en üst düzey performansa yol açtı.
-
YOLO (You Only Look Once): YOLO, nesne tespitini tek bir regresyon problemi olarak ele alıp tam görüntülerden tek bir değerlendirmede doğrudan sınırlayıcı kutuları ve sınıf olasılıklarını tahmin ederek bu alanda devrim yarattı. Bu yaklaşım, benzeri görülmemiş bir hız ve doğrulukla gerçek zamanlı nesne tespitini mümkün kıldı; bu da onu otonom sürüş ve gözetim gibi anlık işleme gerektiren uygulamalar için uygun hale getirdi.
Bilgisayarlı görü uygulamaları#
Sağlık hizmetleri#
Bilgisayarlı görü kullanımları oldukça fazladır. Örneğin, Ultralytics YOLOv8 gibi vision modelleri, tıbbi görüntülemede kanser ve diyabetik retinopati gibi hastalıkları tespit etmek için kullanılır. X-ışınlarını, MR'ları ve BT taramalarını yüksek hassasiyetle analiz ederek anormallikleri erken aşamada belirlerler. Bu erken tespit özelliği, zamanında müdahalelere ve iyileştirilmiş hasta sonuçlarına olanak tanır.

Fig 5. Ultralytics YOLOv8 Kullanılarak Beyin Tümörü Tespiti.
Çevresel koruma#
Computer vision modelleri, yaban hayatı habitatlarından gelen görüntüleri ve videoları analiz ederek nesli tükenmekte olan türlerin izlenmesine ve korunmasına yardımcı olur. Hayvanların davranışlarını tanımlar ve takip ederek popülasyonları ile hareketleri hakkında veri sağlarlar. Bu teknoloji, kaplanlar ve filler gibi türleri korumak için koruma stratejilerine ve politika kararlarına bilgi sağlar.
Görüntüleme yapay zekasının yardımıyla, orman yangınları ve ormansızlaşma gibi diğer çevresel tehditler izlenebilir ve yerel yetkililerin hızlı müdahale süreleri sağlanabilir.

Fig 6. Bir orman yangınının uydu görüntüsü.
Zorluklar ve gelecek yönelimleri#
Zaten önemli başarılar elde etmiş olsalar da, aşırı karmaşıklıkları ve geliştirilmelerinin zorlu doğası nedeniyle, görüntü modelleri sürekli araştırma ve gelecekteki ilerlemeler gerektiren çok sayıda zorlukla karşı karşıyadır.
Yorumlanabilirlik ve açıklanabilirlik#
Görüntü modelleri, özellikle derin öğrenme modelleri, genellikle sınırlı şeffaflığa sahip "kara kutular" olarak görülür. Bunun nedeni, bu tür modellerin inanılmaz derecede karmaşık olmasıdır. Yorumlanabilirlik eksikliği, özellikle sağlık hizmetleri gibi kritik uygulamalarda güven ve hesap verebilirliği engeller.
Hesaplama gereksinimleri#
En son teknoloji yapay zeka modellerini eğitmek ve dağıtmak, önemli hesaplama kaynakları gerektirir. Bu durum, genellikle büyük miktarlarda görüntü ve video verisinin işlenmesini gerektiren görüntü modelleri için özellikle geçerlidir. En veri yoğun eğitim girdileri arasında yer alan yüksek çözünürlüklü görüntüler ve videolar, hesaplama yükünü artırır. Örneğin, tek bir HD görüntü birkaç megabayt depolama alanı kaplayabilir, bu da eğitim sürecini kaynak yoğun ve zaman alıcı hale getirir.
Bu durum, etkili görüntü modelleri geliştirmede yer alan kapsamlı verileri ve karmaşık hesaplamaları yönetmek için güçlü donanım ve optimize edilmiş bilgisayarlı görü algoritmaları gerektirir. Daha verimli mimariler, model sıkıştırma ve GPU'lar ve TPU'lar gibi donanım hızlandırıcıları üzerine yapılan araştırmalar, görüntü modellerinin geleceğini ilerletecek kilit alanlardır.
Bu iyileştirmeler hesaplama taleplerini azaltmayı ve işleme verimliliğini artırmayı amaçlar. Dahası, Ultralytics YOLOv8 gibi gelişmiş ön eğitilmiş modellerden yararlanmak, kapsamlı eğitim ihtiyacını önemli ölçüde azaltabilir, geliştirme sürecini kolaylaştırabilir ve verimliliği artırabilir.
Sürekli gelişen bir manzara#
Günümüzde vision modellerinin uygulamaları, tümör tespiti gibi sağlık hizmetlerinden trafik izleme gibi günlük kullanımlara kadar yaygındır. Bu gelişmiş modeller, daha önce hayal bile edilemeyen gelişmiş doğruluk, verimlilik ve yetenekler sağlayarak sayısız endüstriye yenilik getirmiştir.
Teknoloji ilerlemeye devam ettikçe, görüntü modellerinin yaşamın ve endüstrinin çeşitli yönlerini yenileme ve iyileştirme potansiyeli sınırsız kalmaya devam ediyor. Bu süregelen evrim, bilgisayarlı görü alanında devam eden araştırma ve geliştirmenin önemini vurgulamaktadır.
Vision AI'ın geleceğini merak ediyor musun? En son gelişmeler hakkında daha fazla bilgi için Ultralytics Belgelerini incele ve Ultralytics GitHub ile YOLOv8 GitHub üzerindeki projelerine göz at. Ek olarak, yapay zeka uygulamalarının çeşitli endüstrilerdeki etkileri hakkında bilgi edinmek için Otonom Araçlar ve Üretim çözümleri sayfaları özellikle faydalı bilgiler sunmaktadır.






