Görüntü modellerinin tarihi
Görüntü modellerinin tarihini, başarılarını, zorluklarını ve gelecekteki yönelimlerini keşfet.

Bilgisayarlı görü nedir#
Bir kameranın yüzünü tanıdığı, ruh hâlini analiz ettiği ve tercihlerine göre uyarlanmış ürünler önerdiği bir mağazaya girdiğini hayal et; üstelik tüm bunlar gerçek zamanlı gerçekleşiyor. Bu, bilim kurgu değil, modern görme modellerinin mümkün kıldığı bir gerçekliktir. Fortune Business Insight'ın raporuna göre küresel bilgisayarlı görü pazarının büyüklüğü 2023'te 20,31 milyar USD olarak değerlendirildi ve 2024'te 25,41 milyar USD'den 2032'ye kadar 175,72 milyar USD'ye yükselmesi bekleniyor. Bu, bu teknolojinin çeşitli sektörlerde hızla ilerlediğini ve giderek daha fazla benimsendiğini gösteriyor.
Bilgisayarlı görü alanı, bilgisayarların görüntülerdeki nesneleri algılamasını, tanımlamasını ve analiz etmesini sağlar. Diğer yapay zekâ ile ilgili alanlarda olduğu gibi bilgisayarlı görü de son birkaç on yılda hızlı bir evrim geçirmiş ve dikkate değer ilerlemeler kaydetmiştir.
Bilgisayarlı görünün tarihi oldukça kapsamlıdır. İlk yıllarında bilgisayarlı görü modelleri basit şekilleri ve kenarları algılayabiliyor, çoğunlukla geometrik desenleri tanıma veya aydınlık ve karanlık alanları ayırt etme gibi temel görevlerle sınırlı kalıyordu. Ancak günümüz modelleri, gerçek zamanlı nesne algılama, yüz tanıma ve hatta yüz ifadelerinden duyguları olağanüstü doğruluk ve verimlilikle yorumlama gibi karmaşık görevleri gerçekleştirebiliyor. Bu çarpıcı ilerleme, hesaplama gücü, algoritmik gelişmişlik ve eğitim için büyük miktarda verinin kullanılabilirliği alanlarında kaydedilen inanılmaz gelişimi ortaya koyuyor.
Bu makalede bilgisayarlı görünün evrimindeki önemli kilometre taşlarını inceleyeceğiz. İlk başlangıçlarından başlayacak, Evrişimli Sinir Ağlarının (CNNs) dönüştürücü etkisini ele alacak ve ardından gelen önemli ilerlemeleri inceleyeceğiz.
Bilgisayarlı görünün ilk başlangıçları#
Diğer yapay zekâ alanlarında olduğu gibi bilgisayarlı görünün ilk gelişimi de temel araştırmalar ve teorik çalışmalarla başladı. Önemli kilometre taşlarından biri, Lawrence G. Roberts'ın 3B nesne tanıma konusundaki öncü çalışmasıydı. Bu çalışma, 1960'ların başlarında hazırladığı "Machine Perception of Three-Dimensional Solids" başlıklı tezinde belgelenmiştir. Katkıları, alandaki gelecekteki gelişmelerin temelini oluşturdu.
İlk algoritmalar - kenar algılama#
İlk bilgisayarlı görü araştırmaları, kenar algılama ve özellik çıkarma gibi görüntü işleme tekniklerine odaklandı. 1960'ların sonlarında geliştirilen Sobel operatörü gibi algoritmalar, görüntü yoğunluğunun gradyanını hesaplayarak kenarları algılayan ilk yöntemler arasındaydı.

Şekil 1. Solda orijinal nesnenin, sağda ise kenarları algılanmış sürümünün gösterildiği bir kenar algılama görüntüsü.
Sobel ve Canny kenar algılayıcıları gibi teknikler, görüntülerdeki sınırların belirlenmesinde önemli bir rol oynadı. Bu sınırlar, nesneleri tanımak ve sahneleri anlamak için gereklidir.
Makine öğrenmesi ve bilgisayarlı görü#
Örüntü tanıma#
1970'lerde örüntü tanıma, bilgisayarlı görünün önemli bir alanı olarak ortaya çıktı. Araştırmacılar görüntülerdeki şekilleri, dokuları ve nesneleri tanımaya yönelik yöntemler geliştirdi; bu yöntemler daha karmaşık görme görevlerinin önünü açtı.

Şekil 2. Örüntü tanıma.
Örüntü tanımaya yönelik ilk yöntemlerden biri, bir görüntünün en iyi eşleşmeyi bulmak için bir şablon kümesiyle karşılaştırıldığı şablon eşleştirmeydi. Bu yaklaşım ölçek, döndürme ve gürültü değişikliklerine duyarlı olması nedeniyle sınırlıydı.

Şekil 3. Soldaki bir şablonun sağdaki görüntü içinde bulunduğu örnek.
İlk bilgisayarlı görü sistemleri, o dönemin sınırlı hesaplama gücü nedeniyle kısıtlıydı. 1960'lar ve 1970'lerdeki bilgisayarlar hantal ve pahalıydı; işlem kapasiteleri de sınırlıydı.
Derin Öğrenmeyle oyunun kurallarını değiştirmek#
Derin Öğrenme ve Evrişimli Sinir Ağları#
Derin öğrenme ve Evrişimli Sinir Ağları (CNNs), bilgisayarlı görü alanında dönüm noktası niteliğinde bir gelişme oldu. Bu ilerlemeler, bilgisayarların görsel verileri yorumlama ve analiz etme biçimini büyük ölçüde dönüştürerek daha önce imkânsız olduğu düşünülen çok çeşitli uygulamaları mümkün kıldı.
CNNs nasıl çalışır?#

Şekil 4. Bir Evrişimli Sinir Ağının (CNN) mimarisi.
- Evrişimli Katmanlar: CNNs, görüntüler veya diziler gibi yapılandırılmış ızgara benzeri verileri işlemek üzere tasarlanmış ve hiyerarşik örüntüleri otomatik olarak öğrenen bir derin öğrenme modeli türü olan evrişimli katmanları kullanarak bir görüntüyü filtreler veya çekirdeklerle tarar. Bu filtreler görüntü üzerinde kaydırılarak ve noktasal çarpımlar hesaplanarak kenarlar, dokular ve renkler gibi çeşitli özellikleri algılar. Her filtre, görüntüdeki belirli örüntüleri etkinleştirerek modelin hiyerarşik özellikleri öğrenmesini sağlar.
- Aktivasyon Fonksiyonları: Evrişimden sonra, pozitifse girdiyi doğrudan, aksi takdirde sıfırı çıktı olarak veren ve sinir ağlarının verilerdeki doğrusal olmayan ilişkileri verimli biçimde öğrenmesine yardımcı olan ReLU (Düzeltilmiş Doğrusal Birim) gibi aktivasyon fonksiyonları kullanılır. Bu, ağın karmaşık örüntüleri ve temsilleri öğrenmesine yardımcı olur.
- Havuzlama Katmanları: Havuzlama katmanları, özellik haritasının boyutluluğunu azaltan bir alt örnekleme işlemi sağlar. Böylece hesaplama maliyeti ve aşırı öğrenme azaltılırken en ilgili özelliklerin çıkarılmasına yardımcı olur.
- Tam Bağlantılı Katmanlar: Bir CNN'nin son katmanları, tahminler yapmak için evrişimli ve havuzlama katmanları tarafından çıkarılan özellikleri yorumlayan tam bağlantılı katmanlardır. Bu katmanlar, geleneksel sinir ağlarındaki katmanlara benzer.
CNN görme modellerinin evrimi#
Görme modellerinin yolculuğu kapsamlı oldu ve en dikkat çekici modellerden bazılarını içerdi:
-
LeNet (1989): LeNet, çoğunlukla el yazısıyla yazılmış çeklerdeki rakamları tanımak için kullanılan en eski CNN mimarilerinden biriydi. Başarısı, daha karmaşık CNN'lerin temelini oluşturdu ve derin öğrenmenin görüntü işlemedeki potansiyelini kanıtladı.
-
AlexNet (2012): AlexNet, ImageNet yarışmasında mevcut modellerden çok daha iyi performans göstererek derin öğrenmenin gücünü ortaya koydu. Bu model ReLU aktivasyonlarından, dropout'tan ve veri artırmadan yararlandı; görüntü sınıflandırmada yeni ölçütler belirledi ve CNN'lere yönelik geniş çaplı ilgiyi tetikledi.
-
VGGNet (2014): VGGNet, daha küçük evrişim filtreleri (3x3) kullanarak görüntü sınıflandırma görevlerinde etkileyici sonuçlar elde etti ve daha yüksek doğruluk sağlamada ağ derinliğinin önemini pekiştirdi.
-
ResNet (2015): ResNet, artık öğrenmeyi kullanıma sunarak derin ağlardaki bozulma sorununu ele aldı. Bu yenilik, çok daha derin ağların eğitilmesini sağlayarak çeşitli bilgisayarlı görü görevlerinde son teknoloji performansın elde edilmesini mümkün kıldı.
-
YOLO (You Only Look Once): YOLO, nesne algılamayı tek bir regresyon problemi olarak ele alarak ve tam görüntülerden tek bir değerlendirmede doğrudan sınırlayıcı kutuları ve sınıf olasılıklarını tahmin ederek devrim yarattı. Bu yaklaşım, benzeri görülmemiş hız ve doğrulukla gerçek zamanlı nesne algılamayı mümkün kıldı ve otonom sürüş ile gözetim gibi anında işlem gerektiren uygulamalar için uygun hâle getirdi.
Bilgisayarlı görü uygulamaları#
Sağlık hizmetleri#
Bilgisayarlı görünün kullanım alanları oldukça fazladır. Örneğin Ultralytics YOLOv8 gibi görme modelleri, kanser ve diyabetik retinopati gibi hastalıkları algılamak için tıbbi görüntülemede kullanılır. X ışınlarını, MRI'ları ve BT taramalarını yüksek hassasiyetle analiz ederek anormallikleri erken aşamada belirler. Bu erken algılama yeteneği, zamanında müdahalelere ve daha iyi hasta sonuçlarına olanak tanır.

Şekil 5. Ultralytics YOLOv8 kullanılarak beyin tümörü algılama.
Çevrenin korunması#
Bilgisayarlı görü modelleri, yaban hayatı yaşam alanlarından alınan görüntü ve videoları analiz ederek nesli tehlike altındaki türlerin izlenmesine ve korunmasına yardımcı olur. Hayvanların davranışlarını belirleyip takip ederek popülasyonları ve hareketleri hakkında veri sağlar. Bu teknoloji, kaplanlar ve filler gibi türleri korumaya yönelik koruma stratejilerine ve politika kararlarına bilgi sunar.
Görme yapay zekâsının yardımıyla orman yangınları ve ormansızlaşma gibi diğer çevresel tehditler de izlenebilir ve yerel yetkililerin hızlı yanıt vermesi sağlanabilir.

Şekil 6. Bir orman yangınının uydu görüntüsü.
Zorluklar ve geleceğe yönelik yönelimler#
Önemli başarılar elde etmiş olsalar da görme modelleri, aşırı karmaşıklıkları ve geliştirme süreçlerinin zorlu yapısı nedeniyle sürekli araştırma ve gelecekteki ilerlemeler gerektiren çok sayıda zorlukla karşı karşıyadır.
Yorumlanabilirlik ve açıklanabilirlik#
Özellikle derin öğrenme modelleri olmak üzere görme modelleri, genellikle şeffaflıkları sınırlı olan "kara kutular" olarak görülür. Bunun nedeni, bu modellerin son derece karmaşık olmasıdır. Yorumlanabilirliğin eksikliği, özellikle sağlık hizmetleri gibi kritik uygulamalarda güveni ve hesap verebilirliği engeller.
Hesaplama gereksinimleri#
Son teknoloji yapay zekâ modellerini eğitmek ve dağıtmak önemli miktarda hesaplama kaynağı gerektirir. Bu durum, çoğu zaman büyük miktarda görüntü ve video verisinin işlenmesini gerektiren görme modelleri için özellikle geçerlidir. Veri açısından en yoğun eğitim girdileri arasında yer alan yüksek çözünürlüklü görüntü ve videolar, hesaplama yükünü artırır. Örneğin tek bir HD görüntü birkaç megabayt depolama alanı kaplayabilir; bu da eğitim sürecini kaynak yoğun ve zaman alıcı hâle getirir.
Bu durum, etkili görme modelleri geliştirilirken kullanılan kapsamlı verileri ve karmaşık hesaplamaları işlemek için güçlü donanım ve optimize edilmiş bilgisayarlı görü algoritmalarını gerekli kılar. Daha verimli mimariler, model sıkıştırma ve GPU'lar ile TPU'lar gibi donanım hızlandırıcıları üzerine yapılan araştırmalar, görme modellerinin geleceğini ilerletecek temel alanlardır.
Bu iyileştirmeler, hesaplama gereksinimlerini azaltmayı ve işleme verimliliğini artırmayı amaçlar. Ayrıca Ultralytics YOLOv8 gibi gelişmiş önceden eğitilmiş modellerden yararlanmak, kapsamlı eğitim gereksinimini önemli ölçüde azaltarak geliştirme sürecini kolaylaştırabilir ve verimliliği artırabilir.
Sürekli gelişen bir ortam#
Günümüzde görme modellerinin uygulamaları, tümör algılama gibi sağlık hizmetlerinden trafik izleme gibi günlük kullanımlara kadar geniş bir alana yayılmıştır. Bu gelişmiş modeller, daha önce hayal bile edilemeyen doğruluk, verimlilik ve yetenekler sağlayarak sayısız sektöre yenilik getirdi.
Teknoloji ilerlemeye devam ettikçe görme modellerinin yaşamın ve sektörün çeşitli yönlerinde yenilik yapma ve iyileştirme potansiyeli sınırsız kalmaya devam ediyor. Bu süregelen evrim, bilgisayarlı görü alanında araştırma ve geliştirmenin devam etmesinin önemini vurguluyor.
Görme yapay zekâsının geleceğini merak ediyor musun? En güncel gelişmeler hakkında daha fazla bilgi için Ultralytics Belgeleri sayfasını inceleyebilir, Ultralytics GitHub ve YOLOv8 GitHub projelerine göz atabilirsin. Ayrıca yapay zekâ uygulamalarının çeşitli sektörlerdeki kullanım alanları hakkında bilgi edinmek için Self-Driving Cars ve Manufacturing çözümleri sayfaları özellikle yararlı bilgiler sunuyor.









