Computer Vision (CV)
Bilgisayarlı görünün makinelerin görüntü ve videoları yorumlamasını nasıl sağladığını keşfet. Temel görevleri, sektörel uygulamaları ve Ultralytics YOLO ile nasıl başlayacağını öğren.
Bilgisayarlı görü (CV), bilgisayarların ve sistemlerin dijital görüntülerden, videolardan ve diğer görsel girdilerden anlamlı bilgiler çıkarmasını sağlayan yapay zekâ (AI) alanıdır. AI makinelerin düşünmesini sağlıyorsa, bilgisayarlı görü onların görmesini, gözlemlemesini ve anlamasını sağlar. Kural tabanlı görüntü işleme araçlarının aksine, modern sistemler doğrudan verilerden öğrenir: bir arabanın veya tümörün neye benzediği kendilerine açıkça söylenmez; bunun yerine binlerce etiketli örnekteki temel örüntüleri belirler ve bu bilgiyi daha önce hiç karşılaşmadıkları görüntülere geneller. Makine öğrenimi (ML) ve derin öğrenme (DL) uygulanarak bilgisayarlı görü, yapılandırılmamış görsel verileri yazılımların eyleme dönüştürebileceği kararlara çevirir.
Bilgisayarlı Görü Nasıl Çalışır#
Bir bilgisayar, görüntüyü pikselleri temsil eden sayısal değerler dizisi olarak görür. Bu diziyi bir eyleme dönüştürmek beş aşamalı bir işlem hattını izler.

Görüntü edinimi. İş akışı, CMOS sensörleri, kızılötesi kameralar veya LiDAR tarayıcılarının ışığı yakalayıp dijital bir piksel ızgarasına dönüştürmesiyle başlar. Analiz başlamadan önce kamera kalibrasyonu lens geometrisini hesaba katar.
Ön işleme. Yakalanan veriler, modelin tutarlı girdiler alması için normalleştirilir: yeniden boyutlandırma, gürültü azaltma ve kontrast ayarlama uygulanır.
Özellik çıkarma. Sistem, kenarlar, gradyanlar ve köşeler gibi düşük seviyeli özellikleri belirler. Veriler ağın daha derin katmanlarına ilerledikçe bu temel öğeler, dokular, örüntüler ve karmaşık geometriler gibi yüksek seviyeli özelliklerde birleşir. Sistem dikey çizgileri algılayıp bunları çit direkleri olarak tanıyabilir ve ardından sahneyi bir çevre sınırı olarak anlayabilir. Bu süreç özellik çıkarma olarak bilinir.
Model çıkarımı. Modern bilgisayarlı görünün motoru evrişimli sinir ağıdır (CNN). Görüntüyü düz bir sayı listesi olarak ele alan standart bir sinir ağının aksine CNN'ler pikseller arasındaki uzamsal ilişkiyi korur ve görüntü boyunca kayan filtreler kullanarak, çerçevenin neresinde göründüklerinden bağımsız olarak örüntüleri algılar. Daha yakın zamanda Görsel Transformer'lar (ViTs), doğal dil işlemedeki dikkat mekanizmasını görüntü verilerine uygulayan güçlü bir alternatif olarak ortaya çıkmıştır.
Çıktı ve eylem. Model yapılandırılmış bir sonuç döndürür: bir etiket, bir dizi sınırlayıcı kutu veya bir piksel maskesi. Çevredeki sistem de buna göre hatalı bir parçayı reddeder, bir aracı frenler veya uyarı oluşturur.
Bir Model Nasıl Öğrenir#
Bir model yalnızca kullandığı veriler kadar iyidir. Denetimli öğrenme, büyük miktarlarda eğitim verisi gerektirir; ImageNet ve COCO gibi kıyaslamalar milyonlarca açıklamalı örnek sağlar. Eğitim sırasında model tahminde bulunur, tahminini gerçek etiketle karşılaştırır ve hatayı azaltmak için dahili ağırlıklarını ayarlar. Eğitildikten sonra aynı model yukarıda açıklanan çıkarım adımını gerçekleştirir.
Kural Tabanlı Sistemlerden Derin Öğrenmeye Geçiş#

İlk bilgisayarlı görü sistemleri manuel özellik mühendisliğine dayanıyordu: mühendisler, makinelerin nesneleri tanımasına yardımcı olmak için katı geometrik parametreler tanımlıyordu. Bu sistemler kırılgandı; aydınlatma değiştiğinde veya bir nesne alışılmadık bir açıyla göründüğünde başarısız oluyordu. Bir milyondan fazla etiketli ImageNet görüntüsüyle eğitilen AlexNet'in 2012'de yayımlanması, evrişimli ağların büyük ölçekte elle tasarlanmış yaklaşımlardan daha iyi performans gösterebildiğini ortaya koyarak dönüm noktası oldu. Derin öğrenme, elle ayarlanan kuralların yerini kendi özelliklerini öğrenen mimarilere bıraktı; bu mimariler, hiçbir zaman tamamen kontrollü olmayan gerçek dünya koşullarına dayanabilecek kadar esnektir.
Bilgisayarlı Görü ile Görüntü İşleme ve Makine Görüsünün Karşılaştırılması#
Bilgisayarlı görüyü, sıklıkla karıştırıldığı komşu alanlardan ayırt etmek önemlidir.
- Görüntü işleme, bir görüntüyü iyileştirmek veya sinyal çıkarmak için değiştirir; parlaklığı ve kontrastı ayarlar ya da filtreler uygular. Çıktısı genellikle başka bir görüntüdür. Bilgisayarlı görü, girdi olarak bir görüntü alır ve yorum üretir ("bu odada üç kişi var"). Bilgisayarlı görü, hazırlık adımı olarak düzenli şekilde görüntü işlemeden yararlanır.
- Makine görüsü, sabit aydınlatma ve bilinen parça konumlarına sahip, sıkı şekilde kontrol edilen ortamlarda çalışan endüstriyel denetim sistemlerini ifade eder. Bilgisayarlı görü, öngörülemeyen ve kontrol edilmeyen koşullarla başa çıkmak üzere tasarlanmış daha geniş bir disiplindir.
- Doğal dil işleme, metin ve konuşmayı ele alır. Bilgisayarlı görü tamamen görsel verilere odaklanır; ancak görsel dil modelleri bu iki alanı giderek daha fazla bir araya getirmektedir.
Temel Bilgisayarlı Görü Görevleri#
Bilgisayarlı görü tek bir işlev değil, her biri farklı bir problemi çözen bir dizi ayrı görevdir. Her birinin daha ayrıntılı açıklaması için bilgisayarlı görü görevleri hakkındaki kapsamlı kılavuza bakabilirsin.
- Görüntü sınıflandırma: tüm görüntüye tek bir etiket atayarak "bu görüntüde ne var?" sorusunu yanıtlar; örneğin ürünleri hatalı veya hatasız olarak sınıflandırır. Bununla yakından ilişkili olan görüntü tanıma, mevcut olanı belirler.
- Nesne algılama: farklı nesneleri belirler ve her birinin etrafına bir sınırlayıcı kutu çizer; böylece sistemlerin tek bir karedeki birden fazla nesneyi saymasını ve konumlandırmasını sağlar.
- Örnek bölümleme: algılanan her nesne için piksel düzeyinde bir maske üretir ve aynı sınıfa ait bağımsız örnekleri birbirinden ayırır. Anlamsal bölümleme ise örnekleri ayırt etmeden her piksele bir sınıf atar.
- Poz tahmini: hareketi ve duruşu izlemek için insan vücudundaki eklemler gibi bir nesne üzerindeki kilit noktaları algılar.
- Yönlendirilmiş sınırlayıcı kutular: eksenlere hizalı olmayan nesnelere döndürülmüş kutular uydurur; hava ve uydu görüntülerinde temel öneme sahiptir.
- Nesne takibi: bir nesneyi video akışı boyunca izler ve kareler arasında tutarlı bir ID korur. Optik akış, ardışık kareler arasındaki görünen hareketi analiz ederek bunu genişletir.
- Optik karakter tanıma (OCR): basılı veya el yazısıyla yazılmış metin görüntülerini makine tarafından okunabilir verilere dönüştürerek belge işlemeyi büyük ölçekte otomatikleştirir.
Doğru Görevi Seçme#
Teknik görevi en baştan iş hedefiyle uyumlu hâle getirmek, maliyetli yeniden çalışmaları önler.
| İş hedefi | Kullanılacak görev |
|---|---|
| Ürünleri kategorilere ayırma | Görüntü sınıflandırma |
| Ögeleri sayma veya konumlarını belirleme | Nesne algılama |
| Bir nesnenin tam şeklini veya sınırını analiz etme | Örnek bölütleme |
| Video kareleri boyunca hareketi izleme | Nesne izleme |
| Vücut konumunu veya eklem açılarını ölçme | Poz tahmini |
| Hava görüntülerindeki döndürülmüş nesneleri algılama | Yönlendirilmiş sınırlayıcı kutular |
| Belgelerden veya etiketlerden metin okuma | Optik karakter tanıma |
Gerçek Dünya Uygulamaları#
Bilgisayarlı görü artık başlıca sektörlerin çoğundaki üretim sistemlerinin temelini oluşturuyor.

- İmalat ve kalite kontrolü. Modern üretim hatları, insanın görsel kapasitesinden daha hızlı çalışır. Görü sistemleri anlık kalite denetimi gerçekleştirerek mikroskobik çatlakları veya hizalanmamış bileşenleri, bir insan denetçinin biriktireceği yorgunluk olmadan hat hızında belirler. Makinelerdeki aşınma örüntülerini izlemek de kestirimci bakımı mümkün kılar; arıza planlanmamış duruşa neden olmadan önce arıza belirtilerini tespit eder. İmalatta bilgisayarlı görü ve kusur algılama konularına bakabilirsin.
- Sağlık ve teşhis. Tıbbi görüntü analizi algoritmaları; erken evre tümörleri, mikro kırıkları ve zaman baskısı altında gözden kaçması kolay retina anormalliklerini tespit etmek için röntgenleri, MRI'ları ve CT taramalarını işler. Ameliyathanede görü sistemleri, minimal invaziv prosedürler sırasında gerçek zamanlı uzamsal haritalama sağlar. Sağlıkta bilgisayarlı görü konusuna bakabilirsin.
- Perakende. Kasasız mağazalar, raflardan alınan ürünleri izlemek ve müşterilerden otomatik olarak ücret almak için sensör füzyonu ve görü algoritmaları kullanır. Aynı sistemler, yeniden stoklama uyarılarını tetiklemek üzere raf seviyelerini gerçek zamanlı izleyerek envanter yönetimini ve perakendede kayıp önlemeyi destekler. Perakendede bilgisayarlı görü konusuna bakabilirsin.
- Otonom ulaşım. Algılama katmanı, sürücüsüz bir otomobilin güvenlik açısından en kritik bileşenidir. Görü sistemleri şerit işaretlerini, trafik levhalarını, yayaları ve diğer araçları gerçek zamanlı olarak belirler; kamera girdisini radar ve LiDAR ile birleştirerek 3B nesne algılama yoluyla aracın çevresinin 360 derecelik bir modelini oluşturur. Otonom araçlar konusuna bakabilirsin.
- Güvenlik ve izleme. Güvenlik altyapısı pasif kayıttan proaktif müdahaleye geçti: kısıtlı bölgelerde oyalanmayı algılıyor, olağandışı davranış örüntülerini gerçekleşirken işaretliyor ve kamusal alanlarda kuyruk yönetimini destekliyor. Temel yetenek anomali algılamadır.
- Tarım. Dronlar ve traktörler, bitki bazında ürün sağlığını değerlendirerek çok bantlı görüntüleri susuzluk, haşere istilası veya besin eksikliği açısından analiz eder. Daha sonra su, pestisit ve gübre tüm tarlaya uygulanmak yerine yalnızca ihtiyaç duyulan yerlere uygulanır. Tarımda bilgisayarlı görü konusuna bakabilirsin.
Uçta Bilgisayarlı Görü#
Gerçek zamanlı görsel analiz, videoyu merkezi bir bulut sunucusuna yönlendirmek yerine giderek daha fazla uçta — doğrudan kamerada veya yerel bir ağ geçidinde — çalıştırılıyor. Bunun iki nedeni var.
Gecikme neredeyse sıfıra iner; bu, milisaniyelik bir gecikmenin hatalara yol açtığı otonom robotik veya endüstriyel hat denetimi için vazgeçilmezdir. Ayrıca ağ üzerinden ham video yerine yalnızca meta veriler geçtiğinden bant genişliği gereksinimleri büyük ölçüde azalırken gizlilik artar; çünkü hassas görüntüler yerel cihazdan hiç ayrılmaz. Uç AI ve gerçek zamanlı çıkarım bunu pratik hâle getirir; ONNX ve TensorRT gibi model dağıtımı seçenekleri de tek bir eğitilmiş modelin farklı donanımlarda çalışmasını sağlar.
Zorluklar ve Sınırlamalar#
Veri kalitesi. Bir model, eğitim verilerinin kalitesini yansıtır. Düşük çözünürlüklü, kötü etiketlenmiş veya temsili olmayan veri kümeleri güvenilmez modeller üretir; çeşitli ve açıklamalı bir veri kümesi oluşturmak da çoğu zaman algoritmayı tasarlamaktan daha fazla emek gerektirir. Veri etiketleme konusuna bakabilirsin.
Çevresel değişkenler. Şiddetli yağmur, lens parlaması, kısmi örtülme ve değişken nesne ölçeği performansı düşürür. Sağlam sistemler, dağıtımdan önce bu koşulları benzetmek ve dayanıklılık oluşturmak için eğitim sırasında veri artırmaya, ayrıca aşırı öğrenmeyi önlemek için dikkatli doğrulamaya dayanır.
Etik hususlar ve önyargı. Demografik çeşitlilikten yoksun bir veri kümesiyle eğitilen bir model, nüfus grupları arasında eşitsiz performans gösterir. Tıbbi görüntüleme, iş yeri güvenliği veya kamusal alanlarda insanları analiz eden sistemleri dağıtan kuruluşlar, adillik açısından veri kümelerini denetlemeli ve otomatik karar vermeyi kapsayan yeni düzenlemelere uymalıdır.
Bilgisayarlı Görünün Geleceği#
Görsel Transformer'lar, bir görüntünün uzak bölümleri arasındaki ilişkilerin anlaşılmasını gerektiren görevlerde nelerin başarılabileceğini yeniden şekillendiriyor. Bunun ötesinde çok kipli öğrenme, daha zengin bağlamsal anlayışa sahip sistemler oluşturmak için görsel verileri metin, ses ve derinlikle birleştirir; görüntüler hakkında soruları yanıtlayan görsel dil modelleri bunun erken bir örneğidir.
Üretken AI, veri kıtlığı sorununu doğrudan ele alıyor. Sentetik veri, gerçek dünyada yeterli miktarda toplanamayan nadir senaryoların — belirli arıza türleri veya yaygın olmayan hastalık görünümleri gibi — hiper gerçekçi görüntülerinin oluşturulmasını mümkün kılar. Bu sırada derinlik algılayan kameralar ve LiDAR, sistemleri düz görüntü analizinin ötesine, dijital bilgilerin fiziksel dünyanın üzerine bindirildiği uzamsal bilişime taşıyor; buna AR rehberli bakım ve yapısal haritalama uygulamaları dahildir.
Ultralytics ile Bilgisayarlı Görü Uygulama#
Bilgisayarlı görü projesini pilot olarak başlatan ekipler için Ultralytics YOLO26, gerçek zamanlı nesne algılama için pratik bir başlangıç noktasıdır: açık kaynaklı, kapsamlı şekilde belgelenmiş ve uçta çalışacak kadar hızlıdır. Donanımlar arasındaki doğruluk ve gecikme değerleri kıyaslamalar sayfasında yayımlanır; belgelerde yan yana model karşılaştırmaları da bulunur. Daha geniş ekosistem, klasik görüntü işleme için OpenCV ve birincil eğitim çatısı olarak PyTorch içerir.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with bounding boxes
results[0].show()Bu betik, birkaç satırda çıkarım gerçekleştirmek için önceden eğitilmiş bir model kullanır. Pilot uygulamadan üretime geçen ekipler; veri kümelerine açıklama eklemek, modelleri bulutta eğitmek ve dağıtımı yönetmek için Ultralytics Platform'u kullanabilir veya önceden eğitilmiş bir modeli sıfırdan eğitime kıyasla çok daha az etiketli veri içeren özel bir veri kümesine uyarlamak için transfer öğrenmesini uygulayabilir.
Sıkça Sorulan Sorular#
Bilgisayarlı görü ile makine öğrenimi arasındaki fark nedir? Makine öğrenimi, verilerden öğrenen sistemler oluşturma disiplinidir. Bilgisayarlı görü ise bu disiplinin, genellikle derin öğrenme aracılığıyla, görüntü ve video gibi görsel girdilere uygulanmasıdır. Modern bilgisayarlı görünün neredeyse tamamı makine öğrenimi üzerine kuruludur; ancak makine öğrenimi metin, ses ve tablo verilerini de kapsar.
Bilgisayarlı görü, görüntü tanımayla aynı şey midir? Hayır. Görüntü tanıma, bilgisayarlı görü içindeki görevlerden biridir ve bir görüntüde ne göründüğünü belirler. Bilgisayarlı görü ayrıca nesne algılama, bölümleme, poz tahmini, takip ve sahne anlayışını da kapsar.
Bir bilgisayarlı görü modelini eğitmek için ne kadar veri gerekir? Bu, görevin karmaşıklığına ve modelin ne kadar değişkenliği ele alması gerektiğine bağlıdır. Ultralytics YOLO26 gibi önceden eğitilmiş bir modelden transfer öğrenmesi gereksinimi büyük ölçüde azaltır; kullanışlı özel algılayıcılar, temel modelleri eğitmek için kullanılan milyonlarca görüntü yerine, sınıf başına genellikle birkaç yüz ila birkaç bin etiketli görüntüyle eğitilebilir.
Bilgisayarlı görü internet bağlantısı olmadan çalışabilir mi? Evet. Modeller doğrudan uç cihazlara dağıtılabilir ve tamamen çevrimdışı çalıştırılabilir; bu, gecikme, bant genişliği veya veri gizliliği kuralları nedeniyle videonun buluta gönderilemediği durumlarda standart uygulamadır.
Bilgisayarlı görü için hangi programlama dili kullanılır? Ekosisteminin olgunluğu sayesinde Python baskındır; buna ultralytics paketi, PyTorch ve OpenCV dahildir. En yüksek çıkarım performansının gerektiği durumlarda, genellikle gömülü ve otomotiv sistemlerinde C++ kullanılır.









