Yüksek kaliteli bilgisayarlı görü veri kümelerinin önemi
Bilgisayarlı görü modelleri oluştururken yüksek kaliteli veriye duyulan ihtiyacı birlikte inceleyelim. Veri kalitesinin model performansını nasıl etkileyebileceğini keşfedin.

2019 itibarıyla kurumsal yapay zekâ (AI) benimsemesi önceki dört yıla göre %270 artmıştı. Bu büyüme, makinelerin çevrelerindeki dünyadan gelen görsel verileri yorumlayıp analiz etmesini sağlayan yapay zekâ sistemleri olan bilgisayarlı görü (CV) uygulamalarının hızla entegre edilmesini destekledi. Bu uygulamalar, tıbbi görüntüleme alanında hastalıkları tespit etmekten ve otonom araçları mümkün kılmaktan ulaşımda trafik akışını optimize etmeye ve güvenlik sistemlerinde gözetimi geliştirmeye kadar çok çeşitli teknolojilere güç verir.
Ultralytics YOLO11 gibi son teknoloji bilgisayarlı görü modellerinin olağanüstü doğruluğu ve eşsiz performansı, bu üstel büyümeyi büyük ölçüde yönlendirdi. Ancak bu modellerin performansı, modelleri eğitmek, doğrulamak ve test etmek için kullanılan verilerin kalitesine ve miktarına büyük ölçüde bağlıdır.
Yeterli miktarda yüksek kaliteli veri olmadan bilgisayarlı görü modellerini endüstri standartlarını karşılayacak şekilde etkili biçimde eğitmek ve ince ayar yapmak zor olabilir. Bu makalede, bilgisayarlı görü modelleri oluşturmada verinin hayati rolünü ve yüksek kaliteli verilerin bilgisayarlı görüde neden bu kadar önemli olduğunu inceleyeceğiz. Ayrıca özel bilgisayarlı görü modelleri üzerinde çalışırken yüksek kaliteli veri kümeleri oluşturmana yardımcı olacak bazı ipuçlarını ele alacağız. Hadi başlayalım!
Bilgisayarlı görü modelleri oluşturmada verinin rolü#
Bilgisayarlı görü modelleri, kalıpları tanımak ve doğru tahminler yapmak için büyük veri kümeleri içindeki görüntü ve videolarla eğitilebilir. Örneğin bir nesne algılama modeli, nesneleri doğru biçimde tanımlamak için yüzlerce, hatta binlerce etiketlenmiş görüntü ve videoyla eğitilebilir.
Bu eğitim verilerinin kalitesi ve miktarı modelin performansını etkiler.
Bilgisayarlı görü modelleri yalnızca maruz kaldıkları verilerden öğrenebildiği için yüksek kaliteli veriler ve çeşitli örnekler sağlamak başarıları açısından kritik öneme sahiptir. Yeterli ve çeşitli veri kümeleri olmadığında bu modeller gerçek dünya senaryolarını doğru biçimde analiz edemeyebilir ve yanlı ya da hatalı sonuçlar üretebilir.
Bu nedenle verinin model eğitimindeki rolünü açıkça anlamak önemlidir. Yüksek kaliteli verilerin özelliklerini ele almadan önce, bilgisayarlı görü modellerini eğitirken karşılaşabileceğin veri kümesi türlerini anlayalım.
Bilgisayarlı görü veri kümesi türleri#
Bilgisayarlı görüde eğitim sürecinde kullanılan veriler, her biri belirli bir amaca hizmet eden üç türe ayrılır. Her türe kısaca göz atalım:
- Eğitim Verileri: Modeli sıfırdan eğitmek için kullanılan birincil veri kümesidir. Modelin kalıpları öğrenmesini ve nesneleri tanımasını sağlayan, önceden tanımlanmış etiketlere sahip görüntü ve videolardan oluşur.
- Doğrulama Verileri: Bir modelin eğitilirken ne kadar iyi performans gösterdiğini kontrol etmek için kullanılan veri kümesidir. Modelin yeni ve daha önce görülmemiş veriler üzerinde doğru çalışmasını sağlamaya yardımcı olur.
- Test Verileri: Eğitilmiş bir modelin nihai performansını değerlendirmek için kullanılan ayrı veri kümesidir. Modelin tamamen yeni ve daha önce görülmemiş veriler üzerinde ne kadar iyi tahminler yapabildiğini kontrol eder.

Şekil 1. Bilgisayarlı görüde verilerin kategorilere ayrılması.
Yüksek kaliteli bilgisayarlı görü veri kümelerinin en önemli 5 özelliği#
Veri kümesinin türü ne olursa olsun, başarılı bilgisayarlı görü modelleri oluşturmak için yüksek kaliteli veriler gereklidir. Bir veri kümesini yüksek kaliteli yapan temel özelliklerden bazıları şunlardır:
- Doğruluk: İdeal olarak veriler gerçek dünya koşullarını yakından yansıtmalı ve doğru etiketler içermelidir. Örneğin sağlık hizmetlerinde görü yapay zekâsı söz konusu olduğunda, modelin doğru öğrenmesine yardımcı olmak için röntgen veya tarama görüntüleri doğru biçimde etiketlenmelidir.
- Çeşitlilik: İyi bir veri kümesi, modelin farklı durumlarda iyi performans göstermesine yardımcı olacak çeşitli örnekler içerir. Örneğin bir model arabaları algılamayı öğreniyorsa veri kümesinde farklı ortamlarda (gündüz, gece, yağmur vb.) farklı şekil, boyut ve renkte arabalar bulunmalıdır.
- Tutarlılık: Yüksek kaliteli veri kümeleri, tek tip bir biçimi ve kalite standartlarını izler. Örneğin görüntüler benzer çözünürlüklere sahip olmalı (bazıları bulanık, bazıları keskin olmamalı) ve modelin tutarlı bilgilerden öğrenmesi için yeniden boyutlandırma veya renk ayarlamaları gibi aynı ön işleme adımlarından geçirilmelidir.
- Güncellik: Düzenli olarak güncellenen veri kümeleri gerçek dünyadaki değişimlere ayak uydurabilir. Her tür aracı algılamak için bir model eğittiğini varsayalım. Elektrikli scooter'lar gibi yeni araçlar ortaya çıkarsa modelin doğruluğunu ve güncelliğini korumasını sağlamak için bunlar veri kümesine eklenmelidir.
- Gizlilik: Bir veri kümesi insanlar fotoğrafları gibi hassas bilgiler içeriyorsa gizlilik kurallarına uymalıdır. Anonimleştirme (kimliği belirleyici ayrıntıların kaldırılması) ve veri maskeleme (hassas bölümlerin gizlenmesi) gibi teknikler, verilerin güvenli biçimde kullanılmasını mümkün kılarken gizliliği koruyabilir.
Düşük kaliteli verilerin yol açtığı zorluklar#
Yüksek kaliteli verilerin özelliklerini anlamak önemli olsa da düşük kaliteli verilerin bilgisayarlı görü modellerini nasıl etkileyebileceğini göz önünde bulundurmak da aynı derecede hayati önem taşır.
Aşırı öğrenme ve yetersiz öğrenme gibi sorunlar model performansını ciddi biçimde etkileyebilir. Aşırı öğrenme, bir modelin eğitim verilerinde iyi performans gösterirken, çoğunlukla veri kümesinde çeşitlilik bulunmadığı için yeni veya daha önce görülmemiş verilerde zorlanmasıyla ortaya çıkar. Öte yandan yetersiz öğrenme, veri kümesi modelin anlamlı kalıpları öğrenmesi için yeterli sayıda örnek veya kalite sağlamadığında meydana gelir. Bu sorunlardan kaçınmak için çeşitli, tarafsız ve yüksek kaliteli veri kümelerini korumak, hem eğitimde hem de gerçek dünya uygulamalarında güvenilir performans sağlamak önemlidir.

Şekil 2. Yetersiz öğrenme ve aşırı öğrenme karşılaştırması.
Düşük kaliteli veriler, modellerin ham verilerden anlamlı kalıpları çıkarmasını ve öğrenmesini de zorlaştırabilir; bu süreç özellik çıkarımı olarak bilinir. Veri kümesi eksik, ilgisiz veya çeşitlilikten yoksunsa model etkili biçimde performans göstermekte zorlanabilir.
Bazen düşük kaliteli veriler verilerin basitleştirilmesinden kaynaklanabilir. Verileri basitleştirmek depolama alanından tasarruf etmeye ve işleme maliyetlerini azaltmaya yardımcı olabilir, ancak aşırı basitleştirme modelin iyi çalışması için ihtiyaç duyduğu önemli ayrıntıları ortadan kaldırabilir. Bu nedenle, veri toplama aşamasından dağıtıma kadar tüm bilgisayarlı görü süreci boyunca yüksek kaliteli verileri korumak çok önemlidir. Genel bir kural olarak veri kümeleri, güvenilir model tahminlerini garanti etmek için çeşitli ve doğru kalırken temel özellikleri de içermelidir.

Şekil 3. Özellik çıkarımını anlama.
Bilgisayarlı görü veri kümenin kalitesini korumaya yönelik ipuçları#
Artık yüksek kaliteli verilerin önemini ve düşük kaliteli verilerin etkisini anladığımıza göre, veri kümenin yüksek standartları karşıladığından nasıl emin olabileceğini inceleyelim.
Her şey güvenilir veri toplamayla başlar. Kitle kaynak kullanımı, farklı coğrafi bölgelerden alınan veriler ve sentetik veri üretimi gibi çeşitli kaynakların kullanılması yanlılığı azaltır ve modellerin gerçek dünya senaryolarıyla başa çıkmasına yardımcı olur. Veriler toplandıktan sonra ön işleme kritik önem taşır. Piksel değerlerini tutarlı bir aralığa ölçeklendiren normalleştirme ve döndürme, çevirme ve yakınlaştırma gibi dönüşümler uygulayan veri artırma teknikleri veri kümesini geliştirir. Bu adımlar, modelinin daha iyi genelleme yapmasına ve daha dayanıklı hâle gelmesine yardımcı olarak aşırı öğrenme riskini azaltır.
Veri kümelerini uygun biçimde bölmek bir diğer önemli adımdır. Yaygın bir yaklaşım, verilerin %70'ini eğitim, %15'ini doğrulama ve %15'ini test için ayırmaktır. Bu kümeler arasında çakışma olmadığını tekrar kontrol etmek veri sızıntısını önler ve doğru model değerlendirmesi sağlar.

Şekil 4. Eğitim, doğrulama ve test arasındaki yaygın veri bölme oranı.
Zamandan ve hesaplama kaynaklarından tasarruf etmek için YOLO11 gibi önceden eğitilmiş modelleri de kullanabilirsin. Büyük veri kümeleriyle eğitilen ve çeşitli bilgisayarlı görü görevleri için tasarlanan YOLO11, ihtiyaçlarını karşılamak üzere belirli veri kümenle ince ayarlanabilir. Modeli verilerine göre ayarlayarak aşırı öğrenmeden kaçınabilir ve yüksek performansı koruyabilirsin.
Bilgisayarlı görü veri kümelerinin geleceği#
AI topluluğu geleneksel olarak daha fazla katmana sahip daha derin modeller oluşturarak performansı artırmaya odaklandı. Ancak AI gelişmeye devam ettikçe odak, modelleri optimize etmekten veri kümelerinin kalitesini iyileştirmeye kayıyor. Genellikle “AI'ın babası” olarak anılan Andrew Ng, "AI dünyasının bu on yılda geçirmesi gereken en önemli değişimin veri merkezli AI'a geçiş olacağına" inanıyor.
Bu yaklaşım, etiket doğruluğunu artırarak, gürültülü örnekleri kaldırarak ve çeşitliliği sağlayarak veri kümelerini iyileştirmeye vurgu yapar. Bilgisayarlı görü açısından bu ilkeler, yanlılık ve düşük kaliteli veriler gibi sorunları ele almak, modellerin gerçek dünya senaryolarında güvenilir biçimde performans göstermesini sağlamak için kritik öneme sahiptir.
Geleceğe baktığımızda bilgisayarlı görünün gelişimi, çok büyük miktarlarda veri toplamaktan ziyade daha küçük ve yüksek kaliteli veri kümeleri oluşturmaya bağlı olacaktır. Andrew Ng'ye göre, "Verileri iyileştirmek tek seferlik bir ön işleme adımı değildir; makine öğrenimi modeli geliştirme sürecinin temel ve yinelemeli bir parçasıdır." Veri merkezli ilkelere odaklanarak bilgisayarlı görü, çeşitli sektörlerde daha erişilebilir, verimli ve etkili hâle gelmeye devam edecektir.
Önemli çıkarımlar#
Veriler, bir görü modelinin yaşam döngüsünün tamamında kritik bir rol oynar. Veri toplama ve ön işlemeden eğitim, doğrulama ve teste kadar verilerin kalitesi modelin performansını ve güvenilirliğini doğrudan etkiler. Yüksek kaliteli verilere ve doğru etiketlemeye öncelik vererek güvenilir ve kesin sonuçlar sunan dayanıklı bilgisayarlı görü modelleri oluşturabiliriz.
Veri odaklı bir geleceğe ilerlerken yanlılık ve gizlilik düzenlemeleriyle ilgili riskleri azaltmak için etik hususları ele almak önemlidir. Sonuç olarak verilerin bütünlüğünü ve adilliğini sağlamak, bilgisayarlı görü teknolojilerinin tüm potansiyelini ortaya çıkarmanın anahtarıdır.
AI hakkında daha fazla bilgi edinmek için topluluğumuza katıl ve GitHub depomıza göz at. Tarım ve imalat gibi sektörlerdeki daha fazla AI uygulamasını keşfetmek için çözüm sayfalarımıza göz at.









