Data Lake
Veri göllerinin yapay zeka ve ML için nasıl temel oluşturduğunu keşfet. Ultralytics YOLO26'yı eğitmek ve bilgisayarlı görü iş akışlarını kolaylaştırmak için ham verilerden nasıl yararlanacağını öğren.
Bir veri gölü (data lake), gerektiğinde kullanılana kadar devasa miktarda ham veriyi kendi orijinal formatında tutan merkezi bir depolama havuzudur. Verilerin girmeden önce yapılandırılmasını gerektiren geleneksel depolama sistemlerinin aksine, bir veri gölü verileri "olduğu gibi" kabul eder; buna yapılandırılmış veriler (satırlar ve sütunlar), yarı yapılandırılmış veriler (CSV, günlükler, XML, JSON), yapılandırılmamış veriler (e-postalar, belgeler, PDF'ler) ve ikili veriler (görseller, ses, video) dahildir. Bu mimari esneklik, veri göllerini modern Big Data stratejilerinin, özellikle de Artificial Intelligence (AI) ve Machine Learning (ML) teknolojilerinden yararlanan organizasyonların temel taşı haline getirir. Veri toplamayı veri kullanımından ayırarak, organizasyonlar devasa bilgi havuzlarını nispeten ucuza depolayabilir ve özel analiz sorularını daha sonra çözebilir.
Yapay Zeka ve Makine Öğreniminde Veri Göllerinin Rolü#
In the context of AI development, the primary value of a data lake lies in its ability to support Deep Learning (DL) workflows. Advanced neural networks require diverse and voluminous training data to achieve high accuracy. A data lake acts as the staging ground where raw assets—such as millions of high-resolution images for Computer Vision (CV) or thousands of audio hours for Speech Recognition—reside before being processed.
Veri bilimciler, veri göllerinde "okuma anında şema" (schema-on-read) metodolojilerini kullanırlar. Bu, yapının veriye, depolama alanına yazıldığı anda değil, yalnızca işleme için okunduğu anda uygulandığı anlamına gelir. Bu durum muazzam bir çeviklik sağlar; aynı ham veri seti, orijinal kaynağı değiştirmeden farklı predictive modeling görevleri için birden fazla şekilde işlenebilir. Dahası, güçlü veri gölleri genellikle Amazon S3 veya Azure Blob Storage gibi cloud computing servisleriyle entegre olarak, YOLO26 gibi ağır modelleri eğitmek için gereken ölçeklenebilir ve paralel işlemeyi mümkün kılar.
Veri Gölü ve Veri Ambarı Karşılaştırması#
Çoğu zaman karıştırılsa da, bir veri gölü veri ambarından (data warehouse) farklıdır. Bir data warehouse verileri yapılandırılmış tablolar halinde depolar ve hızlı SQL sorguları ile iş zekası raporlaması için optimize edilmiştir. "Yazma anında şema" (schema-on-write) kullanır; yani verilerin sisteme girmeden önce bir ETL (Extract, Transform, Load) sürecinden geçerek temizlenmesi ve dönüştürülmesi gerekir.
Buna karşılık, bir veri gölü depolama hacmi ve çeşitliliği için optimize edilmiştir. Amacın henüz tanımlanmamış olabileceği unsupervised learning ve keşif amaçlı analizleri destekler. Örneğin, bir veri ambarı size geçen ay kaç ürün satıldığını söyleyebilirken, bir veri gölü bir yapay zeka modelinin bu ürünlerin neden satıldığını anlamasına yardımcı olan ham customer sentiment günlüklerini ve görsel verilerini barındırır.
Gerçek Dünya Uygulamaları#
Veri gölleri, otomasyonun sınırlarını zorlayan çeşitli endüstrilerde önemli bir rol oynar:
- Otonom Araçlar: Sürüş teknolojisi geliştirmek, petabaytlarca sensör verisinin işlenmesini gerektirir. Autonomous vehicles sürekli olarak LiDAR nokta bulutları, radar sinyalleri ve yüksek tanımlı video akışları üretir. Bir veri gölü bu ham telemetriyi depolayarak mühendislerin, Object Detection modellerini değişen hava koşullarında yayaları ve engelleri tanımaları için eğitmek amacıyla gerçek dünya senaryolarını yeniden oynatmasına olanak tanır.
- Sağlık Teşhisi: Modern medical image analysis süreçlerinde hastaneler; hasta geçmişini, genomik verileri ve görüntüleme dosyalarını (MRI, BT taramaları) güvenli bir veri gölünde konsolide eder. Araştırmacılar daha sonra tumor detection veya hastalık tahmini için modeller eğitmek amacıyla bu anonimleştirilmiş, yapılandırılmamış verilere erişebilir ve sıklıkla tıbbi görüntü içindeki ilgi çekici bölgeleri izole etmek için segmentation tekniklerinden yararlanırlar.
Veri Göllerini Ultralytics ile Kullanma#
Ultralytics Platform ile çalışırken kullanıcılar genellikle eğitim için etiketli veri setleri oluşturmak üzere kuruluşlarının veri gölünden ham veri alt kümelerini çekerler. Ham görseller alınıp etiketlendikten sonra en son teknolojiye sahip modelleri eğitmek için kullanılabilirler.
Aşağıdaki örnek, bir geliştiricinin bir algılama görevi için YOLO26 modelini eğitmek üzere yerel bir veri setini (bir veri gölünden veri çekmeyi taklit ederek) nasıl yükleyebileceğini göstermektedir.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Train the model using a dataset configuration file
# In a production pipeline, this data might be streamed or downloaded
# from a cloud-based data lake prior to this step.
results = model.train(data="coco8.yaml", epochs=5, imgsz=640)
# Run inference on a new image to verify performance
predictions = model("https://ultralytics.com/images/bus.jpg")





