Data Lake
Veri göllerinin yapay zekâ ve ML için nasıl temel oluşturduğunu keşfet. Ultralytics YOLO26'yı eğitmek ve bilgisayarlı görü iş akışlarını kolaylaştırmak için ham verilerden yararlanmayı öğren.
Veri gölü, ihtiyaç duyulana kadar büyük miktarda ham veriyi yerel biçiminde tutan merkezi bir depolama havuzudur. Verilerin sisteme alınmadan önce yapılandırılmasını gerektiren geleneksel depolama sistemlerinin aksine veri gölü; yapılandırılmış verileri (satırlar ve sütunlar), yarı yapılandırılmış verileri (CSV, günlükler, XML, JSON), yapılandırılmamış verileri (e-postalar, belgeler, PDF'ler) ve ikili verileri (görüntüler, ses, video) "olduğu gibi" kabul eder. Bu mimari esneklik, veri göllerini modern Büyük Veri stratejilerinin, özellikle de Yapay Zekâ (AI) ve Makine Öğrenimi (ML) kullanan kuruluşlar için temel bir unsuru hâline getirir. Kuruluşlar, veri toplama ile veri kullanımını birbirinden ayırarak devasa bilgi havuzlarını görece düşük maliyetle depolayabilir ve belirli analiz sorularını daha sonra belirleyebilir.
Yapay Zekâ ve Makine Öğreniminde Veri Göllerinin Rolü#
Yapay zekâ geliştirme bağlamında veri gölünün temel değeri, Derin Öğrenme (DL) iş akışlarını destekleme yeteneğinde yatar. Gelişmiş sinir ağlarının yüksek doğruluk elde edebilmesi için çeşitli ve büyük hacimli eğitim verilerine ihtiyacı vardır. Veri gölü; Bilgisayarlı Görü (CV) için milyonlarca yüksek çözünürlüklü görüntü veya Konuşma Tanıma için binlerce saatlik ses gibi ham varlıkların işlenmeden önce bulunduğu hazırlama alanı görevi görür.
Veri bilimciler, veri gölleri içinde "okuma sırasında şema" metodolojilerini kullanır. Bu, yapının depolamaya yazılırken değil, işlenmek üzere okunduğunda verilere uygulanması anlamına gelir. Bu yaklaşım büyük bir çeviklik sağlar; aynı ham veri kümesi, özgün kaynağı değiştirmeden farklı tahmine dayalı modelleme görevleri için birden fazla şekilde işlenebilir. Ayrıca güçlü veri gölleri genellikle Amazon S3 veya Azure Blob Storage gibi bulut bilişim hizmetleriyle entegre olur ve YOLO26 gibi büyük modellerin eğitimi için gereken ölçeklenebilir, paralel işlemeyi mümkün kılar.
Veri Gölü ve Veri Ambarı Karşılaştırması#
Sıklıkla karıştırılsalar da veri gölü, veri ambarından farklıdır. Bir veri ambarı, verileri yapılandırılmış tablolarda depolar ve hızlı SQL sorguları ile iş zekâsı raporlaması için optimize edilmiştir. "Yazma sırasında şema" kullanır; yani verilerin sisteme alınmadan önce bir Çıkarma, Dönüştürme, Yükleme (ETL) süreciyle temizlenmesi ve dönüştürülmesi gerekir.
Buna karşılık veri gölü, depolama hacmi ve çeşitliliği için optimize edilmiştir. Hedefin henüz tanımlanmamış olabileceği denetimsiz öğrenmeyi ve keşifsel analizi destekler. Örneğin bir veri ambarı geçen ay kaç ürün satıldığını söyleyebilirken, veri gölü bir yapay zekâ modelinin bunların neden satıldığını anlamasına yardımcı olan ham müşteri duyarlılığı günlüklerini ve görüntü verilerini barındırır.
Gerçek Dünya Uygulamaları#
Veri gölleri, otomasyonun sınırlarını zorlayan çeşitli sektörlerde kritik bir rol oynar:
- Otonom Araçlar: kendi kendine sürüş teknolojisinin geliştirilmesi, petabaytlarca sensör verisinin işlenmesini gerektirir. Otonom araçlar, sürekli LiDAR nokta bulutu, radar sinyali ve yüksek çözünürlüklü video akışları üretir. Veri gölü bu ham telemetrileri depolar ve mühendislerin, farklı hava koşullarında yayaları ve engelleri tanımlamak üzere Nesne Tespiti modellerini eğitmek için gerçek dünya senaryolarını yeniden oynatmasına olanak tanır.
- Sağlık Tanıları: Modern tıbbi görüntü analizinde hastaneler; hasta geçmişini, genomik verileri ve görüntüleme dosyalarını (MRI, CT taramaları) güvenli bir veri gölünde birleştirir. Araştırmacılar daha sonra bu anonimleştirilmiş, yapılandırılmamış verilere erişerek tümör tespiti veya hastalık tahmini için modeller eğitebilir ve tıbbi görüntülerdeki ilgi bölgelerini ayırmak için sıklıkla segmentasyon tekniklerinden yararlanabilir.
Veri Göllerini Ultralytics ile Kullanma#
Ultralytics Platformu ile çalışırken kullanıcılar, eğitim için açıklamalı veri kümeleri oluşturmak üzere kuruluşlarının veri gölünden genellikle ham verilerin alt kümelerini çeker. Ham görüntüler alınıp etiketlendikten sonra son teknoloji modelleri eğitmek için kullanılabilir.
Aşağıdaki örnek, bir geliştiricinin bir tespit görevi için YOLO26 modelini eğitmek üzere yerel bir veri kümesini (veri gölünden veri çekme işlemini taklit ederek) nasıl yükleyebileceğini gösterir.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Train the model using a dataset configuration file
# In a production pipeline, this data might be streamed or downloaded
# from a cloud-based data lake prior to this step.
results = model.train(data="coco8.yaml", epochs=5, imgsz=640)
# Run inference on a new image to verify performance
predictions = model("https://ultralytics.com/images/bus.jpg")








