Video Understanding
Video anlayışının eylemleri yorumlamak için zamansal dinamikleri nasıl analiz ettiğini keşfet. İleri düzey yapay zekâ için Ultralytics YOLO26 ile gerçek zamanlı izlemeyi uygulamayı öğren.
Video Anlama, makinelerin görsel verileri zaman içinde algılamasını, analiz etmesini ve yorumlamasını sağlamaya odaklanan gelişmiş bir bilgisayarlı görü (CV) dalıdır. Statik görüntüleri birbirinden bağımsız olarak işleyen standart görüntü tanımanın aksine video anlama; zamansal dinamikleri, bağlamı ve nedensel ilişkileri kavramak için kare dizilerini analiz etmeyi içerir. Yapay zekâ sistemleri, zamanın "dördüncü boyutunu" işleyerek nesneleri basitçe tanımlamanın ötesine geçip bir sahnede gerçekleşen eylemleri, olayları ve anlatıyı anlayabilir. Bu yetenek, dinamik gerçek dünya ortamlarında güvenli ve etkili bir şekilde etkileşim kurabilen akıllı sistemler oluşturmak için gereklidir.
Video Analizinin Temel Bileşenleri#
Video içeriğini başarılı bir şekilde yorumlamak için modellerin iki temel bilgi türünü birleştirmesi gerekir: uzamsal özellikler (karede ne olduğu) ve zamansal özellikler (işlerin nasıl değiştiği). Bu, genellikle birden çok sinir ağı stratejisini bir araya getiren karmaşık bir mimari gerektirir.
- Evrişimli Sinir Ağları (CNNs): Bu ağlar genellikle uzamsal omurga görevi görür ve tek tek karelerden şekiller, dokular ve nesneler gibi görsel özellikleri çıkarır.
- Tekrarlayan Sinir Ağları (RNNs): Uzun Kısa Süreli Bellek (LSTM) birimleri gibi mimariler, CNN tarafından çıkarılan özellik dizisini işlemek için kullanılır; böylece model geçmiş kareleri "hatırlayabilir" ve gelecekteki durumları tahmin edebilir.
- Optik Akış: Birçok sistem, kareler arasındaki piksellerin hareket vektörlerini açıkça hesaplamak için optik akış algoritmalarından yararlanır; bu da nesnenin görünümünden bağımsız olarak hız ve yön hakkında kritik veriler sağlar.
- Görüntü Transformer'ları (ViTs): Modern yaklaşımlar, farklı karelerin veya bölgelerin önemini ağırlıklandırmak için giderek daha fazla dikkat mekanizmalarına dayanır; bu da modelin uzun bir video akışındaki önemli olaylara odaklanmasını sağlar.
Gerçek Dünya Uygulamaları#
Zamansal bağlamı anlama yeteneği, çeşitli sektörlerde gelişmiş otomasyonun önünü açmıştır.
- Otonom Araçlar: Sürücüsüz araçlar, yayaların ve diğer araçların yörüngelerini tahmin etmek için video anlamadan yararlanır. Sistem, hareket kalıplarını analiz ederek olası çarpışmaları öngörebilir ve karmaşık manevralar gerçekleştirebilir.
- Eylem Tanıma: Spor analitiğinde ve sağlık hizmetleri izlemede sistemler, otomatik içgörüler veya uyarılar sağlamak için bir oyuncunun gol atması ya da bir hastanın düşmesi gibi belirli insan etkinliklerini tanımlar.
- Akıllı Perakende: Mağazalar, hırsızlığı tespit etmek veya daha iyi yerleşim optimizasyonu için müşteri trafiği kalıplarını analiz etmek amacıyla anomali tespiti için bu sistemlerden yararlanır.
- İçerik Moderasyonu: Büyük medya platformları, uygunsuz içerikleri otomatik olarak işaretlemek veya yüklemeleri konuya göre kategorilere ayırmak için video anlamadan yararlanır; böylece manuel inceleme ihtiyacı büyük ölçüde azalır.
İlişkili Kavramları Ayırt Etme#
Video anlama geniş bir yetenek yelpazesini kapsasa da yapay zekâ alanındaki bazı ilgili terimlerden farklıdır.
- Video Anlama ve Nesne Takibi: Takip, belirli bir araba gibi bir örneğin kareler arasında hareket ederken benzersiz kimliğini korumaya odaklanır. Video anlama ise bu arabanın "park ettiğini" veya "hız yaptığını" tanımak gibi davranışını yorumlar.
- Video Anlama ve Poz Tahmini: Poz tahmini, tek bir karede veya dizide vücut eklemlerinin geometrik yapılandırmasını tespit eder. Video anlama, "selam vermek" gibi hareketin anlamını çıkarmak için bu verileri kullanır.
- Video Anlama ve Çok Modlu Yapay Zekâ: Video anlama görsel dizilere odaklanırken çok modlu yapay zekâ, daha bütüncül bir analiz için videoyu ses, metin veya sensör verileriyle birleştirir.
Ultralytics YOLO26 ile Video Analizi Uygulama#
Video anlamada temel adımlardan biri, zamansal sürekliliği oluşturmak için nesneleri sağlam bir şekilde tespit etmek ve takip etmektir. Ultralytics YOLO26 modeli, daha üst düzey davranış analizinin öncülü olarak hizmet eden gerçek zamanlı takip için son teknoloji düzeyinde performans sunar.
Aşağıdaki örnek, Python API kullanarak bir video kaynağında nesne takibinin nasıl gerçekleştirileceğini gösterir:
from ultralytics import YOLO
# Load the official YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Track objects in a video file with persistence to maintain IDs
# 'show=True' visualizes the tracking in real-time
results = model.track(source="path/to/video.mp4", persist=True, show=True)Zorluklar ve Gelecekteki Eğilimler#
Önemli ilerlemelere rağmen video anlama, yüksek çözünürlüklü video akışlarındaki çok büyük veri hacmi nedeniyle hesaplama açısından maliyetli olmaya devam etmektedir. 3B evrişimler veya zamansal Transformer'lar için FLOPS hesaplamak, uç yapay zekâ cihazları için karşılanamayacak kadar maliyetli olabilir. Bu sorunu çözmek için araştırmacılar Zamansal Kaydırma Modülü (TSM) gibi verimli mimariler geliştiriyor ve gerçek zamanlı çıkarımı mümkün kılmak için NVIDIA TensorRT gibi optimizasyon araçlarından yararlanıyor.
Gelecekteki gelişmeler, modellerin daha derin bir kavrayış elde etmek için ses ipuçlarını (ör. bir siren) ve metinsel bağlamı birleştirdiği gelişmiş çok modlu öğrenmeye yöneliyor. Ultralytics Platform gibi platformlar da karmaşık video veri kümelerinin etiketlenmesini ve yönetilmesini kolaylaştıracak şekilde gelişiyor; böylece belirli zamansal görevler için özel modeller eğitmek daha kolay hale geliyor.









