Video Understanding
Video Anlama'nın eylemleri yorumlamak için zamansal dinamikleri nasıl analiz ettiğini keşfet. Gelişmiş yapay zeka için Ultralytics YOLO26 ile gerçek zamanlı izlemeyi uygulamayı öğren.
Video Anlama, makinelerin görsel verileri zaman içinde algılamasını, analiz etmesini ve yorumlamasını sağlamaya odaklanan bilgisayarlı görü (CV) alanının gelişmiş bir dalıdır. Statik anlık görüntüleri tek başına işleyen standart görüntü tanıma süreçlerinin aksine video anlama; zamansal dinamikleri, bağlamı ve nedensel ilişkileri kavrayabilmek için kare dizilerini analiz etmeyi içerir. Zamanın "dördüncü boyutunu" işleyen yapay zeka sistemleri, basit nesne tanımlamanın ötesine geçerek bir sahne içinde gelişen eylemleri, olayları ve anlatıyı anlayabilir. Bu yetenek, dinamik gerçek dünya ortamlarında güvenli ve etkili bir şekilde etkileşim kurabilen akıllı sistemler oluşturmak için esastır.
Video Analizinin Temel Bileşenleri#
Video içeriğini başarılı bir şekilde yorumlamak için modellerin iki ana bilgi türünü sentezlemesi gerekir: uzamsal özellikler (karede ne olduğu) ve zamansal özellikler (şeylerin nasıl değiştiği). Bu, genellikle birden fazla sinir ağı stratejisini birleştiren karmaşık bir mimari gerektirir.
- Evrişimli Sinir Ağları (CNN'ler): Bu ağlar genellikle mekansal omurga görevi görerek bireysel karelerden şekiller, dokular ve nesneler gibi görsel özellikleri çıkarır.
- Tekrarlayan Sinir Ağları (RNN'ler): Uzun Kısa Süreli Bellek (LSTM) birimleri gibi mimariler, CNN tarafından çıkarılan özellik dizisini işlemek için kullanılır ve modelin geçmiş kareleri "hatırlamasını" ve gelecek durumları tahmin etmesini sağlar.
- Optik Akış: Birçok sistem, kareler arasındaki piksellerin hareket vektörlerini açıkça hesaplamak için optik akış algoritmalarını kullanır ve nesne görünümünden bağımsız olarak hız ile yön hakkında kritik veriler sağlar.
- Görüntü Transformer'ları (ViT'ler): Modern yaklaşımlar, farklı karelerin veya bölgelerin önemini tartmak için giderek dikkat mekanizmalarına güvenir ve modelin uzun bir video akışındaki anahtar olaylara odaklanmasını sağlar.
Gerçek Dünya Uygulamaları#
Zamansal bağlamı anlama yeteneği, çeşitli endüstrilerde gelişmiş otomasyonun kapılarını araladı.
- Otonom Araçlar: Sürücüsüz arabalar, yayaların ve diğer araçların rotalarını tahmin etmek için video anlama özelliğini kullanır. Sistem, hareket kalıplarını analiz ederek olası çarpışmaları öngörebilir ve karmaşık manevralar gerçekleştirebilir.
- Eylem Tanıma: Spor analitiğinde ve sağlık izlemede, sistemler otomatik içgörüler veya uyarılar sağlamak için bir oyuncunun gol atması veya bir hastanın düşmesi gibi belirli insan aktivitelerini tanımlar.
- Akıllı Perakende: Mağazalar, hırsızlığı belirlemek veya daha iyi yerleşim optimizasyonu için müşteri yaya trafiği kalıplarını analiz etmek amacıyla anormallik tespiti için bu sistemleri kullanır.
- İçerik Denetimi: Büyük medya platformları, uygunsuz içeriği otomatik olarak işaretlemek veya yüklemeleri konuya göre kategorize etmek için video understanding kullanır, bu da manuel inceleme ihtiyacını büyük ölçüde azaltır.
İlgili Kavramları Ayırt Etme#
Video understanding geniş bir yetenek yelpazesini kapsasa da, AI dünyasındaki diğer birkaç ilgili terimden farklıdır.
- Video Anlama ve Nesne Takibi: Takip, bir örnek (belirli bir araba gibi) kareler arasında hareket ederken onun benzersiz kimliğini korumaya odaklanır. Video anlama ise o arabanın "park ettiğini" veya "hız yaptığını" tanımak gibi davranışını yorumlar.
- Video Anlama ve Poz Tahmini: Poz tahmini, tek bir karede veya dizide vücut eklemlerinin geometrik konfigürasyonunu algılar. Video anlama, "el sallamak" gibi hareketin anlamını çıkarmak için bu verileri kullanır.
- Video Anlama ve Çok Modlu Yapay Zeka: Video anlama görsel dizilere odaklanırken, çok modlu yapay zeka daha bütünsel bir analiz için videoyu ses, metin veya sensör verileriyle birleştirir.
Ultralytics YOLO26 ile Video Analizi Uygulama#
Video anlamada temel bir adım, zamansal sürekliliği sağlamak için nesneleri güvenilir bir şekilde tespit etmek ve izlemektir. Ultralytics YOLO26 modeli, daha üst düzey davranış analizinin öncüsü olarak hizmet veren gerçek zamanlı takip için en son teknoloji performansını sunar.
Aşağıdaki örnek, Python API kullanarak bir video kaynağında nesne takibinin nasıl gerçekleştirileceğini göstermektedir:
from ultralytics import YOLO
# Load the official YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Track objects in a video file with persistence to maintain IDs
# 'show=True' visualizes the tracking in real-time
results = model.track(source="path/to/video.mp4", persist=True, show=True)Zorluklar ve Gelecek Eğilimleri#
Önemli ilerlemelere rağmen video anlama, yüksek tanımlı video akışlarındaki devasa veri hacmi nedeniyle hesaplama açısından maliyetli olmaya devam etmektedir. 3D evrişimler veya zamansal transformer'lar için FLOPS hesaplamak, uç yapay zeka cihazları için zahmetli olabilir. Bunu ele almak için araştırmacılar Zamansal Kaydırma Modülü (TSM) gibi verimli mimariler geliştiriyor ve gerçek zamanlı çıkarımı etkinleştirmek için NVIDIA TensorRT gibi optimizasyon araçlarından yararlanıyor.
Gelecekteki gelişmeler, modellerin daha derin bir kavrayış elde etmek için ses ipuçlarını (örneğin bir siren) ve metinsel bağlamı entegre ettiği gelişmiş çok modlu öğrenmeye doğru ilerlemektedir. Ultralytics Platform gibi platformlar da karmaşık video veri kümelerinin etiketlenmesini ve yönetimini kolaylaştırmak için evrim geçirerek belirli zamansal görevler için özel modeller eğitmenizi daha kolay hale getiriyor.






