Action Recognition
Eylem tanımanın videodaki davranışları nasıl belirlediğini keşfet. Poz tahmini için Ultralytics YOLO26'yı kullanmayı ve HAR görevleri için akıllı yapay zekâ sistemleri oluşturmayı öğren.
Genellikle İnsan Etkinliği Tanıma (HAR) olarak da bilinen eylem tanıma, video verilerinde özneler tarafından gerçekleştirilen belirli davranışları veya hareketleri tanımlamak ve sınıflandırmakla ilgilenen dinamik bir bilgisayarlı görü (CV) alt alanıdır. Geleneksel nesne algılama "görüntüde ne var?" sorusunu yanıtlarken eylem tanıma, "zaman içinde ne oluyor?" şeklindeki daha karmaşık soruyu ele alır. Makine öğrenimi (ML) modelleri, durağan görüntüler yerine kare dizilerini analiz ederek "yürüme", "bisiklete binme", "düşme" veya "el sıkışma" gibi karmaşık etkinlikleri ayırt edebilir; bu da insan niyetini ve bağlamını anlayan akıllı sistemler oluşturmak için eylem tanımayı kritik bir bileşen hâline getirir.
Temel Kavramlar ve Teknikler#
Eylemleri tanımak, bir modelin hem uzamsal bilgileri (nesnelerin veya insanların nasıl göründüğü) hem de zamansal bilgileri (zaman içinde nasıl hareket ettikleri) işlemesini gerektirir. Bunu gerçekleştirmek için modern yapay zekâ (AI) sistemleri genellikle standart evrişimli sinir ağlarının (CNN'ler) ötesine geçen özel mimariler kullanır.
- Poz Tahmini: Modelin insan vücudu üzerindeki dirsek, diz ve omuz gibi belirli kilit noktaları izlediği güçlü bir tekniktir. Bu kilit noktaların zaman içindeki geometrik değişimleri, arka plan karmaşasından bağımsız olarak eylemleri sınıflandırmak için güçlü bir sinyal sağlar.
- Zamansal Modelleme: Algoritmalar, geçmiş kareleri hatırlamak ve gelecekteki eylemleri tahmin etmek için Tekrarlayan Sinir Ağları (RNN'ler) veya Uzun Kısa Süreli Bellek (LSTM) ağları gibi yapılardan yararlanır. Daha yakın zamanda Video Transformer'ları, video akışlarındaki uzun menzilli bağımlılıkları ele alma yetenekleri sayesinde popülerlik kazanmıştır.
- İki Akışlı Ağlar: Bu yaklaşım, uzamsal özellikleri (RGB kareleri) ve zamansal özellikleri (genellikle optik akış kullanarak) paralel akışlarda işler ve son sınıflandırmayı yapmak için verileri birleştirir.
Gerçek Dünya Uygulamaları#
İnsan hareketlerini otomatik olarak yorumlama yeteneği, çeşitli sektörlerde dönüştürücü bir potansiyele sahip olup güvenliği, verimliliği ve kullanıcı deneyimini geliştirir.
- Sağlık Hizmetlerinde AI: Eylem tanıma, hasta izleme sistemleri için hayati önem taşır. Örneğin huzurevlerinde otomatik düşme algılamayı mümkün kılar ve bir hasta düştüğünde personeli anında uyarır. Ayrıca uzaktan fiziksel rehabilitasyon süreçlerinde de kullanılır; burada AI koçları, hareketleri doğru ve güvenli bir şekilde gerçekleştirdiklerinden emin olmak için hastanın egzersiz formunu analiz eder.
- Akıllı Gözetim ve Güvenlik: Gelişmiş güvenlik sistemleri, basit hareket algılamanın ötesine geçerek kavga, mağazadan hırsızlık veya yetkisiz giriş gibi şüpheli davranışları tespit etmek ve zararsız etkinlikleri göz ardı etmek için eylem tanımayı kullanır. Bu, yanlış alarmları azaltır ve gerçek zamanlı güvenlik izlemeyi iyileştirir.
Ultralytics ile Eylem Analizi Uygulama#
Yaygın bir iş akışı, önce insanları ve iskelet pozlarını algılamayı, ardından bu eklemlerin hareketini analiz etmeyi içerir. Ultralytics YOLO26 modeli, birçok eylem tanıma işlem hattının temelini oluşturan ilk poz tahmini adımı için son teknoloji hız ve doğruluk sunar.
Aşağıdaki örnek, Python kullanarak bir video karesinden iskelet kilit noktalarının nasıl çıkarılacağını gösterir:
from ultralytics import YOLO
# Load the YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect person keypoints
results = model("https://ultralytics.com/images/bus.jpg")
# Process results
for result in results:
# Access the keypoints (x, y, visibility)
if result.keypoints is not None:
print(f"Detected keypoints shape: {result.keypoints.data.shape}")İlişkili Terimleri Ayırt Etme#
Doğru yöntemlerin uygulandığından emin olmak için eylem tanımayı benzer bilgisayarlı görü görevlerinden ayırmak önemlidir.
- Eylem Tanıma ve Nesne Takibi: Nesne takibi, belirli bir nesnenin veya kişinin kareler boyunca hareket ederken kimliğini korumaya odaklanır (ör. "Kişi A, X koordinatında"). Eylem tanıma ise izlenen bu öznenin davranışını yorumlar (ör. "Kişi A koşuyor").
- Eylem Tanıma ve Video Anlama: Eylem tanıma belirli fiziksel eylemleri tanımlarken video anlama, bir video sahnesindeki tüm anlatıyı, bağlamı ve nedensel ilişkileri kavramayı içeren daha geniş bir kavramdır.
Zorluklar ve Gelecekteki Eğilimler#
Güçlü eylem tanıma modelleri geliştirmek, özellikle Kinetics-400 veya UCF101 gibi büyük, açıklamalı video veri kümelerine duyulan ihtiyaç nedeniyle zorluklar barındırır. Video verilerini etiketlemek, durağan görüntüleri etiketlemeye kıyasla çok daha fazla zaman alır. Bunun üstesinden gelmek için Ultralytics Platform gibi araçlar, açıklama ekleme ve eğitim iş akışını kolaylaştırmaya yardımcı olur.
Ayrıca hesaplama verimliliği kritik önem taşır. Yüksek çözünürlüklü videoyu gerçek zamanlı olarak işlemek, önemli donanım kaynakları gerektirir. Sektör giderek daha fazla Edge AI yaklaşımına yöneliyor ve gecikme ile bant genişliği kullanımını azaltmak için modelleri doğrudan kameralarda ve mobil cihazlarda çalışacak şekilde optimize ediyor. Gelecekteki gelişmeler, model genellemesini iyileştirmeyi ve sistemlerin açıkça üzerinde eğitilmedikleri bakış açılarından bile eylemleri tanımasını hedefliyor.









