Deep Reinforcement Learning
Derin Pekiştirmeli Öğrenmeyi (DRL) ve yapay zeka karar vermeyi derin öğrenmeyle nasıl birleştirdiğini keşfet. Bugün Ultralytics YOLO26'yı algı katmanı olarak kullanmayı öğren.
Derin Pekiştirmeli Öğrenme (Deep Reinforcement Learning - DRL), yapay zekânın (AI) karar verme yeteneklerini pekiştirmeli öğrenmenin gücüyle ve derin öğrenmenin (DL) algısal gücüyle birleştiren gelişmiş bir alt kümesidir. Geleneksel pekiştirmeli öğrenme, durumları eylemlerle eşleştirmek için tablo tabanlı yöntemlere güvenirken, ortam karmaşık veya görsel olduğunda bu yöntemler zorlanır. DRL, video kareleri veya sensör okumaları gibi yüksek boyutlu girdi verilerini yorumlamak için sinir ağlarını kullanarak bu sorunun üstesinden gelir ve makinelerin açık bir insan talimatı olmadan doğrudan ham deneyimden etkili stratejiler öğrenmesini sağlar.
DRL'in Temel Mekanizması#
Bir DRL sisteminde, bir AI ajanı ayrık zaman adımlarında bir ortamla etkileşime girer. Her adımda ajan mevcut "durumu" gözlemler, bir politikaya dayalı olarak bir eylem seçer ve bu eylemin başarısını veya başarısızlığını belirten bir ödül sinyali alır. Birincil amaç, zaman içinde kümülatif ödülü maksimize etmektir.
"Derin" bileşeni, politikayı (hareket etme stratejisini) veya değer fonksiyonunu (tahmini gelecekteki ödülü) yaklaştırmak için derin sinir ağlarının kullanılmasını ifade eder. Bu, ajanın yapısız verileri işlemesini sağlayarak, ortamı bir insan gibi "görmek" için bilgisayarlı görüden (CV) yararlanmasına olanak tanır. Bu yetenek, bu karmaşık ağların eğitilmesini kolaylaştıran PyTorch veya TensorFlow gibi çerçeveler tarafından desteklenir.
Gerçek Dünya Uygulamaları#
DRL, teorik araştırmaların ötesine geçerek çeşitli endüstrilerde pratik ve yüksek etkili uygulamalara dönüşmüştür:
- Gelişmiş Robotik: Robotikte AI alanında DRL, makinelerin kodlanması zor olan karmaşık motor becerilerinde ustalaşmasını sağlar. Robotlar, NVIDIA Isaac Sim gibi fizik motorları içinde hareketlerini geliştirerek düzensiz nesneleri kavramayı veya engebeli arazilerde ilerlemeyi öğrenebilir. Bu genellikle politikayı fiziksel donanıma dağıtmadan önce sentetik veriler üzerinde eğitim almayı içerir.
- Otonom Sürüş: Otonom araçlar, öngörülemeyen trafik senaryolarında gerçek zamanlı kararlar almak için DRL'den yararlanır. Nesne algılama modelleri yayaları ve tabelaları tanımlarken, DRL algoritmaları şerit birleştirme, kavşak navigasyonu ve hız kontrolü için güvenli sürüş politikaları belirlemek amacıyla bu bilgileri kullanır ve güvenlik için gereken çıkarım gecikmesini etkili bir şekilde yönetir.
Durum Gözlemcisi Olarak Görme#
Birçok DRL uygulaması için "durum" görseldir. Yüksek hızlı modeller ajanın gözleri gibi davranarak ham görüntüleri, politika ağının üzerinde işlem yapabileceği yapılandırılmış verilere dönüştürür. Aşağıdaki örnek, YOLO26 modelinin bir ajan için algılama katmanı olarak nasıl hizmet ettiğini, ortamdan gözlemleri (ör. engel sayıları) çıkardığını göstermektedir.
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")DRL'i İlgili Kavramlardan Ayırt Etmek#
Derin Pekiştirmeli Öğrenme'nin AI dünyasındaki benzersiz konumunu anlamak için benzer terimlerden ayırt edilmesine yardımcı olmak faydalıdır:
- Pekiştirmeli Öğrenme (RL): Standart RL temel kavramdır ancak genellikle büyük durum uzayları için kullanışsız hale gelen arama tablolarına (Q-tabloları gibi) güvenir. DRL, fonksiyonları yaklaştırmak için derin öğrenmeyi kullanarak bunu çözer ve görüntüler gibi karmaşık girdileri işlemesini sağlar.
- İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF): DRL genellikle matematiksel olarak tanımlanmış bir ödül fonksiyonu (ör. bir oyundaki puanlar) için optimize edilirken, RLHF modelleri—özellikle Büyük Dil Modellerini (LLM'ler)—AI davranışını insan değerleriyle uyumlu hale getirmek için öznel insan tercihlerini kullanarak iyileştirir; bu teknik OpenAI gibi araştırma grupları tarafından popüler hale getirilmiştir.
- Gözetimsiz Öğrenme: Gözetimsiz yöntemler, açık bir geri bildirim olmaksızın verilerdeki gizli örüntüleri arar. Buna karşın DRL, Sutton ve Barto'nun temel metinlerinde tartışıldığı gibi, ajanı belirli bir hedefe doğru aktif olarak yönlendiren bir ödül sinyali tarafından yönlendirilen, hedef odaklıdır.
DRL sistemlerinin algılama katmanları için gereken veri kümelerini yönetmek isteyen geliştiriciler, etiketleme ve bulut eğitim iş akışlarını basitleştiren Ultralytics Platform kullanabilir. Ek olarak araştırmacılar, DRL algoritmalarını mevcut kıyaslama değerlerine karşı test etmek için genellikle Gymnasium gibi standardize edilmiş ortamlar kullanır.






