Deep Reinforcement Learning
Derin Pekiştirmeli Öğrenmeyi (DRL) ve yapay zekâda karar vermeyi derin öğrenmeyle nasıl birleştirdiğini keşfet. Ultralytics YOLO26'yı bugün bir algı katmanı olarak kullanmayı öğren.
Derin Pekiştirmeli Öğrenme (DRL), yapay zekânın (AI) pekiştirmeli öğrenmenin karar verme yeteneklerini [derin öğrenmenin (DL)](https://ultralytics-translation-2.invalid algısal gücüyle birleştiren gelişmiş bir alt dalıdır. Geleneksel pekiştirmeli öğrenme, durumları eylemlerle eşleştirmek için tablo tabanlı yöntemlere dayanırken bu yöntemler ortam karmaşık veya görsel olduğunda zorlanır. DRL, video kareleri veya sensör okumaları gibi yüksek boyutlu girdi verilerini yorumlamak için sinir ağlarını kullanarak bu sorunun üstesinden gelir ve makinelerin açık bir insan talimatı olmadan doğrudan ham deneyimden etkili stratejiler öğrenmesini sağlar.
DRL'nin Temel Mekanizması#
Bir DRL sisteminde AI aracısı, ayrık zaman adımlarında bir ortamla etkileşime girer. Aracı her adımda mevcut "durumu" gözlemler, bir politikaya dayalı olarak bir eylem seçer ve bu eylemin başarısını veya başarısızlığını belirten bir ödül sinyali alır. Temel amaç, zaman içinde kümülatif ödülü en üst düzeye çıkarmaktır.
"Derin" bileşeni, politikayı (eylem stratejisini) veya değer işlevini (tahmini gelecekteki ödülü) yaklaşık olarak hesaplamak için derin sinir ağlarının kullanılmasını ifade eder. Bu, aracının bilgisayarlı görü (CV) kullanarak yapılandırılmamış verileri işlemesini ve ortamı tıpkı bir insan gibi "görmesini" sağlar. Bu yetenek, bu karmaşık ağların eğitilmesini kolaylaştıran PyTorch veya TensorFlow gibi çerçevelerle desteklenir.
Gerçek Dünya Uygulamaları#
DRL, teorik araştırmaların ötesine geçerek çeşitli sektörlerde pratik ve yüksek etkili uygulamalara taşınmıştır:
- Gelişmiş Robotik: Robotikte AI alanında DRL, makinelerin sabit kodla uygulanması zor olan karmaşık motor becerilerinde ustalaşmasını sağlar. Robotlar, NVIDIA Isaac Sim gibi fizik motorlarında hareketlerini iyileştirerek düzensiz nesneleri kavramayı veya engebeli arazilerde ilerlemeyi öğrenebilir. Bu süreç genellikle politikanın fiziksel donanıma dağıtılmasından önce sentetik veriler üzerinde eğitim yapılmasını içerir.
- Otonom Sürüş: Otonom araçlar, öngörülemeyen trafik senaryolarında gerçek zamanlı kararlar almak için DRL'den yararlanır. Nesne algılama modelleri yayaları ve işaretleri belirlerken DRL algoritmaları, şerit birleşme, kavşak geçişi ve hız kontrolü için güvenli sürüş politikalarını belirlemek üzere bu bilgileri kullanır ve güvenlik için gereken çıkarım gecikmesini etkili şekilde yönetir.
Durum Gözlemcisi Olarak Görüntü#
Birçok DRL uygulamasında "durum" görseldir. Yüksek hızlı modeller, ham görüntüleri politika ağının kullanabileceği yapılandırılmış verilere dönüştürerek aracının gözleri gibi işlev görür. Aşağıdaki örnek, YOLO26 modelinin ortamdan gözlemler (ör. engel sayıları) çıkararak bir aracının algı katmanı olarak nasıl görev yaptığını gösterir.
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")DRL'yi İlişkili Kavramlardan Ayırma#
Yapay zekâ dünyasındaki özgün konumunu anlamak için Derin Pekiştirmeli Öğrenmeyi benzer terimlerden ayırmak yararlıdır:
- Pekiştirmeli Öğrenme (RL): Standart RL temel kavramdır ancak genellikle büyük durum uzaylarında kullanışsız hâle gelen arama tablolarına (Q tabloları gibi) dayanır. DRL, işlevleri yaklaşık olarak hesaplamak için derin öğrenmeyi kullanarak bu sorunu çözer ve görüntüler gibi karmaşık girdileri işleyebilmesini sağlar.
- İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF): DRL genellikle matematiksel olarak tanımlanmış bir ödül işlevini (ör. bir oyundaki puanları) eniyilerken RLHF, AI davranışını insan değerleriyle uyumlu hâle getirmek için modelleri—özellikle Büyük Dil Modellerini (LLMs)—öznel insan tercihlerini kullanarak geliştirir. Bu teknik, OpenAI gibi araştırma gruplarının çalışmalarıyla yaygınlaşmıştır.
- Denetimsiz Öğrenme: Denetimsiz yöntemler, açık bir geri bildirim olmadan verilerdeki gizli örüntüleri arar. Buna karşılık DRL, belirli bir hedefe doğru aracıyı etkin biçimde yönlendiren bir ödül sinyaliyle çalışır ve hedef odaklıdır; bu yaklaşım Sutton ve Barto tarafından kaleme alınan temel metinlerde ele alınmıştır.
DRL sistemlerinin algı katmanları için gereken veri kümelerini yönetmek isteyen geliştiriciler, açıklama ve bulut eğitimi iş akışlarını kolaylaştıran Ultralytics Platformundan yararlanabilir. Ayrıca araştırmacılar, DRL algoritmalarını yerleşik temel sonuçlara göre kıyaslamak için genellikle Gymnasium gibi standartlaştırılmış ortamları kullanır.









