Reinforcement Learning
Pekiştirmeli Öğrenmenin (RL) temel kavramlarını keşfet. Aracıların görevlerde ustalaşmak için geri bildirimi nasıl kullandığını öğren ve Ultralytics YOLO26'nın pekiştirmeli öğrenme görsel sistemlerine nasıl güç verdiğini gör.
Pekiştirmeli öğrenme (RL), bir aracı olarak bilinen otonom bir sistemin eylemler gerçekleştirip ortamından geri bildirim alarak karar vermeyi öğrendiği, hedef odaklı bir makine öğrenimi (ML) alt dalıdır. Doğru yanıtlarla etiketlenmiş statik veri kümelerine dayanan denetimli öğrenmenin aksine, RL algoritmaları dinamik bir deneme-yanılma süreciyle öğrenir. Aracı, bir simülasyonla veya gerçek dünyayla etkileşime girer ve hangi stratejilerin en yüksek uzun vadeli ödülleri sağladığını belirlemek için eylemlerinin sonuçlarını gözlemler. Bu yaklaşım, davranışın zaman içinde pozitif pekiştirme (ödüller) ve negatif pekiştirme (cezalar) yoluyla şekillendirildiği edimsel koşullanma psikolojik kavramını yakından taklit eder.
RL Döngüsünün Temel Kavramları#
RL'nin nasıl çalıştığını anlamak için onu sürekli bir etkileşim döngüsü olarak görselleştirmek faydalıdır. Bu çerçeve genellikle, sonuçların kısmen rastgele ve kısmen karar verici tarafından kontrol edildiği durumlardaki karar alma sürecini yapılandıran bir Markov Karar Süreci (MDP) olarak matematiksel biçimde ifade edilir.
Bu öğrenme döngüsünün başlıca bileşenleri şunlardır:
- Yapay zekâ aracısı: Öğrenmeden ve karar vermeden sorumlu varlıktır. Ortamı algılar ve kümülatif başarısını en üst düzeye çıkarmak için eylemlerde bulunur.
- Ortam: Aracının faaliyet gösterdiği dış dünyadır. Bu ortam, karmaşık bir video oyunu, bir finansal piyasa simülasyonu veya lojistikte yapay zekâ kullanılan fiziksel bir depo olabilir.
- Durum: Mevcut durumun anlık görüntüsü veya temsilidir. Görsel uygulamalarda bu genellikle nesneleri ve engelleri algılamak için kamera görüntülerinin bilgisayarlı görü (CV) kullanılarak işlenmesini içerir.
- Eylem: Aracının gerçekleştirdiği belirli hamle veya seçimdir. Olası tüm hamlelerin oluşturduğu küme eylem uzayı olarak adlandırılır.
- Ödül: Bir eylemden sonra ortamdan aracıya gönderilen sayısal sinyaldir. İyi tasarlanmış bir ödül işlevi, yararlı eylemlere pozitif değerler, zararlı eylemlere ise cezalar atar.
- Politika: Aracının mevcut duruma göre bir sonraki eylemi belirlemek için kullandığı strateji veya kural kümesidir. Q-learning gibi algoritmalar bu politikanın nasıl güncelleneceğini ve optimize edileceğini tanımlar.
Gerçek Dünya Uygulamaları#
Pekiştirmeli öğrenme, teorik araştırmaların ötesine geçerek çeşitli sektörlerde pratik ve yüksek etkili uygulamalarda kullanılmaya başlanmıştır.
- Gelişmiş Robotik: Robotikte yapay zekâ alanında RL, makinelerin sabit kodla tanımlanması zor olan karmaşık motor becerilerinde ustalaşmasını sağlar. Robotlar, gerçek dünyaya geçirilmeden önce NVIDIA Isaac Sim gibi fizik motorlarında eğitilerek düzensiz nesneleri kavramayı veya engebeli arazilerde ilerlemeyi öğrenebilir.
- Otonom Sistemler: Otonom araçlar, öngörülemeyen trafik senaryolarında gerçek zamanlı kararlar almak için RL'den yararlanır. Nesne algılama modelleri yayaları ve trafik işaretlerini belirlerken RL algoritmaları, şerit birleşimi ve kavşaklarda ilerleme için güvenli sürüş politikalarının belirlenmesine yardımcı olur.
- Stratejik Optimizasyon: RL, Google DeepMind'ın AlphaGo'su gibi sistemlerin karmaşık masa oyunlarında insan dünya şampiyonlarını yenmesiyle dünya çapında ilgi gördü. Bu aracılar oyunların ötesinde, enerji tüketimini azaltmak amacıyla veri merkezlerindeki soğutma sistemlerini kontrol etmek gibi endüstriyel lojistik süreçlerini optimize eder.
Görüntüyü RL ile Entegre Etme#
Birçok modern uygulamada aracının gözlemlediği "durum" görseldir. YOLO26 gibi yüksek performanslı modeller, RL aracılarının algılama katmanı olarak görev yaparak ham görüntüleri yapılandırılmış verilere dönüştürür. Nesnelerin konumu ve sınıfı gibi işlenmiş bu bilgiler, RL politikasının bir eylem seçmek için kullandığı durumu oluşturur.
Aşağıdaki örnek, teorik bir RL döngüsü için bir ortam karesinin işlenerek durum temsilinin (ör. nesne sayısı) nasıl oluşturulacağını göstermek amacıyla ultralytics paketinin nasıl kullanılacağını gösterir.
from ultralytics import YOLO
# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")
# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Process the frame to extract the current 'state'
results = model(observation_frame)
# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")İlgili Terimleri Birbirinden Ayırma#
Pekiştirmeli Öğrenmeyi diğer makine öğrenimi paradigmalarından ayırt etmek önemlidir:
- Denetimli Öğrenmeye kıyasla: Denetimli öğrenme, etiketlenmiş eğitim verileri (ör. "bu görüntü bir kedi içeriyor") sağlamak için bilgili bir dış denetleyici gerektirir. Buna karşılık RL, açık etiketler olmadan kendi eylemlerinin sonuçlarından öğrenir ve keşif yoluyla en uygun yolları bulur.
- Denetimsiz Öğrenmeye kıyasla: Denetimsiz öğrenme, etiketsiz verilerdeki gizli yapıları veya örüntüleri (müşterileri kümelendirmek gibi) bulmaya odaklanır. RL ise açıkça hedef odaklıdır; yalnızca veri yapısını açıklamak yerine bir ödül sinyalini en üst düzeye çıkarmaya odaklanır.
Hesaplama gücü arttıkça İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF) gibi teknikler, aracıların öğrenme biçimini daha da geliştirerek hedeflerini karmaşık insani değerler ve güvenlik standartlarıyla daha yakından uyumlu hâle getiriyor. Araştırmacılar bu algoritmaları kıyaslamak ve geliştirmek için sıklıkla Gymnasium gibi standartlaştırılmış ortamları kullanır. Bu aracıların algılama katmanları için gereken veri kümelerini yönetmek isteyen ekipler için Ultralytics Platformu, kapsamlı açıklama ve model yönetimi araçları sunar.









