Reinforcement Learning
Pekiştirmeli Öğrenmenin (RL) temel kavramlarını keşfet. Temsilcilerin görevlerde ustalaşmak için geri bildirimi nasıl kullandığını ve Ultralytics YOLO26'nın RL vizyon sistemlerini nasıl desteklediğini gör.
Pekiştirmeli Öğrenme (RL), bir ajana bilinen otonom sistemin eylemler gerçekleştirerek ve ortamından geri bildirim alarak kararlar almayı öğrendiği makine öğrenimi (ML) odaklı bir hedef odaklı alt kümesidir. Doğru yanıtlarla etiketlenmiş statik veri kümelerine dayanan denetimli öğrenme yönteminin aksine, RL algoritmaları dinamik bir deneme yanılma sürecinden geçerek öğrenir. Ajan, hangi stratejilerin en yüksek uzun vadeli ödülleri sağlayacağını belirlemek için eylemlerinin sonuçlarını gözlemleyerek bir simülasyon veya gerçek dünya ile etkileşime girer. Bu yaklaşım, davranışın zaman içinde olumlu pekiştirme (ödüller) ve olumsuz pekiştirme (cezalar) yoluyla şekillendirildiği edimsel koşullandırma psikolojik kavramını yakından taklit eder.
RL Döngüsünün Temel Kavramları#
RL'nin nasıl çalıştığını anlamak için bunu sürekli bir etkileşim döngüsü olarak görselleştirmek faydalıdır. Bu çerçeve, genellikle sonuçların kısmen rastgele ve kısmen karar verici tarafından kontrol edildiği durumlarda karar vermeyi yapılandıran bir Markov Karar Süreci (MDP) olarak matematiksel olarak resmileştirilir.
Bu öğrenme döngüsünün temel bileşenleri şunlardır:
- YAI Ajanı: Öğrenmeden ve karar vermekten sorumlu olan varlık. Ortamı algılar ve kümülatif başarısını maksimize etmek için eylemler gerçekleştirir.
- Ortam: Ajanın içinde faaliyet gösterdiği dış dünya. Bu, karmaşık bir video oyunu, finansal piyasa simülasyonu veya lojistikte yapay zeka alanında fiziksel bir depo olabilir.
- Durum: Mevcut durumun anlık görüntüsü veya temsili. Görsel uygulamalarda bu, nesneleri ve engelleri tespit etmek için bilgisayarlı görü (CV) kullanılarak kamera akışlarının işlenmesini içerir.
- Eylem: Ajanın yaptığı belirli hamle veya seçim. Tüm olası hamlelerin tam kümesine eylem uzayı denir.
- Ödül: Bir eylemden sonra ortamdan ajana gönderilen sayısal bir sinyal. İyi tasarlanmış bir ödül fonksiyonu, faydalı eylemler için pozitif değerler ve zararlı olanlar için cezalar atar.
- Politika: Ajanın mevcut duruma göre bir sonraki eylemi belirlemek için kullandığı strateji veya kural seti. Q-learning gibi algoritmalar bu politikanın nasıl güncellendiğini ve optimize edildiğini tanımlar.
Gerçek Dünya Uygulamaları#
Pekiştirmeli öğrenme, teorik araştırmaların ötesine geçerek çeşitli sektörlerde pratik ve yüksek etkili kullanımlara ulaşmıştır.
- İleri Düzey Robotik: Robotikte yapay zeka alanında RL, makinelerin kodlanması zor olan karmaşık motor becerilerinde ustalaşmasını sağlar. Robotlar, gerçek dünyaya geçmeden önce NVIDIA Isaac Sim gibi fizik motorlarında eğitim alarak düzensiz nesneleri kavramayı veya engebeli arazilerde gezinmeyi öğrenebilir.
- Otonom Sistemler: Otonom araçlar, öngörülemeyen trafik senaryolarında gerçek zamanlı kararlar almak için RL'yi kullanır. Nesne tespiti modelleri yayaları ve işaretleri tanımlarken, RL algoritmaları şerit birleştirme ve kavşak navigasyonu için güvenli sürüş politikalarının belirlenmesine yardımcı olur.
- Stratejik Optimizasyon: Google DeepMind'ın AlphaGo gibi sistemleri karmaşık masa oyunlarında insan dünya şampiyonlarını yendiğinde RL küresel ilgi gördü. Oyunun ötesinde bu ajanlar, enerji tüketimini azaltmak için veri merkezlerindeki soğutma sistemlerini kontrol etmek gibi endüstriyel lojistiği optimize eder.
Görüntü İşleme ile RL'nin Entegrasyonu#
Birçok modern uygulamada, bir ajanın gözlemlediği "durum" görseldir. YOLO26 gibi yüksek performanslı modeller, ham görüntüleri yapılandırılmış verilere dönüştürerek RL ajanları için algılama katmanı görevi görür. İşlenen bu bilgiler—nesnelerin konumu ve sınıfı gibi—RL politikasının bir eylem seçmek için kullandığı durum haline gelir.
Aşağıdaki örnek, teorik bir RL döngüsü için bir durum temsili (ör. nesne sayısı) oluşturarak bir ortam karesini işlemek için ultralytics paketinin nasıl kullanılacağını göstermektedir.
from ultralytics import YOLO
# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")
# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Process the frame to extract the current 'state'
results = model(observation_frame)
# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")İlgili Terimleri Ayırt Etme#
Pekiştirmeli Öğrenmeyi diğer makine öğrenimi paradigmalarından ayırmak önemlidir:
- vs. Denetimli Öğrenme: Denetimli öğrenme, etiketli eğitim verileri sağlamak için bilgili bir dış denetçi gerektirir (ör. "bu görüntü bir kedi içerir"). Buna karşılık RL, açık etiketler olmadan kendi eylemlerinin sonuçlarından öğrenir ve keşif yoluyla optimal yolları keşfeder.
- vs. Denetimsiz Öğrenme: Denetimsiz öğrenme, etiketlenmemiş veriler içinde gizli yapıları veya kalıpları bulmaya odaklanır (müşterileri kümelemek gibi). RL farklıdır çünkü açıkça hedef odaklıdır ve yalnızca veri yapısını açıklamak yerine bir ödül sinyalini maksimize etmeye odaklanır.
Hesaplama gücü arttıkça, İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF) gibi teknikler ajanların öğrenme biçimini daha da iyileştirerek hedeflerini karmaşık insani değerler ve güvenlik standartlarıyla daha yakından uyumlu hale getiriyor. Araştırmacılar bu algoritmaları kıyaslamak ve geliştirmek için sıklıkla Gymnasium gibi standartlaştırılmış ortamlar kullanırlar. Bu ajanların algılama katmanları için gereken veri kümelerini yönetmek isteyen ekipler için Ultralytics Platform, açıklama ve model yönetimi için kapsamlı araçlar sunar.






