Markov Decision Process (MDP)
Markov Karar Süreçlerinin (MDP) temellerini keşfet. MDP'lerin pekiştirmeli öğrenmeyi nasıl yönlendirdiğini ve Ultralytics YOLO26'nın gerçek zamanlı durum verilerini nasıl sağladığını öğren.
Markov Karar Süreci (MDP), sonuçların kısmen rastlantısal, kısmen de karar vericinin kontrolünde olduğu durumlarda karar vermeyi modellemek için kullanılan matematiksel bir çerçevedir. Belirli bir hedefe ulaşmak için bir yapay zeka ajanının bir ortamla etkileşime geçmesini yapılandırılmış bir şekilde sağlayan pekiştirmeli öğrenmenin (RL) temel taslağıdır. Statik etiketli veri kümelerine dayanan standart denetimli öğrenmenin aksine MDP, mevcut eylemlerin gelecekteki olasılıkları etkilediği sıralı karar vermeye odaklanır.
MDP'nin Temel Bileşenleri#
Bir MDP'nin nasıl çalıştığını anlamak için onu bir ajan ile ortamı arasındaki etkileşim döngüsü olarak görselleştirmek faydalıdır. Bu döngü beş temel bileşenle tanımlanır:
- Durum: Ortamın mevcut durumu veya yapılandırmasıdır. Otonom araçlarda durum; aracın hızı, konumu ve bilgisayarlı görü (CV) sensörleri tarafından algılanan yakındaki engelleri içerebilir.
- Eylem: Ajanın kullanabileceği tüm olası hamleler veya seçenekler kümesidir. Bu genellikle ayrık (ör. sola hareket etme, sağa hareket etme) veya sürekli (ör. direksiyon açısını ayarlama) olabilen eylem uzayı olarak adlandırılır.
- Geçiş Olasılığı: Belirli bir eylem gerçekleştirildikten sonra bir durumdan diğerine geçme olasılığını tanımlar. Gerçek dünyanın belirsizliğini ve dinamiklerini hesaba katarak MDP'leri deterministik sistemlerden ayırır.
- Ödül: Her eylemden sonra alınan sayısal bir sinyaldir. Ödül işlevi kritik öneme sahiptir çünkü ajanın davranışını yönlendirir; pozitif ödüller arzu edilen eylemleri teşvik ederken negatif ödüller (cezalar) hataları caydırır.
- İskonto Faktörü: Gelecekteki ödüllerin anlık ödüllere kıyasla önemini belirleyen bir değerdir. Ajanın kısa vadeli haz yerine uzun vadeli planlamaya öncelik vermesine yardımcı olur; bu, stratejik optimizasyonun temelindeki bir kavramdır.
Gerçek Dünya Uygulamaları#
MDP'ler, birçok ileri teknolojinin arkasındaki karar verme motoru olarak işlev görerek sistemlerin karmaşık ve dinamik ortamlarda yol almasını sağlar.
- Robotik Kontrolü: Robotikte yapay zeka alanında MDP'ler, makinelerin karmaşık motor becerileri öğrenmesini sağlar. Örneğin bir robot kolu, çarpışmalardan kaçınırken bir nesneyi almak için en uygun yolu belirlemek üzere MDP'leri kullanır. Durum, 3B nesne algılamadan elde edilen eklem açıları ve nesnenin konumudur; ödül ise başarılı kavrama hızına göre belirlenir.
- Envanter Yönetimi: Perakendeciler envanter optimizasyonu için MDP'leri kullanır. Burada durum mevcut stok düzeylerini, eylemler yeniden sipariş verme kararlarını, ödüller ise depolama ve stok tükenmesi maliyetleri çıkarıldıktan sonraki kâr marjlarını temsil eder.
- Sağlık Hizmetlerinde Tedavi: Kişiselleştirilmiş tıpta MDP'ler dinamik tedavi planları tasarlamaya yardımcı olur. Doktorlar, hasta sağlık ölçümlerini durumlar ve ilaçları eylemler olarak modelleyerek öngörücü modellemeyi hastanın uzun vadeli sağlık sonuçlarını en üst düzeye çıkarmak için kullanabilir.
Pekiştirmeli Öğrenmeyle İlişkisi#
Yakından ilişkili olsalar da MDP ile Pekiştirmeli Öğrenme arasındaki ayrımı yapmak önemlidir. MDP, biçimsel problem tanımıdır; yani ortamın matematiksel modelidir. Pekiştirmeli Öğrenme, iç dinamikler (geçiş olasılıkları) tam olarak bilinmediğinde bu problemi çözmek için kullanılan yöntemdir. Q-öğrenmesi gibi RL algoritmaları, deneme yanılma yoluyla en iyi politikayı öğrenmek için MDP ile etkileşime girer.
MDP'lerde Görsel Gözlem#
Modern yapay zeka uygulamalarında bir MDP'nin "durumu" genellikle görsel verilerden elde edilir. Yüksek hızlı algılama modelleri sistemin gözleri gibi hareket ederek ham kamera görüntülerini MDP'nin işleyebileceği yapılandırılmış verilere dönüştürür. Örneğin Ultralytics YOLO26, bir karar verme ajanı için durum girdileri olarak kullanılan gerçek zamanlı nesne koordinatları sağlayabilir.
Aşağıdaki örnek, Python kullanarak bir görüntüden durum temsilinin (sınırlayıcı kutuların) nasıl çıkarılacağını ve ardından bunun bir MDP politikasına aktarılabileceğini gösterir.
from ultralytics import YOLO
# Load the YOLO26 model to serve as the perception layer
model = YOLO("yolo26n.pt")
# Perform inference to observe the current 'state' of the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Extract bounding box coordinates to form the state vector
# This structured data tells the agent where objects are located
for box in results[0].boxes:
print(f"State Object: Class {int(box.cls)} at {box.xywh.tolist()}")Geliştiriciler, güçlü görü modellerini MDP çerçeveleriyle entegre ederek yalnızca dünyayı algılayan değil, aynı zamanda bu dünya içinde akıllı ve uyarlanabilir kararlar alan sistemler oluşturabilir. Bu sinerji, otonom sistemlerin ve akıllı üretimin ilerlemesi için kritik öneme sahiptir.









