Markov Decision Process (MDP)
Markov Karar Süreçlerinin (MDP) temellerini keşfet. MDP'lerin pekiştirmeli öğrenmeyi nasıl yönlendirdiğini ve Ultralytics YOLO26'nın gerçek zamanlı durum verisini nasıl sağladığını öğren.
Markov Karar Süreci (MDP), sonuçların kısmen rastgele olduğu ve kısmen bir karar vericinin kontrolü altında bulunduğu durumlarda karar vermeyi modellemek için kullanılan matematiksel bir çerçevedir. Bir yapay zeka ajanı (AI agent) ile belirli bir hedefe ulaşmak üzere bir çevre etkileşim kurması için yapılandırılmış bir yol sağlayarak pekiştirmeli öğrenme (reinforcement learning - RL) için temel planı oluşturur. Statik etiketli veri kümelerine dayanan standart denetimli öğrenmenin (supervised learning) aksine, bir MDP, mevcut eylemlerin gelecekteki olasılıkları etkilediği ardışık karar vermeye odaklanır.
Bir MDP'nin Temel Bileşenleri#
Bir MDP'nin nasıl çalıştığını anlamak için, onu bir aracı ile çevresi arasındaki etkileşim döngüsü olarak görselleştirmek faydalıdır. Bu döngü beş temel bileşenle tanımlanır:
- Durum: Çevrenin mevcut durumu veya konfigürasyonu. Otonom araçlarda, durum arabanın hızını, konumunu ve bilgisayarlı görü (computer vision - CV) sensörleri tarafından algılanan yakındaki engelleri içerebilir.
- Eylem: Ajan için mevcut olan tüm olası hamlelerin veya seçimlerin kümesi. Bu genellikle ayrık (örneğin, sola git, sağa git) veya sürekli (örneğin, direksiyon açısını ayarlama) olabilen eylem uzayı olarak adlandırılır.
- Geçiş Olasılığı: Bu, belirli bir eylemi gerçekleştirdikten sonra bir durumdan diğerine geçme olasılığını tanımlar. MDP'leri deterministik sistemlerden ayıran, gerçek dünyanın belirsizliğini ve dinamiklerini hesaba katar.
- Ödül: Her eylemden sonra alınan sayısal bir sinyal. Ödül fonksiyonu çok önemlidir çünkü ajanın davranışını yönlendirir; pozitif ödüller arzu edilen eylemleri teşvik ederken, negatif ödüller (cezalar) hataları caydırır.
- İndirim Faktörü: Gelecekteki ödüllerin hemen elde edilenlere kıyasla önemini belirleyen bir değer. Ajanın kısa vadeli tatmin yerine uzun vadeli planlamaya öncelik vermesine yardımcı olur; bu kavram stratejik optimizasyonun merkezindedir.
Gerçek Dünya Uygulamaları#
MDP'ler, birçok ileri teknolojinin arkasındaki karar verme motoru görevi görerek sistemlerin karmaşık ve dinamik ortamlarda gezinmesini sağlar.
- Robotik Kontrolü: Robotikte yapay zeka alanında, MDP'ler makinelerin karmaşık motor becerileri öğrenmesini sağlar. Örneğin, robotik bir kol, çarpışmalardan kaçınırken bir nesneyi almak için en optimal yolu belirlemek üzere MDP'leri kullanır. Durum, 3D nesne algılama özelliğinden türetilen eklem açıları ve nesne konumudur ve ödül, başarılı kavrama hızına dayanır.
- Envanter Yönetimi: Perakendeciler envanter optimizasyonu için MDP'leri kullanır. Burada durum mevcut stok seviyelerini temsil eder, eylemler yeniden sipariş kararlarıdır ve ödüller kar marjlarından depolama ve stok tükenme maliyetleri çıkarılarak hesaplanır.
- Sağlık Tedavisi: Kişiselleştirilmiş tıpta MDP'ler dinamik tedavi planları tasarlamaya yardımcı olur. Doktorlar, hasta sağlık metriklerini durumlar ve ilaçları eylemler olarak modellediklerinde, hastanın uzun vadeli sağlık sonuçlarını maksimize etmek için tahmine dayalı modellemeden yararlanabilirler.
Pekiştirmeli Öğrenme ile İlişkisi#
Yakından ilişkili olmakla birlikte, bir MDP ile Pekiştirmeli Öğrenme arasında ayrım yapmak önemlidir. Bir MDP resmi problem tanımıdır—çevrenin matematiksel modelidir. Pekiştirmeli Öğrenme, iç dinamikler (geçiş olasılıkları) tam olarak bilinmediğinde bu problemi çözmek için kullanılan yöntemdir. Q-learning gibi RL algoritmaları, deneme yanılma yoluyla en iyi politikayı öğrenmek için MDP ile etkileşime girer.
MDP'lerde Görsel Gözlem#
Modern yapay zeka uygulamalarında, bir MDP'nin "durumu" genellikle görsel verilerden türetilir. Yüksek hızlı algılama modelleri sistemin gözleri gibi hareket ederek ham kamera akışlarını MDP'nin işleyebileceği yapılandırılmış verilere dönüştürür. Örneğin, Ultralytics YOLO26, bir karar verici ajan için durum girdileri olarak hizmet eden gerçek zamanlı nesne koordinatları sağlayabilir.
Aşağıdaki örnek, bir MDP politikasına aktarılabilecek bir durum temsilinin (sınırlayıcı kutular) Python kullanılarak bir görüntüden nasıl çıkarılacağını göstermektedir.
from ultralytics import YOLO
# Load the YOLO26 model to serve as the perception layer
model = YOLO("yolo26n.pt")
# Perform inference to observe the current 'state' of the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Extract bounding box coordinates to form the state vector
# This structured data tells the agent where objects are located
for box in results[0].boxes:
print(f"State Object: Class {int(box.cls)} at {box.xywh.tolist()}")Güçlü görü modellerini MDP çerçeveleriyle entegre ederek geliştiriciler yalnızca dünyayı algılamakla kalmayıp aynı zamanda bunun içinde akıllı, uyarlanabilir kararlar alan sistemler oluşturabilirler. Bu sinerji, otonom sistemlerin ve akıllı üretim sistemlerinin ilerlemesi için esastır.






