YOLO Vision 2026:
Ultralytics Sözlüğüne dön

Process Reward Model (PRM)

Süreç Ödül Modellerinin (PRM) AI akıl yürütmeyi nasıl iyileştirdiğini keşfet. RLHF'deki adım düzeyinde geri bildirimin, LLM'ler ve Ultralytics YOLO26 için nasıl mantıklı ve güvenli yollar sağladığını öğren.

Karmaşık artificial intelligence modellerini değerlendirmek, yalnızca nihai sonucun doğru olup olmadığını kontrol etmekten fazlasını gerektirir. Oldukça özelleşmiş bir reinforcement learning tekniği, bir göre sırasında yapay zekanın attığı her ara adıma matematiksel puanlar atayarak dense, step-level feedback sağlar. Bu ayrıntılı yaklaşım, modelin yalnızca doğru hedefe ulaşmasını değil, aynı zamanda oraya ulaşmak için mantıksal, güvenli ve doğrulanabilir yolları izlemesini de sağlar.

Süreç Ödül Modelleri ve Sonuç Ödül Modelleri#

Reward Modeling konusunun daha geniş bağlamında, süreç tabanlı ve sonuç tabanlı denetim arasında ayrım yapmak önemlidir. Geleneksel Sonuç Ödül Modelleri (ORM'ler), bir üretim sürecinin en sonunda tek ve seyrek bir ödül sağlar. ORM'leri eğitmek daha kolay olsa da, karmaşık görevlerde büyük bir dezavantajdan muzdariptirler: Kusurlu mantık veya hallucinations yoluyla doğru cevaba ulaşan modelleri yanlışlıkla ödüllendirebilirler.

Bir Process Reward Model (PRM), tüm muhakeme yörüngesini değerlendirerek bunu çözer. Let's Verify Step by Step gibi makalelerde temel OpenAI research çalışmalarıyla popülerleştiği üzere, bir PRM her düşünceye veya eyleme stepwise supervision uygular. Bu, Proximal Policy Optimization (PPO) gibi algoritmaları kullanarak politika optimizasyonunu aktif olarak yönlendirdiği için gelişmiş Reinforcement Learning from Human Feedback (RLHF) boru hatlarının kritik bir bileşenidir.

Gerçek Dünya Uygulamaları#

PRM'ler, Large Language Models (LLMs) ve otonom sistemlerin yüksek riskli ortamlarda çalışma şeklini dönüştürüyor:

  • Mathematical Reasoning: Denklemleri satır satır değerlendiren PRM'ler, modellerin birden fazla çözüm yolunu keşfetmek ve mantıksal açıdan en sağlam sırayı seçmek için Best-of-N (BoN) sampling veya Monte Carlo Tree Search (MCTS) gibi algoritmaları kullanmasına olanak tanır.
  • Code Generation: Yazılım üretirken, yalnızca nihai betiğin çalışıp çalışmadığını kontrol etmek yetersizdir. PRM'ler süreç denetimi sağlayarak kodun verimli, güvenli ve sürdürülebilir olmasını sağlamak için bireysel fonksiyonları ve mantık bloklarını puanlar.
  • Operations Research and Visual Agents: 2025 ve 2026 yıllarındaki son gelişmeler, PRM'leri metnin ötesine taşıdı. Örneğin, yöneylem araştırması artık karmaşık zamanlama algoritmalarını doğrulamak için PRM'leri kullanıyor. Benzer şekilde, Ultralytics YOLO26 gibi güçlü computer vision motorlarıyla donatılmış görsel AI agents, yalnızca bir hedefe ulaşmak için tek bir ödül almak yerine, fiziksel ortamlarda gezinmek için adım adım ödüller alır.

Adım Düzeyinde Geri Bildirimi Uygulamak#

Bir PRM'yi eğitmek, her bir alt adımın insanlar veya daha güçlü yapay zeka modelleri tarafından değerlendirildiği kapsamlı veri setlerinin yönetilmesini gerektirir. Bu yoğun data annotation iş akışlarını yönetmek, proje organizasyonunu ve dağıtımını kolaylaştıran Ultralytics Platform gibi bulut tabanlı araçlarla daha basit hale gelir.

Çıkarım veya model optimization sırasında PRM, adım zincirine dayalı kümülatif bir kayıp veya ödül hesaplar. torch kullanan aşağıdaki kavramsal Python kod parçacığı, sıra puanlama için PyTorch documentation içinde bulunan yaygın bir yaklaşımla, ara bir adımın başarısız olması durumunda adım düzeyindeki ödüllerin nasıl cezalandırıldığını gösterir.

import torch

# Simulate reward scores from a PRM for 3 consecutive reasoning steps
# Scores represent the probability of correctness for each step (0.0 to 1.0)
step_rewards = torch.tensor([0.95, 0.80, 0.15], requires_grad=True)

# The PRM aggregates the scores, heavily penalizing the poor 3rd step
# Negative log-likelihood is commonly used to optimize the trajectory
prm_loss = -torch.log(step_rewards).mean()

print(f"Calculated PRM Loss: {prm_loss.item():.4f}")
# During RLHF, this loss would guide hyperparameter tuning and model updates

Geliştiriciler, her ara adımın beklenen davranışla uyumlu olmasını sağlayarak son derece güvenilir sistemler dağıtabilir. Süreç düzeyinde denetimi sürekli hyperparameter tuning ile birleştirmek, yeni nesil modellerin sorunlar üzerinde güvenli ve etkili bir şekilde gerçekten akıl yürütebilmesini sağlar.

Explore solutions

Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin

Yapay zekanın geleceğini birlikte inşa edelim!

Yolculuğuna makine öğreniminin geleceğiyle başla