YOLO Vision 2026:
Ultralytics Sözlüğüne dön

Reinforcement Learning with Verifiable Rewards (RLVR)

Doğrulanabilir Ödüllerle Pekiştirmeli Öğrenmeyi (RLVR) keşfet. Deterministik geri bildirim ve Ultralytics YOLO26 kullanarak nasıl gelişmiş yapay zeka eğitebileceğini öğren.

Doğrulanabilir Ödüllerle Pekiştirmeli Öğrenme (RLVR), yapay zeka (AI) modellerinin akıl yürütme ve problem çözme yeteneklerini geliştirmek için kullanılan gelişmiş bir eğitim paradigmasıdır. İnsan tarafından etiketlenmiş tercih verilerine dayanan geleneksel eğitim yöntemlerinin aksine RLVR, bir modelin çıktısını değerlendirmek için belirleyici, kural tabanlı sistemler kullanır. Üretilen bir kod parçasının derlenmesi veya matematiksel bir denklemin doğru şekilde çözülmesi gibi nesnel, ikili bir ödül sağlayarak RLVR, modellerin kısıtlamasız keşif yoluyla öğrenmesini sağlar. Bu nesnel geri bildirim döngüsü, son derece yetenekli akıl yürütme modellerindeki son gelişmelerin arkasındaki temel itici güç olup, sürekli insan müdahalesi olmaksızın en optimal, karmaşık mantık yollarını keşfetmelerini sağlar.

RLVR'nin Temel İlkeleri#

Standart makine öğrenimi (ML) ortamlarında bir yapay zeka ajanı, bir ödül sinyalini maksimize ederek öğrenir. RLVR'de ise bu ödül sinyali, öznel insan yargısı yerine katı bir programlama sistemi tarafından üretilir. Öğrenme süreci birkaç temel adıma dayanır:

  • Keşif Stratejisi: Model, karmaşık görevleri parçalara ayırmak için sıklıkla düşünce zinciri yönlendirmesinden yararlanarak belirli bir istek için birden fazla olası çözüm veya akıl yürütme yolu üretir.
  • Belirleyici Doğrulama: Python derleyicisi, hesap makinesi veya bilgisayarlı görü (CV) algılama sistemi gibi harici bir araç, nihai çıktıyı nesnel başarı kriterlerine göre kontrol eder.
  • Politika Optimizasyonu: Çıktı doğrulanabilir şekilde doğruysa model olumlu bir ödül alır. Modelin politikası daha sonra, başarılı akıl yürütme yollarını desteklemek için Grup Göreceli Politika Optimizasyonu (GRPO) veya Yaklaşık Politika Optimizasyonu (PPO) gibi optimizasyon algoritmaları kullanılarak güncellenir.

Bu yaklaşım, eğitim sırasında bir modelin çıkarım gecikmesi verimliliğini önemli ölçüde artırır ve ortaya çıkan akıl yürütme yeteneklerini teşvik eder; bu teknik, son zamanlarda DeepSeek-R1 gibi son derece yetenekli modelleri eğitmek için kullanılmıştır.

RLVR ile RLHF ve PRM Karşılaştırması#

RLVR'yi AI ekosistemindeki diğer hizalama ve eğitim paradigmalarından ayırmak önemlidir:

  • İnsan Geri Bildiriminden Pekiştirmeli Öğrenmeye (RLHF) Karşı: RLHF, öznel insan tercihleri üzerinde eğitilmiş öğrenilmiş bir ödül modelleme sistemine dayanır. RLVR, kesin doğru veya yanlış yanıtları olan görevler için oldukça ölçeklenebilir hale getirerek, katı bir şekilde nesnel ve programatik gerçeklere dayanarak insanı döngü içinde tutma dar boğazını ortadan kaldırır.
  • Süreç Ödül Modeline (PRM) Karşı: PRM'ler, bir modelin akıl yürütme yörüngesi boyunca ayrıntılı, adım adım geri bildirim sağlarken RLVR genellikle sürecin sonunda doğrulanabilir sonuca odaklanır. Bununla birlikte, 2025'teki son araştırmalar, RLVR'de nihai doğrulanabilir bir ödül için optimize etmenin, ara akıl yürütme adımlarını da dolaylı olarak teşvik ettiğini göstermektedir.

Gerçek Dünya Uygulamaları#

RLVR, çeşitli deterministik alanlarda karmaşık AI sistemlerinin eğitilme biçimini dönüştürüyor:

  • Matematiksel Akıl Yürütme: OpenAI o serisi gibi büyük akıl yürütme modelleri, karmaşık matematik teoremlerini çözmek için RLVR'den yararlanır. Doğrulayıcı, modelin türettiği yanıtın doğru olduğunu kesin olarak kanıtlayan bir motor görevi görerek kıyaslama veri seti performansını önemli ölçüde artırır.
  • Yazılım Mühendisliği ve Kod Üretimi: Yapay zeka kodlama asistanları, kod yazmak, hata ayıklamak ve optimize etmek için RLVR'yi kullanır. Doğrulanabilir ödül, üretilen kod başarıyla derlendiğinde ve bir dizi otomatik birim testini geçtiğinde elde edilir.
  • Otonom Görü Ajanları: Fiziksel ortamlarda otonom ajanlar, hedef bir konuma ulaştıklarında veya bir nesneyi başarıyla manipüle ettiklerinde doğrulanabilir ödüller alırlar. Görü modelleri bu alanlarda doğrulanabilir durum denetleyicisi olarak görev yapar.

Görü AI'da Doğrulanabilir Bir Ödül Uygulama#

Fiziksel ve görsel ortamlarda, Ultralytics YOLO26 gibi algılama modelleri bir RLVR döngüsünde programatik doğrulayıcı olarak hizmet verebilir. Örneğin, bir yapay zeka ajanının amacı bir nesneyi belirli bir bölgeye taşımaksa YOLO modeli, nesnenin o bölgedeki varlığını tespit ederek başarıyı doğrulayabilir.

Aşağıdaki Python kod parçacığı, ultralytics paketini kullanan kavramsal bir programatik doğrulayıcıyı göstermektedir.

from ultralytics import YOLO

# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")


def get_verifiable_reward(image_path: str, target_class: int) -> float:
    """Returns a verifiable reward of 1.0 if the target object is detected."""
    results = verifier_model(image_path)

    # Check if the desired class (e.g., 0 for 'person') exists in the detections
    detected_classes = results[0].boxes.cls.tolist()
    if target_class in detected_classes:
        return 1.0  # Verifiable success
    return 0.0  # Verifiable failure


# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")

Geliştiriciler, bu algılama doğrulayıcılarını dağıtmak için Ultralytics Platform gibi bulut platformlarından yararlanarak otonom ve akıl yürütme ajanlarının gelecek neslini eğiten sağlam, ölçeklenebilir RLVR boru hatları oluşturabilirler.

Explore solutions

Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin

Yapay zekanın geleceğini birlikte inşa edelim!

Yolculuğuna makine öğreniminin geleceğiyle başla