Reinforcement Learning with Verifiable Rewards (RLVR)
Doğrulanabilir Ödüllerle Pekiştirmeli Öğrenmeyi (RLVR) keşfet. Deterministik geri bildirim ve Ultralytics YOLO26 kullanarak gelişmiş yapay zekâyı eğitmeyi öğren.
Doğrulanabilir Ödüllerle Pekiştirmeli Öğrenme (RLVR), yapay zekâ (AI) modellerinin akıl yürütme ve problem çözme yeteneklerini geliştirmek için kullanılan gelişmiş bir eğitim paradigmasıdır. İnsanlar tarafından etiketlenmiş tercih verilerine dayanan geleneksel eğitim yöntemlerinden farklı olarak RLVR, model çıktısını değerlendirmek için deterministik, kural tabanlı sistemler kullanır. Oluşturulan bir kod parçasının derlenip derlenmediği veya matematiksel bir denklemin doğru çözülüp çözülmediği gibi nesnel, ikili bir ödül sağlayan RLVR, modellerin kısıtlanmamış keşif yoluyla öğrenmesine olanak tanır. Bu nesnel geri bildirim döngüsü, son dönemde son derece yetenekli akıl yürütme modellerinde görülen atılımların temel itici güçlerinden biridir ve bu modellerin sürekli insan müdahalesi olmadan en iyi, karmaşık mantık yollarını keşfetmesini sağlar.
RLVR'nin Temel İlkeleri#
Standart makine öğrenimi (ML) ortamlarında bir AI ajanı, ödül sinyalini en üst düzeye çıkararak öğrenir. RLVR'de bu ödül sinyali, öznel insan yargısı yerine katı bir programlama sistemi tarafından üretilir. Öğrenme süreci birkaç temel adıma dayanır:
- Keşif Stratejisi: Model, belirli bir istem için birden fazla olası çözüm veya akıl yürütme yolu üretir; karmaşık görevleri parçalara ayırmak için genellikle düşünce zinciri istemlerinden yararlanır.
- Deterministik Doğrulama: Python derleyicisi, hesap makinesi veya bilgisayarlı görü (CV) algılama sistemi gibi harici bir araç, nihai çıktıyı nesnel başarı ölçütlerine göre denetler.
- Politika Optimizasyonu: Çıktının doğruluğu doğrulanırsa model olumlu bir ödül alır. Ardından modelin politikası, başarılı akıl yürütme yollarını tercih etmesi için Group Relative Policy Optimization (GRPO) veya Proximal Policy Optimization (PPO) gibi optimizasyon algoritmalarıyla güncellenir.
Bu yaklaşım, eğitim sırasında modelin çıkarım gecikmesi verimliliğini önemli ölçüde artırır ve kendiliğinden ortaya çıkan akıl yürütme yeteneklerini teşvik eder. Bu teknik, son zamanlarda DeepSeek-R1 gibi son derece yetenekli modelleri eğitmek için kullanılmıştır.
RLVR, RLHF ve PRM'ler#
RLVR'yi yapay zekâ ekosistemindeki diğer hizalama ve eğitim paradigmalarından ayırt etmek önemlidir:
- İnsan Geri Bildiriminden Pekiştirmeli Öğrenmeye (RLHF) kıyasla: RLHF, öznel insan tercihlerine göre eğitilmiş bir ödül modelleme sistemine dayanır. RLVR ise yalnızca nesnel ve programatik doğruları temel alarak insanı döngüde tutma darboğazını ortadan kaldırır; bu da onu kesin doğru veya yanlış yanıtları olan görevlerde yüksek ölçüde ölçeklenebilir kılar.
- Süreç Ödül Modeline (PRM) kıyasla: PRM'ler modelin akıl yürütme süreci boyunca adım adım ayrıntılı geri bildirim sağlarken RLVR genellikle sürecin sonundaki doğrulanabilir sonuca odaklanır. Ancak 2025'te yayımlanan güncel araştırmalar, RLVR'de nihai doğrulanabilir ödül için optimizasyon yapmanın ara akıl yürütme adımlarının doğruluğunu da örtük biçimde teşvik ettiğini gösteriyor.
Gerçek Dünya Uygulamaları#
RLVR, çeşitli deterministik alanlarda karmaşık yapay zekâ sistemlerinin eğitimini dönüştürüyor:
- Matematiksel Akıl Yürütme: OpenAI o serisi gibi büyük akıl yürütme modelleri, karmaşık matematik teoremlerini çözmek için RLVR'den yararlanır. Doğrulayıcı, modelin ulaştığı yanıtın doğru olup olmadığını kesin olarak kanıtlayan bir motor görevi görerek kıyaslama veri kümesi performansını önemli ölçüde artırır.
- Yazılım Mühendisliği ve Kod Üretimi: Yapay zekâ kodlama yardımcıları, kod yazmak, hatalarını ayıklamak ve kodu optimize etmek için RLVR kullanır. Üretilen kod başarıyla derlenip bir dizi otomatik birim testini geçtiğinde doğrulanabilir ödül kazanılır.
- Otonom Görü Ajanları: Fiziksel ortamlarda otonom ajanlar, hedef noktaya ulaştıklarında veya bir nesneyi başarıyla manipüle ettiklerinde doğrulanabilir ödüller alır. Görü modelleri bu ortamlarda doğrulanabilir koşul denetleyicisi olarak görev yapar.
Görü Yapay Zekâsında Doğrulanabilir Ödül Uygulama#
Fiziksel ve görsel ortamlarda Ultralytics YOLO26 gibi algılama modelleri, bir RLVR döngüsünde programatik doğrulayıcı olarak görev yapabilir. Örneğin, bir AI ajanının amacı bir nesneyi belirli bir bölgeye taşımaksa YOLO modeli, nesnenin o bölgede bulunduğunu tespit ederek başarının gerçekleştiğini doğrulayabilir.
Aşağıdaki Python kod parçacığı, ultralytics paketini kullanan kavramsal bir programatik doğrulayıcıyı gösteriyor.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")Bu algılama doğrulayıcılarını dağıtmak için Ultralytics Platform gibi bulut platformlarından yararlanan geliştiriciler, yeni nesil otonom ve akıl yürüten ajanları eğiten sağlam ve ölçeklenebilir RLVR işlem hatları oluşturabilir.









