Reward Modeling
Makine öğreniminde ödül modellemeyi keşfet. Daha güvenli ve doğru bir performans için yapay zeka temsilcilerini ve Ultralytics YOLO26 modellerini hizalamak adına insan geri bildirimini nasıl kullandığını öğren.
Ödül Modellemesi, yapay zeka sistemlerine kendi davranışlarını insan tercihlerine göre nasıl değerlendireceğini ve öncelik sırasına koyacağını öğretmek için kullanılan bir makine öğrenimi tekniğidir. Geleneksel reinforcement learning ortamlarında bir AI agent, bir video oyunundaki skor gibi önceden tanımlanmış, matematiksel olarak katı bir ödül fonksiyonunu maksimize ederek öğrenir. Ancak, "iyi" davranışın öznel veya incelikli olduğu karmaşık gerçek dünya görevlerinde (örneğin kibar bir e-posta yazmak veya bir kavşakta güvenli bir şekilde seyretmek), kusursuz bir ödül fonksiyonunu elle yazmak neredeyse imkansızdır. Ödül modellemesi, ikincil bir neural network (ödül modeli) eğiterek insan yargısının vekili gibi davranmasını sağlayarak bunu çözer. Bu model, birincil yapay zekanın çıktılarını değerlendirir ve skaler skorlar atayarak ana modeli güvenli, yardımcı ve doğru davranışlara doğru dinamik olarak yönlendirir.
Ödül Modelleme Nasıl Çalışır#
Bir ödül modeli oluşturma hattı, büyük ölçüde yüksek kaliteli insan geri bildirimi toplamaya dayanır.
- Data Labeling ve Tercihler: İnsan etiketleyicilere, bir yapay zeka modeli tarafından üretilen birden fazla yanıtla birlikte istemler verilir. Değerlendiriciler bu yanıtları yardımseverlik, zararsızlık ve doğruluk gibi kriterlere göre en iyiden en kötüye doğru sıralar. Bu büyük ölçekli etiketleme iş akışlarını Ultralytics Platform kullanarak sorunsuz bir şekilde yönetebilirsin.
- Vekil Ağın Eğitilmesi: Bu insan karşılaştırmaları veri kümesi üzerinde özel bir sinir ağı eğitilir. Bir optimizasyon sürecinden geçerek, bir eylemin veya metin yanıtının embeddings değerlerini tek bir skaler ödül değerine eşleyerek bir insanın hangi çıktıyı tercih edeceğini tahmin etmeyi öğrenir. Sinar ağı mimarileri oluşturma hakkında PyTorch API documentation üzerinden daha fazla bilgi okuyabilirsin.
- Politika Optimizasyonu: Birincil model, Proximal Policy Optimization (PPO) gibi algoritmaları tipik olarak kullanarak eylemlerini iyileştirmek için ödül modelinden gelen sürekli geri bildirimi kullanır. Bu adım, modelin politikasını öğrenilen insan niyetiyle yinelemeli olarak hizalar.
Ödül Modelleme vs. RLHF#
Ödül modellemesini Reinforcement Learning from Human Feedback (RLHF) kavramından ayırt etmek önemlidir. Bu iki terim sıklıkla birlikte tartışılsa da eş anlamlı değildirler. RLHF, denetimli ince ayar, veri toplama ve politika güncellemelerini kapsayan, modelleri hizalamak için kullanılan kapsamlı uçtan uca boru hattıdır. Ödül modellemesi, RLHF boru hattı içinde belirli, çok önemli bir bileşendir. Kesikli insan sıralamalarını, takviyeli öğrenme algoritmasının optimize edebileceği sürekli bir matematiksel sinyale çeviren köprü görevi görür.
Gerçek Dünya Uygulamaları#
Ödül modelleme, insanlarla ve fiziksel dünyayla doğrudan etkileşime giren modern yapay zeka sistemleri geliştirmede önemli bir rol oynar.
- Large Language Models (LLMs): Konuşma tabanlı yapay zeka asistanları, yanıtlarının yalnızca olgusal olarak doğru değil aynı zamanda kibar, ilgili ve zehirli dilden arınmış olmasını sağlamak için ödül modellerine güvenir. AI safety alanını araştıran kuruluşlar, helpful and harmless AI alignment yansıtan sistemler oluşturmak için ödül modellemesini sürekli olarak ilerletir.
- Autonomous Vehicles ve Robotik: Fiziksel otomasyonda ödül modelleri, robotların karmaşık sürüş görgü kurallarını veya nesne manipülasyon stratejilerini anlamasına yardımcı olur. Ultralytics YOLO26 tarafından desteklenen bir algılama sistemi yayaları ve trafik işaretlerini tespit edebilirken, bir ödül modeli aracın planlanan yörüngesini değerlendirerek yapay zekanın tamamen agresif noktadan noktaya seyrüsefer yerine yolcu konforuna ve güvenliğine öncelik vermesini sağlar.
Temel Bir Ödül Modeli Kavramını Uygulama#
Aşağıdaki Python örneği, bir ödül modelinin temel yapısını göstermek için torch kullanır. Pratikte bu ağ, insan tercihleriyle uyumlu bir çıktıya daha yüksek bir skaler skor atamayı öğrenir.
import torch
import torch.nn as nn
# Define a simplified reward model architecture
class SimpleRewardModel(nn.Module):
def __init__(self):
super().__init__()
# Maps the AI's output embedding to a single reward score
self.fc = nn.Linear(768, 1)
def forward(self, embeddings):
return self.fc(embeddings)
# Initialize the model
reward_model = SimpleRewardModel()
# Simulated embeddings for a human-preferred action and a rejected action
chosen_action = torch.randn(1, 768)
rejected_action = torch.randn(1, 768)
# The model predicts scalar scores to guide the primary agent
print(f"Chosen Action Reward: {reward_model(chosen_action).item():.4f}")
print(f"Rejected Action Reward: {reward_model(rejected_action).item():.4f}")Hizalamanın açık kaynaklı temel modelleri nasıl etkilediğine dair daha derinlemesine bir inceleme için dil modellerini insan niyetiyle hizalamaya yönelik temel araştırmaları keşfet ve computer vision (CV) sistemlerinin dinamik ortamlarla güvenli bir şekilde etkileşim kurmak için gelişmiş geri bildirim döngülerinden nasıl yararlandığını öğren.






