YOLO Vision 2026:
Ultralytics Sözlüğüne dön

Reward Modeling

Makine öğreniminde ödül modellemeyi keşfet. Daha güvenli ve doğru bir performans için yapay zeka temsilcilerini ve Ultralytics YOLO26 modellerini hizalamak adına insan geri bildirimini nasıl kullandığını öğren.

Ödül Modellemesi, yapay zeka sistemlerine kendi davranışlarını insan tercihlerine göre nasıl değerlendireceğini ve öncelik sırasına koyacağını öğretmek için kullanılan bir makine öğrenimi tekniğidir. Geleneksel reinforcement learning ortamlarında bir AI agent, bir video oyunundaki skor gibi önceden tanımlanmış, matematiksel olarak katı bir ödül fonksiyonunu maksimize ederek öğrenir. Ancak, "iyi" davranışın öznel veya incelikli olduğu karmaşık gerçek dünya görevlerinde (örneğin kibar bir e-posta yazmak veya bir kavşakta güvenli bir şekilde seyretmek), kusursuz bir ödül fonksiyonunu elle yazmak neredeyse imkansızdır. Ödül modellemesi, ikincil bir neural network (ödül modeli) eğiterek insan yargısının vekili gibi davranmasını sağlayarak bunu çözer. Bu model, birincil yapay zekanın çıktılarını değerlendirir ve skaler skorlar atayarak ana modeli güvenli, yardımcı ve doğru davranışlara doğru dinamik olarak yönlendirir.

Ödül Modelleme Nasıl Çalışır#

Bir ödül modeli oluşturma hattı, büyük ölçüde yüksek kaliteli insan geri bildirimi toplamaya dayanır.

  • Data Labeling ve Tercihler: İnsan etiketleyicilere, bir yapay zeka modeli tarafından üretilen birden fazla yanıtla birlikte istemler verilir. Değerlendiriciler bu yanıtları yardımseverlik, zararsızlık ve doğruluk gibi kriterlere göre en iyiden en kötüye doğru sıralar. Bu büyük ölçekli etiketleme iş akışlarını Ultralytics Platform kullanarak sorunsuz bir şekilde yönetebilirsin.
  • Vekil Ağın Eğitilmesi: Bu insan karşılaştırmaları veri kümesi üzerinde özel bir sinir ağı eğitilir. Bir optimizasyon sürecinden geçerek, bir eylemin veya metin yanıtının embeddings değerlerini tek bir skaler ödül değerine eşleyerek bir insanın hangi çıktıyı tercih edeceğini tahmin etmeyi öğrenir. Sinar ağı mimarileri oluşturma hakkında PyTorch API documentation üzerinden daha fazla bilgi okuyabilirsin.
  • Politika Optimizasyonu: Birincil model, Proximal Policy Optimization (PPO) gibi algoritmaları tipik olarak kullanarak eylemlerini iyileştirmek için ödül modelinden gelen sürekli geri bildirimi kullanır. Bu adım, modelin politikasını öğrenilen insan niyetiyle yinelemeli olarak hizalar.

Ödül Modelleme vs. RLHF#

Ödül modellemesini Reinforcement Learning from Human Feedback (RLHF) kavramından ayırt etmek önemlidir. Bu iki terim sıklıkla birlikte tartışılsa da eş anlamlı değildirler. RLHF, denetimli ince ayar, veri toplama ve politika güncellemelerini kapsayan, modelleri hizalamak için kullanılan kapsamlı uçtan uca boru hattıdır. Ödül modellemesi, RLHF boru hattı içinde belirli, çok önemli bir bileşendir. Kesikli insan sıralamalarını, takviyeli öğrenme algoritmasının optimize edebileceği sürekli bir matematiksel sinyale çeviren köprü görevi görür.

Gerçek Dünya Uygulamaları#

Ödül modelleme, insanlarla ve fiziksel dünyayla doğrudan etkileşime giren modern yapay zeka sistemleri geliştirmede önemli bir rol oynar.

  • Large Language Models (LLMs): Konuşma tabanlı yapay zeka asistanları, yanıtlarının yalnızca olgusal olarak doğru değil aynı zamanda kibar, ilgili ve zehirli dilden arınmış olmasını sağlamak için ödül modellerine güvenir. AI safety alanını araştıran kuruluşlar, helpful and harmless AI alignment yansıtan sistemler oluşturmak için ödül modellemesini sürekli olarak ilerletir.
  • Autonomous Vehicles ve Robotik: Fiziksel otomasyonda ödül modelleri, robotların karmaşık sürüş görgü kurallarını veya nesne manipülasyon stratejilerini anlamasına yardımcı olur. Ultralytics YOLO26 tarafından desteklenen bir algılama sistemi yayaları ve trafik işaretlerini tespit edebilirken, bir ödül modeli aracın planlanan yörüngesini değerlendirerek yapay zekanın tamamen agresif noktadan noktaya seyrüsefer yerine yolcu konforuna ve güvenliğine öncelik vermesini sağlar.

Temel Bir Ödül Modeli Kavramını Uygulama#

Aşağıdaki Python örneği, bir ödül modelinin temel yapısını göstermek için torch kullanır. Pratikte bu ağ, insan tercihleriyle uyumlu bir çıktıya daha yüksek bir skaler skor atamayı öğrenir.

import torch
import torch.nn as nn


# Define a simplified reward model architecture
class SimpleRewardModel(nn.Module):
    def __init__(self):
        super().__init__()
        # Maps the AI's output embedding to a single reward score
        self.fc = nn.Linear(768, 1)

    def forward(self, embeddings):
        return self.fc(embeddings)


# Initialize the model
reward_model = SimpleRewardModel()

# Simulated embeddings for a human-preferred action and a rejected action
chosen_action = torch.randn(1, 768)
rejected_action = torch.randn(1, 768)

# The model predicts scalar scores to guide the primary agent
print(f"Chosen Action Reward: {reward_model(chosen_action).item():.4f}")
print(f"Rejected Action Reward: {reward_model(rejected_action).item():.4f}")

Hizalamanın açık kaynaklı temel modelleri nasıl etkilediğine dair daha derinlemesine bir inceleme için dil modellerini insan niyetiyle hizalamaya yönelik temel araştırmaları keşfet ve computer vision (CV) sistemlerinin dinamik ortamlarla güvenli bir şekilde etkileşim kurmak için gelişmiş geri bildirim döngülerinden nasıl yararlandığını öğren.

Explore solutions

Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin

Yapay zekanın geleceğini birlikte inşa edelim!

Yolculuğuna makine öğreniminin geleceğiyle başla