YOLO Vision 2026:
Ultralytics Sözlüğüne dön

Reinforcement Learning from Human Feedback (RLHF)

İnsan Geri Bildirimli Pekiştirmeli Öğrenmenin (RLHF) yapay zekayı insani değerlerle nasıl hizaladığını öğren. Temel bileşenlerini ve Ultralytics YOLO26 ile entegrasyonunu keşfet.

İnsan Geri Bildiriminden Güç Alan Pekiştirmeli Öğrenme (RLHF), doğrudan insan girdisini eğitim döngüsüne dahil ederek yapay zeka modellerini iyileştiren gelişmiş bir makine öğrenimi tekniğidir. Yalnızca statik etiketli veri kümelerine güvenen standart denetimli öğrenmenin aksine RLHF, insan değerlendiricilerin modelin çıktılarını sıraladığı veya puanladığı dinamik bir geri bildirim mekanizması sunar. Bu süreç, yapay zekanın basit bir matematiksel kayıp fonksiyonuyla tanımlanması zor olan karmaşık, öznel veya nüanslı hedefleri—"yardımcılık", "güvenlik" veya "yaratıcılık" gibi—yakalamasını sağlar. RLHF, modern büyük dil modellerinin (LLM) ve üretken yapay zekanın geliştirilmesinde temel taş haline gelmiş, güçlü temel modellerin insan değerleriyle ve kullanıcı niyetiyle etkili bir şekilde uyumlu olmasını sağlamıştır.

RLHF'nin Temel Bileşenleri#

RLHF süreci genellikle ham tahmin yetenekleri ile insanla uyumlu davranış arasındaki boşluğu doldurmak için tasarlanmış üç aşamalı bir hattı takip eder.

  1. Denetimli İnce Ayar (SFT): İş akışı genellikle önceden eğitilmiş bir temel modelle başlar. Geliştiriciler, daha küçük ve yüksek kaliteli bir gösterim veri kümesi (ör. uzmanlar tarafından yazılmış soru-cevap çiftleri) kullanarak ilk ince ayarı gerçekleştirir. Bu adım temel bir politika oluşturarak modele görev için beklenen genel biçimi ve tonu öğretir.

  2. Ödül Modeli Eğitimi: Bu aşama RLHF'nin ayırt edici özelliğidir. İnsan etiketleyiciler, modelin aynı girdi için ürettiği birden fazla çıktıyı inceler ve en iyiden en kötüye doğru sıralar. Bu veri etiketleme çabası, bir tercihler veri kümesi oluşturur. Ödül modeli adı verilen ayrı bir sinir ağı, insan yargısını yansıtan skaler bir puan tahmin etmek üzere bu karşılaştırma verileri üzerinde eğitilir. Ultralytics Platform üzerinde sunulan araçlar, bu tür etiketleme iş akışlarının yönetimine hız kazandırabilir.

  3. Pekiştirmeli Öğrenme Optimizasyonu: Son olarak, orijinal model bir pekiştirmeli öğrenme ortamında bir Yapay Zeka ajanı olarak hareket eder. Ödül modelini kılavuz olarak kullanan Yakınsama Politikası Optimizasyonu (PPO) gibi optimizasyon algoritmaları, modelin parametrelerini beklenen ödülü en üst düzeye çıkaracak şekilde ayarlar. Bu adım, modelin politikasını öğrenilen insan tercihleriyle uyumlu hale getirerek yardımcı ve güvenli davranışları teşvik ederken toksik veya anlamsız çıktıların önüne geçer.

Gerçek Dünya Uygulamaları#

RLHF, yüksek güvenlik standartları ve insan etkileşiminin incelikli bir şekilde anlaşılmasını gerektiren yapay zeka sistemlerinin dağıtımında kritik öneme sahip olduğunu kanıtlamıştır.

  • Konuşma Tabanlı Yapay Zeka ve Sohbet Botları: RLHF'nin en belirgin uygulaması, sohbet botlarını yardımcı, zararsız ve dürüst olacak şekilde uyarlamaktır. Önyargılı, olgusal olarak yanlış veya tehlikeli çıktıları cezalandırarak RLHF, LLM'lerde halüsinasyonu hafifletmeye yardımcı olur ve algoritmik önyargı riskini azaltır. Bu, sanal asistanların meşru sorgular için yararlı kalmaya devam ederken zararlı talimatları reddedebilmesini sağlar.
  • Robotik ve Fiziksel Kontrol: RLHF metnin ötesine geçerek karmaşık fiziksel görevler için kusursuz bir ödül fonksiyonu tanımlamanın zor olduğu robotikteki yapay zekaya uzanır. Örneğin, kalabalık bir depoda hareket etmeyi öğrenen bir robot, hangi yörüngelerin güvenli olduğu ve hangilerinin aksamalara yol açtığı konusunda insan denetçilerden geri bildirim alabilir. Bu geri bildirim, robotun kontrol politikasını yalnızca hedef tamamlanmasına dayanan basit bir derin pekiştirmeli öğrenmeden çok daha etkili bir şekilde iyileştirir.

RLHF ve Standart Pekiştirmeli Öğrenme Karşılaştırması#

Özel kullanım amacını anlamak için RLHF'yi geleneksel pekiştirmeli öğrenmeden (RL) ayırmak faydalıdır.

  • Standart RL: Geleneksel ortamlarda ödül fonksiyonu genellikle ortam tarafından kodlanmıştır. Örneğin bir video oyununda ortam net bir sinyal sağlar (kazanma için +1, kaybetme için -1). Ajan, tanımlanan bu Markov Karar Süreci (MDP) içinde eylemlerini optimize eder.
  • RLHF: Yaratıcı bir hikaye yazmak veya nazikçe araç sürmek gibi birçok gerçek dünya senaryosunda "başarı" özneldir. RLHF, kodlanmış ödülü insan tercihlerinden türetilen öğrenilmiş bir ödül modeliyle değiştirerek bunu çözer. Bu, açıkça programlanması imkansız olan "kalite" veya "uygunluk" gibi soyut kavramların optimize edilmesine olanak tanır.

Algıyı Geri Bildirim Döngüleriyle Bütünleştirme#

Görsel uygulamalarda RLHF ile uyumlu ajanlar, harekete geçmeden önce çevrelerinin durumunu algılamak için genellikle bilgisayarlı görüye (CV) güvenir. YOLO26 gibi güçlü bir dedektör, politika ağının bir eylem seçmek için kullandığı yapılandırılmış gözlemler (ör. "3 metrede engel algılandı") sağlayan algılama katmanı olarak işlev görür.

Aşağıdaki Python örneği, bir YOLO modelinin çevresel durumu sağladığı basitleştirilmiş bir kavramı göstermektedir. Tam bir RLHF döngüsünde "ödül" sinyali, bu algılama verilerine dayalı olarak ajanın kararlarına ilişkin insan geri bildirimiyle eğitilmiş bir modelden gelecektir.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

Güçlü algılama modellerini insan geri bildirimiyle iyileştirilen politikalarla birleştiren geliştiriciler, yalnızca akıllı olmakla kalmayıp aynı zamanda yapay zeka güvenliği ilkeleriyle de sıkı sıkıya uyumlu sistemler oluşturabilir. Anayasal Yapay Zeka gibi ölçeklenebilir gözetim üzerine devam eden araştırmalar, yüksek model performansını korurken büyük ölçekli insan etiketlemesinin getirdiği darboğazı azaltmayı amaçlayarak bu alanı geliştirmeye devam etmektedir.

Explore solutions

Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte AI

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte Yapay Zeka

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede AI

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta Yapay Zeka

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde Yapay Zeka

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde yapay zeka

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda yapay zeka

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin

Yapay zekanın geleceğini birlikte inşa edelim!

Yolculuğuna makine öğreniminin geleceğiyle başla