Reinforcement Learning from Human Feedback (RLHF)
İnsan Geri Bildiriminden Pekiştirmeli Öğrenmenin (RLHF) yapay zekâyı insan değerleriyle nasıl hizaladığını öğren. Temel bileşenlerini ve Ultralytics YOLO26 ile entegrasyonunu keşfet.
İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF), doğrudan insan girdisini eğitim döngüsüne dâhil ederek yapay zekâ modellerini geliştiren gelişmiş bir makine öğrenimi tekniğidir. Yalnızca statik etiketli veri kümelerine dayanan standart denetimli öğrenmenin aksine RLHF, insan değerlendiricilerin model çıktılarının sıralamasını veya puanlamasını yaptığı dinamik bir geri bildirim mekanizması sunar. Bu süreç, yapay zekânın basit bir matematiksel kayıp fonksiyonuyla tanımlanması zor olan "faydalılık", "güvenlik" veya "yaratıcılık" gibi karmaşık, öznel ya da nüanslı hedefleri kavramasını sağlar. RLHF, modern büyük dil modellerinin (LLMs) ve üretken yapay zekânın geliştirilmesinde temel bir unsur hâline gelmiş, güçlü temel modellerin insan değerleriyle ve kullanıcı niyetiyle etkili biçimde uyumlu olmasını sağlamıştır.
RLHF'nin Temel Bileşenleri#
RLHF süreci, ham tahmin yetenekleri ile insanlarla uyumlu davranış arasındaki boşluğu kapatmak üzere tasarlanmış üç aşamalı bir işlem hattını genel olarak izler.
-
Denetimli İnce Ayar (SFT): İş akışı genellikle önceden eğitilmiş bir temel modelle başlar. Geliştiriciler, gösterimlerden oluşan daha küçük ve yüksek kaliteli bir veri kümesini (ör. uzmanlar tarafından yazılmış soru-cevap çiftleri) kullanarak ilk ince ayarı gerçekleştirir. Bu adım, modele görev için beklenen genel biçimi ve üslubu öğreterek bir temel politika oluşturur.
-
Ödül Modeli Eğitimi: Bu aşama, RLHF'nin ayırt edici özelliğidir. İnsan etiketleyiciler, model tarafından aynı girdi için oluşturulan birden fazla çıktıyı inceler ve bunları en iyiden en kötüye doğru sıralar. Bu veri etiketleme çalışması bir tercih veri kümesi oluşturur. Ödül modeli adı verilen ayrı bir sinir ağı, insan değerlendirmesini yansıtan skaler bir puanı tahmin etmek üzere bu karşılaştırma verileriyle eğitilir. Ultralytics Platform üzerinde bulunan araçlar, bu tür açıklama iş akışlarının yönetimini kolaylaştırabilir.
-
Pekiştirmeli Öğrenme Optimizasyonu: Son olarak, özgün model bir pekiştirmeli öğrenme ortamında yapay zekâ aracısı olarak görev yapar. Ödül modelini rehber olarak kullanan Yakın Politika Optimizasyonu (PPO) gibi optimizasyon algoritmaları, beklenen ödülü en üst düzeye çıkarmak için modelin parametrelerini ayarlar. Bu adım, modelin politikasını öğrenilmiş insan tercihleriyle uyumlu hâle getirerek faydalı ve güvenli davranışları teşvik ederken zararlı veya anlamsız çıktıları engeller.
Gerçek Dünya Uygulamaları#
RLHF, yüksek güvenlik standartları ve insan etkileşiminin nüanslı biçimde anlaşılmasını gerektiren yapay zekâ sistemlerinin kullanıma sunulmasında kritik öneme sahip olduğunu kanıtlamıştır.
- Diyaloga Dayalı Yapay Zekâ ve Sohbet Robotları: RLHF'nin en öne çıkan uygulaması, sohbet robotlarını faydalı, zararsız ve dürüst olacak şekilde hizalamaktır. Önyargılı, gerçeklere aykırı veya tehlikeli çıktıları cezalandıran RLHF, LLMs'de halüsinasyon oluşumunu azaltmaya ve algoritmik önyargı riskini düşürmeye yardımcı olur. Bu sayede sanal asistanlar, meşru sorular için faydalı olmaya devam ederken zararlı talimatları reddedebilir.
- Robotik ve Fiziksel Kontrol: RLHF, karmaşık fiziksel görevler için kusursuz bir ödül fonksiyonu tanımlamanın zor olduğu robotikte yapay zekâ uygulamalarına da uzanır. Örneğin, kalabalık bir depoda gezinmeyi öğrenen bir robot, hangi yörüngelerin güvenli olduğu ve hangilerinin aksamalara yol açtığı konusunda insan denetçilerden geri bildirim alabilir. Bu geri bildirim, robotun kontrol politikasını yalnızca hedefin tamamlanmasına dayanan basit derin pekiştirmeli öğrenmeden daha etkili biçimde geliştirir.
RLHF ve Standart Pekiştirmeli Öğrenme#
RLHF'yi geleneksel pekiştirmeli öğrenmeden (RL) ayırmak, kendine özgü faydasını anlamana yardımcı olur.
- Standart RL: Geleneksel ortamlarda ödül fonksiyonu genellikle ortam tarafından sabit kodlanır. Örneğin bir video oyununda ortam, kazanma için (+1), kaybetme için (-1) gibi net bir sinyal sağlar. Aracı, eylemlerini tanımlanmış bu Markov Karar Süreci (MDP) içinde optimize eder.
- RLHF: Yaratıcı bir hikâye yazmak veya nazikçe araç kullanmak gibi birçok gerçek dünya senaryosunda "başarı" özneldir. RLHF, sabit kodlanmış ödülü insan tercihlerinden türetilen öğrenilmiş bir ödül modeliyle değiştirerek bu sorunu çözer. Bu, açıkça programlanması imkânsız olan "kalite" veya "uygunluk" gibi soyut kavramların optimize edilmesini sağlar.
Algıyı Geri Bildirim Döngüleriyle Entegre Etme#
Görsel uygulamalarda RLHF ile hizalanmış aracılar, eyleme geçmeden önce ortamlarının durumunu algılamak için genellikle bilgisayarlı görüden (CV) yararlanır. YOLO26 gibi güçlü bir algılayıcı, algı katmanı olarak işlev görür ve politika ağının bir eylem seçmek için kullandığı yapılandırılmış gözlemler (ör. "3 metre mesafede engel algılandı") sağlar.
Aşağıdaki Python örneği, bir YOLO modelinin ortam durumunu sağladığı basitleştirilmiş bir kavramı gösterir. Tam bir RLHF döngüsünde "ödül" sinyali, aracının bu algılama verilerine dayalı kararları hakkında insan geri bildirimleriyle eğitilmiş bir modelden gelirdi.
from ultralytics import YOLO
# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")
# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")
# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)
print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.Güçlü algı modellerini insan geri bildirimiyle geliştirilen politikalarla birleştiren geliştiriciler, yalnızca akıllı değil, aynı zamanda yapay zekâ güvenliği ilkeleriyle titizlikle uyumlu sistemler oluşturabilir. Anayasal Yapay Zekâ gibi ölçeklenebilir gözetim alanındaki devam eden araştırmalar, yüksek model performansını korurken büyük ölçekli insan açıklamalarındaki darboğazı azaltmayı amaçlayarak bu alanı geliştirmeye devam ediyor.









