Ultralytics YOLO27:
Ultralytics Sözlüğüne dön

Reinforcement Learning from Human Feedback (RLHF)

İnsan Geri Bildiriminden Pekiştirmeli Öğrenmenin (RLHF) yapay zekâyı insan değerleriyle nasıl hizaladığını öğren. Temel bileşenlerini ve Ultralytics YOLO26 ile entegrasyonunu keşfet.

İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF), doğrudan insan girdisini eğitim döngüsüne dâhil ederek yapay zekâ modellerini geliştiren gelişmiş bir makine öğrenimi tekniğidir. Yalnızca statik etiketli veri kümelerine dayanan standart denetimli öğrenmenin aksine RLHF, insan değerlendiricilerin model çıktılarının sıralamasını veya puanlamasını yaptığı dinamik bir geri bildirim mekanizması sunar. Bu süreç, yapay zekânın basit bir matematiksel kayıp fonksiyonuyla tanımlanması zor olan "faydalılık", "güvenlik" veya "yaratıcılık" gibi karmaşık, öznel ya da nüanslı hedefleri kavramasını sağlar. RLHF, modern büyük dil modellerinin (LLMs) ve üretken yapay zekânın geliştirilmesinde temel bir unsur hâline gelmiş, güçlü temel modellerin insan değerleriyle ve kullanıcı niyetiyle etkili biçimde uyumlu olmasını sağlamıştır.

RLHF'nin Temel Bileşenleri#

RLHF süreci, ham tahmin yetenekleri ile insanlarla uyumlu davranış arasındaki boşluğu kapatmak üzere tasarlanmış üç aşamalı bir işlem hattını genel olarak izler.

  1. Denetimli İnce Ayar (SFT): İş akışı genellikle önceden eğitilmiş bir temel modelle başlar. Geliştiriciler, gösterimlerden oluşan daha küçük ve yüksek kaliteli bir veri kümesini (ör. uzmanlar tarafından yazılmış soru-cevap çiftleri) kullanarak ilk ince ayarı gerçekleştirir. Bu adım, modele görev için beklenen genel biçimi ve üslubu öğreterek bir temel politika oluşturur.

  2. Ödül Modeli Eğitimi: Bu aşama, RLHF'nin ayırt edici özelliğidir. İnsan etiketleyiciler, model tarafından aynı girdi için oluşturulan birden fazla çıktıyı inceler ve bunları en iyiden en kötüye doğru sıralar. Bu veri etiketleme çalışması bir tercih veri kümesi oluşturur. Ödül modeli adı verilen ayrı bir sinir ağı, insan değerlendirmesini yansıtan skaler bir puanı tahmin etmek üzere bu karşılaştırma verileriyle eğitilir. Ultralytics Platform üzerinde bulunan araçlar, bu tür açıklama iş akışlarının yönetimini kolaylaştırabilir.

  3. Pekiştirmeli Öğrenme Optimizasyonu: Son olarak, özgün model bir pekiştirmeli öğrenme ortamında yapay zekâ aracısı olarak görev yapar. Ödül modelini rehber olarak kullanan Yakın Politika Optimizasyonu (PPO) gibi optimizasyon algoritmaları, beklenen ödülü en üst düzeye çıkarmak için modelin parametrelerini ayarlar. Bu adım, modelin politikasını öğrenilmiş insan tercihleriyle uyumlu hâle getirerek faydalı ve güvenli davranışları teşvik ederken zararlı veya anlamsız çıktıları engeller.

Gerçek Dünya Uygulamaları#

RLHF, yüksek güvenlik standartları ve insan etkileşiminin nüanslı biçimde anlaşılmasını gerektiren yapay zekâ sistemlerinin kullanıma sunulmasında kritik öneme sahip olduğunu kanıtlamıştır.

  • Diyaloga Dayalı Yapay Zekâ ve Sohbet Robotları: RLHF'nin en öne çıkan uygulaması, sohbet robotlarını faydalı, zararsız ve dürüst olacak şekilde hizalamaktır. Önyargılı, gerçeklere aykırı veya tehlikeli çıktıları cezalandıran RLHF, LLMs'de halüsinasyon oluşumunu azaltmaya ve algoritmik önyargı riskini düşürmeye yardımcı olur. Bu sayede sanal asistanlar, meşru sorular için faydalı olmaya devam ederken zararlı talimatları reddedebilir.
  • Robotik ve Fiziksel Kontrol: RLHF, karmaşık fiziksel görevler için kusursuz bir ödül fonksiyonu tanımlamanın zor olduğu robotikte yapay zekâ uygulamalarına da uzanır. Örneğin, kalabalık bir depoda gezinmeyi öğrenen bir robot, hangi yörüngelerin güvenli olduğu ve hangilerinin aksamalara yol açtığı konusunda insan denetçilerden geri bildirim alabilir. Bu geri bildirim, robotun kontrol politikasını yalnızca hedefin tamamlanmasına dayanan basit derin pekiştirmeli öğrenmeden daha etkili biçimde geliştirir.

RLHF ve Standart Pekiştirmeli Öğrenme#

RLHF'yi geleneksel pekiştirmeli öğrenmeden (RL) ayırmak, kendine özgü faydasını anlamana yardımcı olur.

  • Standart RL: Geleneksel ortamlarda ödül fonksiyonu genellikle ortam tarafından sabit kodlanır. Örneğin bir video oyununda ortam, kazanma için (+1), kaybetme için (-1) gibi net bir sinyal sağlar. Aracı, eylemlerini tanımlanmış bu Markov Karar Süreci (MDP) içinde optimize eder.
  • RLHF: Yaratıcı bir hikâye yazmak veya nazikçe araç kullanmak gibi birçok gerçek dünya senaryosunda "başarı" özneldir. RLHF, sabit kodlanmış ödülü insan tercihlerinden türetilen öğrenilmiş bir ödül modeliyle değiştirerek bu sorunu çözer. Bu, açıkça programlanması imkânsız olan "kalite" veya "uygunluk" gibi soyut kavramların optimize edilmesini sağlar.

Algıyı Geri Bildirim Döngüleriyle Entegre Etme#

Görsel uygulamalarda RLHF ile hizalanmış aracılar, eyleme geçmeden önce ortamlarının durumunu algılamak için genellikle bilgisayarlı görüden (CV) yararlanır. YOLO26 gibi güçlü bir algılayıcı, algı katmanı olarak işlev görür ve politika ağının bir eylem seçmek için kullandığı yapılandırılmış gözlemler (ör. "3 metre mesafede engel algılandı") sağlar.

Aşağıdaki Python örneği, bir YOLO modelinin ortam durumunu sağladığı basitleştirilmiş bir kavramı gösterir. Tam bir RLHF döngüsünde "ödül" sinyali, aracının bu algılama verilerine dayalı kararları hakkında insan geri bildirimleriyle eğitilmiş bir modelden gelirdi.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

Güçlü algı modellerini insan geri bildirimiyle geliştirilen politikalarla birleştiren geliştiriciler, yalnızca akıllı değil, aynı zamanda yapay zekâ güvenliği ilkeleriyle titizlikle uyumlu sistemler oluşturabilir. Anayasal Yapay Zekâ gibi ölçeklenebilir gözetim alanındaki devam eden araştırmalar, yüksek model performansını korurken büyük ölçekli insan açıklamalarındaki darboğazı azaltmayı amaçlayarak bu alanı geliştirmeye devam ediyor.

Explore solutions

Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin
Hava görüntüleri için bilgisayarlı görü

Hava görüntüleri için bilgisayarlı görü

Ultralytics YOLO ile tarım, su ürünleri yetiştiriciliği, çevresel izleme, koruma ve coğrafi uzaktan algılama için drone ve hava görüntülerini gerçek zamanlı içgörülere dönüştür.
Daha fazla bilgi edin
Havacılıkta bilgisayarlı görü

Havacılıkta bilgisayarlı görü

Ultralytics YOLO modelleri ile havadan izlemeye yapay zeka tabanlı görü kazandır. Bilgisayarlı görü çözümleriyle dronları, havacılık iş akışlarını, çevre koruma ve jeosansiyel endüstrilerini güçlendir.
Daha fazla bilgi edin

Ultralytics YOLO modelleri ile her alanı koru. Yapay zeka tabanlı görü; çevre izleme, tehdit tespiti, plaka tanıma ve iş yeri güvenliğini destekler.
Daha fazla bilgi edin
Robotikte bilgisayarlı görü

Robotikte bilgisayarlı görü

Ultralytics YOLO modelleriyle daha akıllı makineler geliştir. Robotikte Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü mümkün kılar.
Daha fazla bilgi edin
Lojistikte bilgisayarlı görü

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleriyle lojistiği kolaylaştır. Vision AI; paket denetimini, ayırmayı, araç takibini ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Perakendede bilgisayarlı görü

Perakendede bilgisayarlı görü

Ultralytics YOLO modelleriyle perakendeyi yeniden tasarla. Vision AI; envanter takibini, raf izlemeyi, sıra yönetimini ve daha akıllı müşteri içgörülerini destekler.
Daha fazla bilgi edin
Sağlık hizmetlerinde bilgisayarlı görü

Sağlık hizmetlerinde bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık hizmetleri çözümleri geliştir. Sağlık hizmetlerindeki Vision AI; daha hızlı tıbbi görüntülemeyi, daha akıllı tanıyı ve hasta takibini mümkün kılar.
Daha fazla bilgi edin
Üretimde bilgisayarlı görü

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleriyle üretimi optimize et. Vision AI; kalite kontrolünü, kusur tespitini, PPE uyumluluğunu ve montaj hattı otomasyonunu güçlendirir.
Daha fazla bilgi edin
Otomotivde bilgisayarlı görü

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygulayın. Görsel yapay zekâ, daha akıllı yollar için yol güvenliğini, sürücü yardımını ve araç otomasyonunu geliştirir.
Daha fazla bilgi edin
Tarımda bilgisayarlı görü

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görsel yapay zekâ taşıyın. Daha yüksek ve akıllı verim için ürün izlemeye, hayvan takibine ve hassas tarıma güç verin.
Daha fazla bilgi edin

Yapay zekânın geleceğini birlikte inşa edelim!

Makine öğreniminin geleceğiyle yolculuğuna başla