YOLO Vision 2026:
Ultralytics Sözlüğüne dön

Direct Preference Optimization

Doğrudan Tercih Optimizasyonu'nun (DPO) yapay zeka hizalamasını nasıl basitleştirdiğini öğren. Geleneksel RLHF'den daha verimli bir şekilde model güvenliğini ve performansını nasıl iyileştireceğini keşfet.

Direct Preference Optimization (DPO), yapay zeka modellerini ince ayar yapmak için kullanılan, özellikle insan istekleri ve güvenlik standartlarıyla uyumlu olmalarını sağlayan kararlı ve verimli bir algoritmik tekniktir. Karmaşık ödül modellemesi gerektiren geleneksel pekiştirmeli öğrenme yöntemlerinden farklı olarak DPO, tercih öğrenme problemini bir sınıflandırma görevi olarak ele alarak uyum sürecini basitleştirir. Açıklayıcıların "kazanan" bir yanıtı "kaybeden" bir yanıtın karşısında seçtiği bir insan tercihleri veri kümesine dayanarak modeli doğrudan optimize ederek geliştiriciler, foundation models ve generative AI sistemlerinin yardımseverliğini, dürüstlüğünü ve güvenliğini önemli ölçüde artırabilir. Bu yaklaşım, çok daha az hesaplama yüküyle son teknoloji sonuçlar elde etme yeteneği sayesinde 2024 ve 2025 yıllarında büyük bir ivme kazanmıştır.

DPO Model Uyumunu Nasıl Basitleştirir#

Direct Preference Optimization'ın temel yeniliği, eski uyum boru hatlarında bulunan "aracıyı" ortadan kaldırmasında yatar. Tarihsel olarak, bir Large Language Model (LLM) veya Vision-Language Model hizalamak, Reinforcement Learning from Human Feedback (RLHF) olarak bilinen çok adımlı bir süreç içeriyordu. RLHF, insan puanlamasını yaklaştırmak için ayrı bir ödül modeli eğitilmesini ve ardından ana modeli güncellemek için PPO (Proximal Policy Optimization) gibi kararsızlığa eğilimli bir algoritma kullanılmasını gerektirir.

DPO, bu ayrı ödül modeline olan ihtiyacı matematiksel olarak ortadan kaldırır. Bunun yerine, "tercih edilen" çıktıların olasılığını artırırken "reddedilen" çıktıların olasılığını azaltan türetilmiş bir loss function kullanır. Bu, güncellenen modelin orijinal training data dağılımından çok fazla sapmamasını sağlamak için bir referans modeline dayanır. Bu matematiksel basitleştirme, sürecin standart supervised learning çok daha yakın bir şekilde davranmasını sağlayarak daha hızlı yakınsama ve GPU hardware üzerinde daha düşük bellek kullanımı sağlar.

RLHF'den Farkı#

DPO ve RLHF, AI Safety ve uyum amacını paylaşsa da, uygulamaları önemli ölçüde farklılık gösterir:

  • Karmaşıklık: RLHF, eğitim sırasında aynı anda birden fazla modelin (aktör, eleştirmen, ödül modeli, referans modeli) sürdürülmesini içerir. DPO ise yalnızca eğitilmekte olan modeli ve dondurulmuş bir referans modelini gerektirir.
  • Kararlılık: Pekiştirmeli öğrenme, hyperparameter tuning karşı oldukça hassastır. DPO genellikle standart bir sınıflandırma görevinin kararlılığıyla çalışır ve model collapse riskini azaltır.
  • Verimlilik: Ödül modeli çıkarım adımlarını kaldırarak, DPO hesaplama yükünü azaltır ve kurumların daha büyük modelleri daha küçük kümeler üzerinde hizalamasına olanak tanır.

Gerçek Dünya Uygulamaları#

Doğrudan Tercih Optimizasyonu, günümüzde etkileşimli yapay zeka sistemlerinin çeşitli endüstrilerde nasıl oluşturulduğunu yeniden şekillendiriyor.

Sohbet Ajanlarının geliştirilmesi#

chatbots ve sanal asistanlar alanında DPO, toksisiteyi azaltmak ve olgusal doğruluğu iyileştirmek için kullanılır. Geliştiriciler, bir insan açıklayıcının bir komuta verilen iki yanıtı incelediği veri kümeleri hazırlar; biri halüsinasyon görmüş veya kaba, diğeri ise doğru ve kibardır. İnsan, kibar yanıtı "seçilen" olarak işaretler. DPO daha sonra seçilen stili desteklemek için model weights günceller. Bu, katı AI Ethics yönergelerine uyan müşteri hizmetleri ajanlarını dağıtmak için çok önemlidir.

Görsel-Dil Modellerini İyileştirme#

Bilgisayarlı görü evrildikçe, modellerin gördüklerini açıklaması giderek daha fazla beklenmektedir. image captioning veya görsel soru yanıtlama gibi uygulamalar için DPO, araştırmacıların modelin metinsel çıktısını ayrıntılı insan tercihleriyle hizalamasına olanak tanır. Örneğin, bir kullanıcı bir security system "davetsiz misafiri tanımla" derse, DPO modeli şiirsel veya belirsiz olanlar yerine olgusal açıklamalara (örn. "kırmızı gömlek, mavi şapka") öncelik verecek şekilde eğitebilir ve computer vision system kullanışlılığını artırabilir.

Modern Yapay Zeka İş Akışında DPO#

DPO'yu uygulamak, yüksek kaliteli ikili veri gerektirir. Modern iş akışları genellikle veri kümelerini yönetmek için Ultralytics Platform gibi araçları kullanarak data annotation sürecinin net "kazanan" ve "kaybeden" örnekler vermesini sağlar. DPO metin için öncülük edilmiş olsa da, ilkeleri kalite metriklerini tercih çiftleri olarak çerçeveleyerek object detection architectures ve diğer modaliteleri optimize etmek için giderek daha fazla uygulanmaktadır.

torch kullanan aşağıdaki Python kod parçacığı, DPO tarzı bir kayıp hesaplaması için gereken temel veri yapısını göstermektedir. "Seçilen" ve "reddedilen" yanıtların toplu olarak nasıl hazırlandığını gösterir; bu, modern model optimization için kritik bir kavramdır.

import torch
import torch.nn.functional as F

# Simulate log probabilities for 'chosen' and 'rejected' responses
# In a real scenario, these come from your model (e.g., a VLM or LLM)
chosen_log_probs = torch.tensor([-0.5, -0.8, -0.2], requires_grad=True)
rejected_log_probs = torch.tensor([-2.5, -3.0, -1.5], requires_grad=True)

# DPO aims to maximize the margin between chosen and rejected
# This is a simplified conceptual look at the margin calculation
beta = 0.1  # A hyperparameter controlling deviation from the reference model
logits = beta * (chosen_log_probs - rejected_log_probs)

# The loss minimizes the negative log sigmoid of this margin
loss = -F.logsigmoid(logits).mean()

print(f"DPO Loss: {loss.item()}")
# Output demonstrates the penalty applied if the model doesn't prefer the chosen data

DPO gibi tekniklerden yararlanarak geliştiriciler, Ultralytics YOLO26 gibi modellerde performansın sınırlarını zorlayabilir, otomatik kararların yalnızca doğru olmasını değil, aynı zamanda insan niyetiyle de uyumlu olmasını sağlayabilirler. Bu, güvenilirliğin çok önemli olduğu autonomous vehicles ve medical image analysis gibi yüksek riskli ortamlar için hayati önem taşır.

Harici Kaynaklar#

Explore solutions

Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin

Yapay zekanın geleceğini birlikte inşa edelim!

Yolculuğuna makine öğreniminin geleceğiyle başla