YOLO Vision 2026:
Ultralytics Sözlüğüne dön

Direct Preference Optimization (DPO)

Doğrudan Tercih Optimizasyonu'nun (DPO) yapay zeka hizalamasını nasıl basitleştirdiğini öğren. Bu verimli yöntemin model güvenliğini ve performansını iyileştirmek için RLHF'nin yerini nasıl aldığını keşfet.

Direct Preference Optimization (DPO), yapay zeka modellerini ince ayarlamak için kullanılan kararlı ve verimli bir algoritmik tekniktir; bu sayede modellerin insan istekleri, güvenlik standartları ve etik ilkelerle uyumlu olması sağlanır. İnsan geri bildirimini yakalamak için karmaşık, çok aşamalı boru hatları gerektiren geleneksel yöntemlerin aksine DPO, tercih öğrenmesini doğrudan standart bir classification task in machine learning olarak ele alarak uyum sürecini matematiksel olarak basitleştirir. Geliştiriciler, insan tercihlerinden oluşan bir veri kümesine dayanarak modeli doğrudan optimize ederek (bu süreçte etiketçiler "kazanan" bir yanıtı "kaybeden" bir yanıta tercih eder) büyük ölçekli foundation models ve modern generative AI systems bileşenlerinin yararlılığını, dürüstlüğünü ve güvenliğini önemli ölçüde artırabilir.

DPO Model Uyumunu Nasıl Basitleştirir#

Direct Preference Optimization'ın temel yeniliği, mimari "aracıyı" ortadan kaldırmasında yatar. Tarihsel olarak, bir Large Language Model (LLM) veya bir Vision-Language Model modelini uyumlu hale getirmek, Reinforcement Learning from Human Feedback (RLHF) olarak bilinen karmaşık bir süreci içeriyordu. RLHF, insan puanlamasını yaklaştırmak için ayrı bir ödül modeli eğitilmesini ve ardından ana modeli güncellemek için Proximal Policy Optimization gibi istikrarsızlığa eğilimli bir pekiştirmeli öğrenme algoritmasının kullanılmasını gerektirir.

DPO, bu ayrı ödül modeline duyulan ihtiyacı matematiksel olarak ortadan kaldırır. Bunun yerine, "tercih edilen" çıktıların üretilme olasılığını artırırken eş zamanlı olarak "reddedilen" çıktıların olasılığını azaltan türetilmiş bir loss function üzerine kuruludur. Güncellenen modelin orijinal training data dağılımından çok fazla sapmamasını sağlamak için Kullback-Leibler divergence sınırlandırmak amacıyla bir referans model kullanır. Bu matematiksel basitleştirme, sürecin standart supervised learning süreçlerine çok daha yakın davranmasını sağlayarak daha hızlı yakınsama ve GPU hardware üzerinde daha düşük bellek kullanımı elde edilmesini sağlar. Bu durum, doğası gereği model collapse riskini azaltır ve kapsamlı hyperparameter tuning gereksinimini ortadan kaldırır.

Gerçek Dünya Uygulamaları#

Direct Preference Optimization, güçlü AI Safety arayışıyla, etkileşimli yapay zeka sistemlerinin çeşitli yüksek riskli endüstrilerde nasıl oluşturulduğunu ve dağıtıldığını kökten yeniden şekillendirmektedir.

  • Enhancing Conversational Agents: chatbots ve sanal asistanlar alanında DPO; toksisiteyi azaltmak ve yanıtları katı OpenAI safety best practices ile Anthropic research on AI alignment ilkeleriyle uyumlu hale getirmek için kullanılır. İnsan etiketçiler bir bilgi istemine verilen iki yanıtı inceler ve kibar, olgusal yanıtı "seçilen" olarak işaretler. DPO daha sonra, halüsinasyonları cezalandırırken bu belirli konuşma tarzını desteklemek için model ağırlıklarını günceller.
  • Refining Vision-Language Models: image recognition geliştiği sürece, modellerin insan operatörlere gördüklerini açıklama gereksinimi giderek artmaktadır. Görsel soru yanıtlama gibi uygulamalar için DPO, araştırmacıların modelin metinsel çıktısını ayrıntılı insan tercihleriyle uyumlu hale getirmesine olanak tanır. Örneğin bir kullanıcı, Ultralytics YOLO26 destekli bir robotik sistemden bir nesneyi tanımlamasını isterse DPO, katı AI Ethics yönergelerine sıkı sıkıya bağlı kalarak modeli belirsiz yorumlar yerine olgusal ve kısa açıklamalara öncelik verecek şekilde eğitir.

Uygulamada DPO#

DPO'yu uygulamak, yüksek kaliteli ikili veriler gerektirir. Modern iş akışları, bu veri kümelerini sorunsuz bir şekilde yönetmek ve data annotation sürecinin net "kazanan" ve "kaybeden" örnekler vermesini sağlamak için Ultralytics Platform gibi kapsamlı araçlardan yararlanır. Bu konunun temelini oluşturan araştırmayı Direct Preference Optimization: Your Language Model is Secretly a Reward Model adlı makalede inceleyebilir veya Stanford HAI tarafından hazırlanan Alignment and Human Preferences hakkındaki yazıları okuyabilirsiniz.

Aşağıdaki Python kod parçacığı, PyTorch API reference içinde bulunan işlevler kullanılarak DPO tarzı bir kayıp hesaplaması için gereken temel veri yapısını gösterir.

import torch
import torch.nn.functional as F


def dpo_loss(chosen_logps, rejected_logps, beta=0.1):
    # DPO maximizes the margin between chosen and rejected log probabilities
    logits = beta * (chosen_logps - rejected_logps)
    # The loss minimizes the negative log sigmoid of this margin
    return -F.logsigmoid(logits).mean()


print(f"DPO Loss: {dpo_loss(torch.tensor([-0.5]), torch.tensor([-2.5])):.4f}")

Explore solutions

Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin
Real-time AI that works with your team

Robotikte bilgisayarlı görü

Daha akıllı makineleri Ultralytics YOLO modelleriyle destekle. Robotikteki Vision AI; otonom navigasyonu, algılamayı, nesne takibini ve gerçek zamanlı kontrolü yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Lojistikte bilgisayarlı görü

Ultralytics YOLO modelleri ile lojistiği kolaylaştır. Görü Yapay Zekası; paket inceleme, ayıklama, araç takibi ve gerçek zamanlı depo güvenliği izlemeyi mümkün kılar.
Daha fazla bilgi edin
Real-time AI that works with your team

Perakendede bilgisayarlı görü

Perakendeyi Ultralytics YOLO modelleri ile yeniden hayal et. Görü Yapay Zekası; envanter takibi, raf izleme, sıra yönetimi ve daha akıllı müşteri içgörüleri sağlar.
Daha fazla bilgi edin
Real-time AI that works with your team

Sağlıkta bilgisayarlı görü

Ultralytics YOLO modelleriyle sağlık çözümleri oluştur. Sağlıkta görüntü tabanlı yapay zeka; daha hızlı tıbbi görüntülemeyi, daha akıllı teşhisleri ve hasta izlemeyi güçlendirir.
Daha fazla bilgi edin
Real-time AI that works with your team

Üretimde bilgisayarlı görü

Ultralytics YOLO modelleri ile üretimi optimize et. Görü Yapay Zekası; kalite kontrol, kusur tespiti, KKD uyumu ve montaj hattı otomasyonunu yönlendirir.
Daha fazla bilgi edin
Real-time AI that works with your operation

Otomotivde bilgisayarlı görü

Ultralytics YOLO modelleriyle otomotivde bilgisayarlı görü uygula. Görüntü tabanlı yapay zeka; yol güvenliğini, sürücü yardımını ve araç otomasyonunu daha akıllı yollar için geliştirir.
Daha fazla bilgi edin
Real-time AI tailored to your operation

Tarımda bilgisayarlı görü

Ultralytics YOLO modelleriyle akıllı tarıma görüntü tabanlı yapay zeka getir. Daha yüksek ve akıllı verimler için mahsul takibini, hayvancılık izlemeyi ve hassas tarımı güçlendir.
Daha fazla bilgi edin

Yapay zekanın geleceğini birlikte inşa edelim!

Yolculuğuna makine öğreniminin geleceğiyle başla