YOLO Vision 2026:
Ultralytics用語集に戻る

Direct Preference Optimization (DPO)

Direct Preference Optimization (DPO) がAIアライメントをどのように簡素化するか解説します。この効率的な手法がRLHFに代わって、いかにモデルの安全性とパフォーマンスを向上させるかを発見しましょう。

Direct Preference Optimization (DPO) は、人工知能モデルを微調整して人間の意図、安全性基準、および倫理的ガイドラインに確実に適合させるために使用される、安定した効率的なアルゴリズム手法です。人間のフィードバックを捉えるために複雑なマルチステージパイプラインを必要とする従来の方法とは異なり、DPO は、選好学習を標準的な機械学習における分類タスクとして直接扱うことによって、アライメントプロセスを数学的に簡素化します。アノテーターが「不採用」の応答よりも「採用」の応答を選択する、人間の選好に関するデータセットに基づいてモデルを直接最適化することにより、開発者は大規模な基礎モデルおよび現代の生成AIシステムの有用性、誠実さ、および安全性を大幅に向上させることができます。

DPOがモデルの適合を簡素化する仕組み#

Direct Preference Optimization の主要な革新は、アーキテクチャ上の「仲介役」を排除した点にあります。歴史的に、大規模言語モデル (LLM) またはビジョン・言語モデルのアライメントには、人間のフィードバックからの強化学習 (RLHF) として知られる複雑なプロセスが含まれていました。RLHF では、人間のスコアを近似するために別個の報酬モデルをトレーニングし、その後に近傍政策最適化のような不安定になりやすい強化学習アルゴリズムを使用してメインモデルを更新する必要があります。

DPO は、この別個の報酬モデルの必要性を数学的に排除します。その代わりに、「選ばれた」出力の生成確率を高めると同時に、「拒否された」出力の生成確率を低下させる、派生した損失関数に依存します。参照モデルを使用してカルバック・ライブラー情報量を制限し、更新されたモデルが元のトレーニングデータ分布から大きく乖離しないようにします。この数学的な簡素化により、プロセスは標準的な教師あり学習に非常に近い動作をするようになり、GPU ハードウェアでの高速な収束と低いメモリ使用量をもたらします。これにより、本質的にモデル崩壊のリスクが軽減され、広範なハイパーパラメータチューニングが不要になります。

実社会での応用#

Direct Preference Optimization は、堅牢なAI安全性の追求に向けて、さまざまな重要性の高い産業全体でインタラクティブな AI システムが構築および展開される方法を根本的に再定義しています。

  • 会話型エージェントの強化: チャットボットやバーチャルアシスタントの領域では、DPO は有害性を削減し、応答を厳格なOpenAIの安全に関するベストプラクティスおよびAIアライメントに関するAnthropicの研究に適合させるために使用されます。人間のアノテーターがプロンプトに対する2つの回答をレビューし、丁寧で事実に基づいた回答に「選択済み」のマークを付けます。その後、DPO はモデルの重みを更新してこの特定の会話スタイルを優先しつつ、ハルシネーションにペナルティを課します。
  • ビジョン・言語モデルの洗練: 画像認識が進化するにつれて、モデルは自分が見ているものを人間のオペレーターに説明することをますます求められています。視覚的質問応答などのアプリケーションの場合、DPO は、モデルのテキスト出力を詳細な人間の選好に適合させることを研究者に許可します。たとえば、ユーザーが Ultralytics YOLO26 を搭載したロボットシステムにオブジェクトの説明を求めた場合、DPO は、曖昧な解釈よりも事実に基づく簡潔な説明を優先するようにモデルをトレーニングし、厳格なAI倫理ガイドラインに厳密に従わせます。

DPOの実践#

DPO を実装するには、高品質なペアワイズデータが必要です。現代のワークフローでは、Ultralytics プラットフォームのような包括的なツールを活用してこれらのデータセットをシームレスに管理し、データアノテーションプロセスによって明確な「勝者」と「敗者」の例が得られるようにします。これの背景にある基礎的な研究については、論文Direct Preference Optimization: Your Language Model is Secretly a Reward Modelで探索するか、Stanford HAI によるアライメントと人間の選好について読むことができます。

次の Python スニペットは、PyTorch API リファレンスにある関数を使用して、DPO スタイルの損失計算に必要な基礎的なデータ構造を示しています。

import torch
import torch.nn.functional as F


def dpo_loss(chosen_logps, rejected_logps, beta=0.1):
    # DPO maximizes the margin between chosen and rejected log probabilities
    logits = beta * (chosen_logps - rejected_logps)
    # The loss minimizes the negative log sigmoid of this margin
    return -F.logsigmoid(logits).mean()


print(f"DPO Loss: {dpo_loss(torch.tensor([-0.5]), torch.tensor([-2.5])):.4f}")

Explore solutions

Real-time AI that works with your team

ロボティクスにおけるコンピュータビジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるコンピュータビジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売におけるコンピュータビジョン

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるコンピュータビジョン

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるコンピュータビジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるコンピュータビジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるコンピュータビジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売におけるコンピュータビジョン

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるコンピュータビジョン

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるコンピュータビジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるコンピュータビジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるコンピュータビジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売におけるコンピュータビジョン

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるコンピュータビジョン

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるコンピュータビジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら

AIの未来を共に築き上げましょう!

機械学習の未来とともに旅を始めましょう