Prompt Chaining
プロンプトチェーニングが複雑なAIタスクを信頼性の高いワークフローに分割する方法を学びます。高度なAIエージェントを構築するために、Ultralytics YOLO26とLLMを統合する方法を探求しましょう。
プロンプトチェイニングは、人工知能 (AI)開発における高度なアーキテクチャパターンであり、複雑なタスクをより小さく管理しやすいサブタスクのシーケンスに分解します。このワークフローでは、1つのステップの出力(通常は大規模言語モデル (LLM)やコンピュータビジョンシステムによって生成される)が、後続のステップの入力として機能します。多面的な問題を一度に解決しようとする単一のモノリス的なプロンプトとは異なり、チェイニングを行うことで、開発者はより信頼性が高く、テスト可能で、能力の高いアプリケーションを構築できます。このモジュール式のアプローチは、推論、ウェブブラウジング、または物理環境との対話が可能な洗練されたAIエージェントを作成するために不可欠です。
チェイニングのメカニズム#
プロンプトチェイニングは、その核心において、基盤モデルにおけるコンテキストウィンドウと推論能力の制限に対処します。1つのリクエストでモデルにあまりにも多くの異なる操作を実行するよう要求した場合(例:「この画像を分析し、テキストを抽出し、スペイン語に翻訳し、JSONインボイスとしてフォーマットする」)、エラーの確率が増加します。これをパイプラインに分割することで、開発者は各段階の精度を検証できます。
効果的なチェーンでは、ステップ間のデータ変換を処理するために、Pythonで記述された、またはLangChainのようなオーケストレーションライブラリによって管理される「グルーコード」がしばしば活用されます。これにより、オブジェクト検出の視覚的敏捷性と生成テキストモデルの言語的流暢さを組み合わせるなど、異種のテクノロジーの統合が可能になります。
実社会での応用#
プロンプトチェイニングは、異なるデータモダリティ間のギャップを埋める際に特に強力であり、マルチモーダルモデルが動的な産業および商業環境で機能することを可能にします。
-
自動ビジュアルレポート: スマート製造では、品質管理システムがビジョンモデルとLLMをチェーン化できます。まず、Ultralytics YOLO26のような高速モデルが組立ライン上の部品をスキャンします。構造化された出力(例:「Class: Dented_Can, Confidence: 0.92」)がテキスト文字列に変換されます。次に、このテキストが「この欠陥に基づいて保守リクエストの下書きを作成する」といったプロンプトとともに言語モデルに渡され、現場マネージャー向けの人間に読みやすいメールが生成されます。
-
コンテキストアウェアなカスタマーサポート: インテリジェントチャットボットは、複雑なユーザーのクエリをナビゲートするためにチェイニングをよく使用します。チェーンの最初のリンクでは、自然言語処理 (NLP)を使用してユーザーの意図を分類します。意図が技術的なものである場合、システムは検索拡張生成 (RAG)ワークフローをトリガーします。クエリの埋め込みを生成し、ドキュメントのベクトルデータベースを検索し、最後にLLMにプロンプトを出して取得したチャンクを役立つ回答に統合させます。
ビジョン・言語間のコード例#
次の例は、チェーンの最初の「リンク」を示しています。コンピュータビジョン (CV)を使用して、下流のプロンプトのコンテキストとして機能する構造化データを生成することです。
from ultralytics import YOLO
# Load the YOLO26 model (natively end-to-end and highly efficient)
model = YOLO("yolo26n.pt")
# Step 1: Run inference to 'see' the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Step 2: Format visual detections into a natural language string
det_names = [model.names[int(c)] for c in results[0].boxes.cls]
prompt_context = f"The scene contains: {', '.join(det_names)}. Please describe the likely activity."
# The 'prompt_context' variable is now ready to be sent to an LLM API
print(prompt_context)関連概念の区別#
効果的な機械学習 (ML)アーキテクチャを実装するために、AI業界における同様の用語からプロンプトチェイニングを区別することが役立ちます。
- VS 思考の連鎖プロンプト: 思考の連鎖(CoT)は、モデルに「作業を示す」(例:「ステップバイステップで考える」)よう促すために、単一のプロンプト内で使用されるテクニックです。プロンプトチェイニングには複数の個別のAPIコールが含まれ、ステップBの入力はステップAの出力に依存します。
- VS プロンプトエンジニアリング: プロンプトエンジニアリングは、より良いモデルパフォーマンスを引き出すためにテキスト入力を最適化する広範な分野です。チェイニングは、操作の順序付きフローとロジック制御に焦点を当てた特定のエンジニアリングパターンです。
- VS プロンプトチューニング: プロンプトチューニングは、トレーニングフェーズ中に学習可能なパラメータ(ソフトプロンプト)を更新するモデル最適化手法です。プロンプトチェイニングは完全にリアルタイム推論中に発生し、モデルのモデル重みを変更しません。
プロンプトチェイニングを活用することで、チームはロジック、データ取得、アクション認識を統合した堅牢なアプリケーションを構築できます。これらのチェーンを動かすデータセットの管理とビジョンモデルのトレーニングのために、Ultralytics プラットフォームはアノテーション、トレーニング、およびデプロイメントのための集中型ソリューションを提供します。






