Generative AI
Generative AIの基礎をご確認ください。合成データを生成し、Ultralytics YOLO26と統合し、コンピュータビジョンのイノベーションを推進する仕組みを学べます。
生成AIは、ユーザーのプロンプトに応じて、テキスト、画像、音声、動画、コンピューターコードなどの新しいコンテンツを作成することに重点を置く人工知能 (AI)の一分野です。既存のデータの分析や分類を主な目的として設計された従来のAIシステムとは異なり、生成モデルは深層学習 (DL)アルゴリズムを使用して、大規模なデータセットに内在するパターン、構造、確率分布を学習します。学習後、これらのシステムは学習データと統計的な類似性を持ちながらも、独自に作成された新しい出力を生成できます。この機能により、生成AIは現代の基盤モデルの中核となり、クリエイティブ産業、ソフトウェア開発、科学研究全体のイノベーションを推進しています。
生成モデルの仕組み#
生成AIの中核には、情報のエンコードとデコードを学習する複雑なニューラルネットワークアーキテクチャがあります。これらのモデルは通常、膨大なデータコーパスを用いた教師なし学習によって訓練されます。
- Transformer: テキストやコードでは、Transformerアーキテクチャが自己注意などのメカニズムを利用して、シーケンス内の長い距離にわたる単語間の関係を追跡します。これにより、大規模言語モデル (LLMs)は一貫性があり、文脈に適したテキストを生成できます。
- 拡散モデル: 画像生成では、拡散モデルは画像が認識できなくなるまでノイズを加え、その後、このプロセスを逆転させて、ランダムノイズから鮮明な画像を再構成する方法を学習します。
- GANs: 生成敵対ネットワーク (GANs)は、生成器と識別器という2つのニューラルネットワークを使用します。両者が互いに競い合うことで、生成器はますます現実的な出力を生成するようになります。
生成AIと識別AIの比較#
生成AIを理解するには、識別AIとの違いを明確にすることが重要です。どちらも機械学習の柱ですが、その目的は大きく異なります。
- 生成AIは生成に重点を置きます。個々のクラスの分布をモデル化し、新しいサンプルを生成します。たとえば、Stable Diffusionのようなモデルは、テキストによる説明に基づいて犬の新しい画像を生成します。
- 識別AIは分類と予測に重点を置きます。クラス間の決定境界を学習して、入力データを分類します。YOLO26のような高性能ビジョンモデルは識別モデルです。画像を分析して特定のオブジェクトを識別・位置特定する物体検出に優れており(写真内の犬の検出など)、画像自体を作成するわけではありません。
実世界での利用例#
生成AIは高い汎用性を持つため、さまざまな分野に適用でき、多くの場合、識別モデルと組み合わせて強力なワークフローを構築します。
-
合成データ生成: コンピュータービジョンエンジニアにとって最も実用的な用途の1つは、合成データの作成です。特定の産業上の欠陥や危険な道路状況など、まれなエッジケースの実世界データを収集することは、危険またはコストのかかる場合があります。生成モデルは、こうしたシナリオのフォトリアリスティックな画像を数千枚生成できます。その後、このデータを使用してYOLO26のような堅牢な検出器を訓練し、実世界での精度を向上させます。
-
クリエイティブデザインとプロトタイピング: クリエイティブ分野では、テキストから画像へのモデルを利用したツールによって、デザイナーはコンセプトを迅速に可視化できます。プロンプトを入力すると、アーティストは製品デザイン、建築レイアウト、マーケティング素材などの複数のバリエーションを生成でき、アイデア創出の段階を大幅に加速できます。
-
コード生成とデバッグ: ソフトウェア開発は、コードリポジトリで訓練されたモデルによって変革されました。これらのアシスタントは、コードスニペットの提案、ドキュメントの作成、さらにはバグの特定によって開発者を支援し、ソフトウェアライフサイクルを効率化します。
コンピュータービジョンとの相乗効果#
生成AIと識別型のコンピュータービジョンモデルは、補完的なテクノロジーとして機能することがよくあります。一般的なパイプラインでは、生成モデルを使用してデータセットを拡張し、その後、Ultralytics Platformなどのツールを使用して、拡張されたデータセットで識別モデルを訓練します。
次のPythonの例では、ultralyticsパッケージを使用してYOLO26モデルを読み込む方法を示します。ハイブリッドワークフローでは、このコードを使用して、合成生成された画像内のオブジェクトを検証できます。
from ultralytics import YOLO
# Load the YOLO26 model (Latest stable Ultralytics model)
model = YOLO("yolo26n.pt")
# Run inference on an image (e.g., a synthetic sample from a generative model)
# The model identifies objects within the generated content
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results to verify the synthetic data quality
results[0].show()課題と考慮事項#
生成AIは強力である一方、ユーザーが対処しなければならない特有の課題ももたらします。モデルは、ときどきハルシネーションを起こし、もっともらしく聞こえるものの事実とは異なる情報や、視覚的なアーティファクトを生成することがあります。さらに、これらのモデルはインターネット規模のデータで訓練されるため、元の資料に含まれるAIにおけるバイアスを意図せず拡散する可能性があります。
著作権や知的財産に関する倫理的な懸念も顕著であり、さまざまなAI倫理フレームワークで議論されています。Stanford Institute for Human-Centered AIなどの研究者や組織は、これらの強力なツールが責任を持って開発・導入されるようにする方法に積極的に取り組んでいます。さらに、こうした大規模モデルの訓練にかかる計算コストの増大により、エッジデバイスでの推論をよりエネルギー効率の高いものにするため、モデル量子化への関心が高まっています。









