Foundation Model
AIにおける基盤モデルの力を探求します。Ultralytics Platformを使用して、Ultralytics YOLO26のような大規模モデルをカスタムタスクに適応させる方法を学びましょう。
基盤モデルは、人工知能 (AI) の分野における重要なパラダイムシフトを表しています。これは、数千億ものパラメータを含む膨大なデータでトレーニングされた大規模な機械学習モデルであり、幅広い下流タスクに適応させることができます。特定の種類の花の分類など、通常は特定単一の目的のために構築される従来の 機械学習 (ML) モデルとは異なり、基盤モデルは、リソース集約型の事前トレーニングフェーズ中に幅広いパターン、構造、および関係性を学習します。この幅広い知識ベースにより、開発者は 転移学習 を通じてモデルを新しい問題に適用できるようになり、最先端の結果を達成するために必要な時間とデータが大幅に削減されます。
中核となるメカニズム:事前学習と適応#
基盤モデルのパワーは、事前トレーニングとファインチューニングという2段階の開発プロセスにあります。事前トレーニング中、モデルはインターネットの大部分、多様な画像ライブラリ、広範なコードリポジトリなどの大規模なデータセットにさらされます。この段階では、多くの場合、自己教師あり学習 が活用されます。これは、手動の データアノテーション のボトルネックを解消し、モデル自身がデータ構造から独自のラベルを生成するテクニックです。たとえば、言語モデルは文内の次の単語を予測することを学習し、ビジョンモデルはエッジ、テクスチャ、およびオブジェクトの永続性を理解することを学習します。
事前トレーニングが完了すると、モデルは汎用的な出発点として機能します。ファインチューニング と呼ばれるプロセスを通じて、開発者はより小規模なドメイン固有のデータセットでモデルの重みを微調整できます。この機能は AIの民主化 の中心であり、計算リソースが限られた組織でも強力なアーキテクチャを活用できるようになります。最新のワークフローでは、Ultralytics プラットフォーム のようなツールを利用してこの適応プロセスを合理化し、ゼロからニューラルネットワークを構築することなく、カスタムデータセットで効率的なトレーニングを行うことができます。
実社会での応用#
基盤モデルは、さまざまな業界におけるイノベーションのバックボーンとして機能します。一般化能力を備えているため、自然言語処理から高度な コンピュータビジョン に至るまでのタスクに適用できます。
- 医療におけるコンピュータビジョン: 特化型のビジョン基盤モデルをファインチューニングすることで、医療画像分析 を支援できます。一般画像で元々トレーニングされたモデルを適応させることで、MRIスキャンにおける腫瘍の検出や、X線における バックル骨折 の識別を行うことができます。この用途は、一般的な視覚的理解が人命を救う診断ツールにどのように変換されるかを示しています。
- 産業オートメーション: 製造業では、Ultralytics YOLO26 などのビジョンモデルがオブジェクト検出の基礎アーキテクチャとして機能します。工場ではこれらのモデルを使用して 品質検査 を自動化し、組立ライン上の欠陥を高速かつ高精度で検出します。モデルの既存のオブジェクト境界に関する知識により、これらの スマートマニュファクチャリング ソリューションの導入が加速されます。
技術的な実装例#
開発者は基盤モデルを活用して、最小限のコードで複雑なタスクを実行できます。次の例は、リアルタイムアプリケーション向けに最適化されたビジョン基盤モデルである、事前トレーニング済みの YOLO26 モデル をロードして画像上でオブジェクト検出を実行する方法を示しています。
from ultralytics import YOLO
# Load a pre-trained YOLO26 foundation model
# 'n' stands for nano, the smallest and fastest version
model = YOLO("yolo26n.pt")
# Perform inference on an image to detect objects
# The model uses its pre-trained knowledge to identify common objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()主要な用語の区別#
AI環境における関連概念から「基盤モデル」を区別し、それぞれの役割を理解することは有益です。
- 大規模言語モデル (LLM): LLMは、テキストの処理と生成に特化して設計された基盤モデルの タイプ です。すべてのLLMは基盤モデルですが、すべての基盤モデルがLLMであるわけではありません。このカテゴリには、SAM (Segment Anything Model) やマルチモーダルシステムなどのビジョンモデルも含まれます。
- 転移学習: これは、基盤モデルを新しいタスクに適用するために使用される テクニック です。基盤モデルは成果物(保存されたニューラルネットワーク)であり、転移学習は、農業における害虫駆除 などの特定のユースケースに合わせてその成果物の知識を更新するプロセスです。
- 生成AI: これは、新しいコンテンツ(テキスト、画像、コード)を作成できるシステムを指します。多くの基盤モデルが生成AIアプリケーションを支えていますが、厳密には「生成」ではない分類や オブジェクトトラッキング などの識別タスクに使用することもできます。
将来の方向性と影響#
基盤モデルの進化は マルチモーダルAI に向かって進んでおり、単一のシステムでテキスト、画像、音声、センサーからの情報を同時に処理および関連付けることができます。スタンフォード人間中心AI研究所 (HAI) などの機関による研究は、これらのシステムが人間のように世界を推論する可能性を強調しています。これらのモデルの効率が向上するにつれて、エッジコンピューティング デバイスへのデプロイがますます現実的になり、強力なAI機能がスマートフォン、ドローン、IoTセンサーに直接もたらされます。






