Unsupervised Learning
ラベルなしデータに隠れたパターンを発見するための教師なし学習を探求します。クラスタリング、異常検知、そしてそれらがどのように現代のAIソリューションを動かしているかを学びましょう。
教師なし学習は、人間が介入することなく、アルゴリズムがタグ付けされていないデータからパターンを学習する機械学習の一種です。モデルのトレーニングにラベル付きの入出力ペアを必要とする教師あり学習とは異なり、教師なし学習は過去のラベルがないデータを扱います。システムは、入力データ内の隠れた構造、パターン、または関係性を発見することで、本質的に自己学習を試みます。今日生成される画像、動画、テキスト、センサーログなどの膨大なデータは非構造化でラベル付けされていないため、このアプローチは非常に価値があります。
教師なし学習の仕組み#
教師なし学習のシナリオでは、アルゴリズムはデータ内の興味深い構造を発見するために自律的に動作します。目標は、データの基盤となる分布をモデル化すること、あるいはデータそのものについてさらに深く学ぶことであることがよくあります。トレーニング中に「正解」が提供されないため、モデルを伝統的な意味での精度で評価することはできません。代わりに、パフォーマンスは、モデルがどの程度次元を削減できているか、あるいは類似したデータポイントをどの程度クラスタリングできているかによって測定されることが一般的です。
この手法は、人間が新しい概念を学ぶ方法によく似ています。例えば、子供は「犬」や「猫」という名前を最初から知らなくても、その異なる形や行動を観察することで犬と猫を区別することができます。同様に、教師なしアルゴリズムは、本質的な類似性に基づいて情報をグループ化します。この能力は、システムが人間の常時監視なしに新しい環境に適応できるようにするため、人工汎用知能 (AGI) の開発において極めて重要です。
教師なし学習の主要な手法#
教師なし学習にはいくつかの明確な手法があり、それぞれが異なるタイプのデータ分析課題に適しています。
- クラスタリング: これは最も一般的な応用であり、アルゴリズムが互いに類似したデータポイントをグループ化します。一般的な手法として K-Meansクラスタリング があり、これは特徴量の類似性に基づいてデータを k 個の異なるグループに分割します。これは、同様の購買行動を持つ顧客グループを特定するためのマーケットセグメンテーションで広く使用されています。
- 次元削減: 高次元データは、処理が複雑で計算コストが高くなる可能性があります。主成分分析 (PCA) などの手法は、データセットの本質的な情報を保持しながら変数の数を削減します。これにより、データビジュアライゼーション が簡素化され、他の機械学習モデルのトレーニングが高速化されます。
- 異常検知: 「正常な」データがどのようなものかを学習することで、教師なしモデルは正常値から大きく逸脱した外れ値を特定できます。これは、異常なトランザクションパターンがセキュリティアラートを引き起こす 金融における不正検知 において不可欠です。
- アソシエーションルール学習: この手法は、大規模なデータベース内の変数間の興味深い関係を発見します。これはマーケットバスケット分析に使用されることで有名であり、パンを購入する顧客がバターも購入する可能性が高いことを小売業者が理解するのに役立ちます。
教師なし学習と教師あり学習の比較#
教師なし学習 と 教師あり学習 を区別することは重要です。主な違いは使用されるデータにあります。教師あり学習には ラベル付きデータセット が必要であり、これは各トレーニング例が正しい出力(例:「猫」とラベル付けされた猫の画像)とペアになっていることを意味します。モデルは、誤差を最小限に抑えるために、入力を出力にマッピングすることを学習します。
対照的に、教師なし学習ではラベルなしデータを使用します。モデルに出力が正しいかどうかを伝えるフィードバックループはありません。学習精度を向上させるために少量のラベル付きデータと大量のラベルなしデータを組み合わせた 半教師あり学習 と呼ばれる中間的な手法が存在し、データのラベリングに費用や時間がかかる場合によく利用されます。
実社会での応用#
教師なし学習は、私たちが日常的に遭遇する多くの技術を支えています。具体的な例を2つ挙げます。
-
小売における顧客セグメンテーション: Eコマースプラットフォームは、事前定義されたカテゴリなしで数百万のユーザーインタラクションを分析します。クラスタリングアルゴリズムを使用することで、「週末のバーゲンハンター」や「テック愛好家」などの明確なユーザーペルソナを特定します。これにより、高度にパーソナライズされたマーケティングキャンペーンや レコメンデーションシステム が可能になり、顧客体験が大幅に向上します。
-
ゲノム配列解析: バイオインフォマティクスにおいて、研究者は教師なし学習を使用して遺伝データを分析します。アルゴリズムはDNA配列をクラスタリングし、異なる集団間で類似した遺伝的マーカーや変異を見つけ出します。これは、個々の遺伝子機能に関する事前の知識がなくても、進化上の関係を理解したり、疾患に対する遺伝的素因を特定したりするのに役立ちます。
コード例: Scikit-Learn を使用したクラスタリング#
Ultralytics YOLO26 は主に教師ありオブジェクト検出フレームワークですが、アンカーボックス分布の分析やデータセット特徴量のクラスタリングなどの前処理ステップでは、教師なし手法がよく使用されます。以下は、基本的な教師なし手法である K-Meansクラスタリングを実行するために sklearn を使用した簡単な例です。
import numpy as np
from sklearn.cluster import KMeans
# Generate synthetic data: 10 points with 2 features each
X = np.array([[1, 2], [1, 4], [1, 0], [10, 2], [10, 4], [10, 0]])
# Initialize KMeans with 2 clusters (k=2)
kmeans = KMeans(n_clusters=2, random_state=0, n_init="auto")
# Fit the model to the data (no labels provided!)
kmeans.fit(X)
# Predict which cluster each point belongs to
print(f"Labels: {kmeans.labels_}")
# Output will group the first 3 points together (0) and the last 3 together (1)ディープラーニングにおける教師なし学習の役割#
現代の ディープラーニング (DL) では、教師なしの原則がますます統合されています。自己教師あり学習 (SSL) などの手法により、モデルはデータから独自の監視信号を生成できます。例えば、自然言語処理 (NLP) では、GPT-4 などのモデルが膨大な量のテキストで事前トレーニングされ、文中の次の単語を予測することで、明示的なラベルなしで言語の構造を効率的に学習します。
同様に、コンピュータビジョン (CV) では、オートエンコーダーを使用して効率的なデータエンコーディングを学習します。これらのニューラルネットワークは、画像を低次元表現に圧縮し、その後再構築します。このプロセスにより、ネットワークは視覚データの最も顕著な特徴を学習し、画像ノイズ除去 や生成モデリングなどのタスクに役立ちます。
トレーニング用のデータセットを管理したい方のために、Ultralytics Platform はデータ分布を視覚化するツールを提供しており、教師ありトレーニングプロセスが始まる前にクラスターや異常を特定するのに役立ちます。教師なし探索を通じてデータの構造を理解することは、多くの場合、ロバストなAIソリューションを構築するための最初のステップとなります。






