Tabular Foundation Models
分類および回帰における事前学習済み知識の活用方法について、実践的なワークフロー、アプリケーション、評価ガイダンスとともに、タブلار基礎モデルの仕組みを学びます。
表形式基盤モデルは、行と列に整理された構造化データから予測を行うように設計された、事前学習済みの機械学習モデルです。すべての新しいタスクを最初から完全に学習するのではなく、多くのデータセットで学習したパターンを再利用して、新しい表、そのラベル付きサンプル、および特徴量間の関係を解釈します。表形式基盤モデルは、汎用的な基盤モデルのアイデアを、分類や回帰などの一般的な教師あり学習の問題に拡張したものです。
表形式基盤モデルの仕組み#
従来の表形式モデルは、1つのタスク用に提供されたデータセットからのみ学習します。一方、表形式基盤モデルは、まず幅広い分布の表または生成されたデータ問題全体で事前学習されます。これにより、関係、ノイズ、特徴量間の相互作用、クラスの境界、および欠損情報に関する再利用可能な仮定をモデルに学習させることができます。
新しいデータセットが与えられると、モデルは学習用の行、そのターゲット値、および予測を必要とする行を調べます。多くの実装では、コンテキスト内学習によってこのステップを実行します。ラベル付きレコードは、多くの場合に長いタスク固有のパラメータ最適化を必要とせずに、新しいタスクを解決するために必要なコンテキストを提供します。Transformerはアーキテクチャによって異なる場合がありますが、列と行をコンテキスト要素として処理する場合があります。
表には、画像やテキストにはない課題が存在します。列は連続値の測定値、カテゴリ、日付、カウント、または識別子を表すことができ、その順序は通常ほとんど意味を持ちません。適切なデータ準備は依然として不可欠です。scikit-learnの混合型列の処理に関するガイドは、異なる特徴量型に異なる処理が必要になる理由を示しており、pandasのドキュメントでは欠損データの表現の一貫した方法を説明しています。基盤モデルは手動の特徴量エンジニアリングを削減できますが、誤ったラベルや不適切に定義された変数を自動的に修正することはできません。
関連概念と主な違い#
-
自動機械学習: AutoMLは、各データセットのアルゴリズム、前処理ステップ、およびハイパーパラメータを探索します。これに対し、表形式基盤モデルは事前学習から再利用可能な知識をもたらし、モデル探索をほとんど行わずに予測を生成する場合があります。
-
転移学習: 転移学習は通常、ファインチューニングを通じて事前学習済み重みを適応させます。表形式基盤モデルはファインチューニングをサポートできますが、多くは新しい表のサンプルから直接推論するように設計されています。
-
勾配ブースティング木: ツリーアンサンブルは依然として強力で効率的な表形式のベースラインであり、タスクごとに個別に学習されます。基盤モデルは、小規模なデータセット、迅速な実験、または繰り返しのタスクに特に便利ですが、ツリーモデルの置き換えとみなされるのではなく、ツリーモデルと比較されるべきです。
表形式基盤モデルは、CSVテキストに適用される言語モデルとも異なります。表形式基盤モデルは、すべての行を通常の自然言語プロンプトとして扱うのではなく、特徴量とターゲットの統計的構造に対して動作します。
実世界での利用例#
-
臨床リスク評価: 病院には、患者の年齢、検査測定値、症状、治療履歴、および結果のラベルを含む比較的小さな表が存在する場合があります。表形式基盤モデルは、大規模なニューラルネットワークの学習実行を必要とせずに、再入院や合併症などのリスクを推定できます。エラーがケアの決定に影響を与える可能性があるため、チームは患者グループ全体でパフォーマンスを評価し、適切な臨床的監督を維持する必要があります。このワークフローは、スキャンから得られた測定値が追加の表の列になる、画像ベースの医療におけるコンピュータビジョンを補完できます。
-
製造品質予測: 検査システムは、機械の温度、生産速度、材料のバッチ、シフト、およびセンサーの読み取り値を記録しながら、コンピュータビジョンを使用して目に見える欠陥を検出できます。欠陥数や信頼度スコアなどのUltralytics YOLO26モデルからの予測は、構造化された特徴量に変換され、運用データと組み合わせることができます。次に、表形式モデルは、ユニットにレビューが必要かどうか、またはプロセスが許容範囲から外れる可能性が高いかどうかを予測できます。チームは、Ultralytics Platformを通じて、ビジョンデータセットのアノテーション、学習、およびデプロイを管理できます。
実践的なワークフローと評価#
よく知られている実装では、文書化されたTabPFN分類ワークフローを通じてscikit-learnスタイルの分類器が公開されています。tabpfnとscikit-learnをインストールし、必要な初回のモデルアクセスを完了した後の、最小限の二値分類の例は次のとおりです。
from sklearn.datasets import load_breast_cancer
from sklearn.metrics import roc_auc_score
from sklearn.model_selection import train_test_split
from tabpfn import TabPFNClassifier
# Create separate training and test sets
features, targets = load_breast_cancer(return_X_y=True)
x_train, x_test, y_train, y_test = train_test_split(features, targets, test_size=0.2, random_state=42, stratify=targets)
# Fit from the labeled context and predict probabilities
model = TabPFNClassifier()
model.fit(x_train, y_train)
probabilities = model.predict_proba(x_test)[:, 1]
print(roc_auc_score(y_test, probabilities))これはおなじみのfitおよびpredictインターフェイスを示していますが、単一のテスト分割は本番環境への準備完了の十分な証拠ではありません。適切なクロスバリデーション戦略を使用し、前処理またはターゲットのリークを防ぎ、エラーのコストに一致する評価指標を選択してください。決定が予測確率に依存する場合は、精度だけでなく確率キャリブレーションも確認してください。
最後に、サブグループごとにパフォーマンスを検査し、単純なベースラインと比較し、シフトされたデータをテストし、制限事項を文書化します。NIST AIリスク管理フレームワークは信頼性の高い評価のためのより広いガイダンスを提供し、継続的なモデルモニタリングはデプロイ後の変化する特徴量分布とパフォーマンスの低下を検出するのに役立ちます。









