Scaling Laws
AIにおけるニューラルスケーリング則とテスト時コンピュートについて説明します。リソースのスケーリングと最適化が、新しいUltralytics YOLO26のようなモデルを導く方法を紹介します。
人工知能におけるニューラルスケーリングの経験的観察から、計算能力、データセットのサイズ、パラメーター数などの特定のリソースを増やすと、モデルの性能が予測可能な形で向上することが示されています。OpenAIやGoogle DeepMindなどの組織による研究によって広く知られるようになったこれらのべき乗則の関係は、リソースを拡大するとクロスエントロピー損失が数学的に予測可能な形で減少することを示しています。これらの原則を理解することで、研究者やエンジニアは数百万ドル規模の予算を効率的に配分し、大規模なトレーニングを開始する前に、目標とする精度を達成するために必要なニューラルネットワークの規模を正確に見積もることができます。
事前学習スケーリングの進化#
2020年に導入されたKaplanのスケーリング則として知られるこれらの規則の初期の定式化では、トレーニング時の計算量を増やすと、言語モデルの性能が滑らかにスケールすることが示されました。その後、このフレームワークは2022年のChinchillaスケーリング則によって改良され、最適なトレーニングには、モデルサイズとトレーニングデータの両方を同じ比率でスケールさせる必要があることが明らかになりました。たとえば、モデルのパラメーター数を2倍にする場合、トレーニングトークン数も2倍にする必要があります。このパラダイムは、PyTorchやTensorFlowなどのフレームワークを使用して構築された最新の大規模言語モデル(LLMs)の開発を導き、過学習のリスクや計算資源の無駄を避けながら、大規模なGPUクラスターを効果的に活用できるようにしました。
パラダイムシフト:テスト時コンピュートのスケーリング#
年次AI進歩レポートで強調されているように、2024年から2025年にかけて、AI業界では推論時のスケーリングへと大きくシフトしました。より大規模なモデルの事前学習が収穫逓減やデータ可用性の限界に直面し始める中、研究者たちはLLMのテスト時コンピュートをスケールさせる方法を直接見いだしました。推論中にモデルへより多くの処理能力を与えることで、複雑な推論能力を大幅に向上させられます。
思考の連鎖(CoT)やBest-of-Nサンプリングなどの手法により、モデルは回答する前に複数の経路を探索できます。OpenAIのo1やDeepSeek-R1などの先進的なモデルが先導したこのテスト時スケーリング則は、その他の高度な推論モデルとともに、予測段階の計算量を増やすことで、はるかに小規模で高効率なアーキテクチャが、厳格な論理ベンチマークにおいて大規模な従来型モデルを上回れることを実証しています。
実世界での利用例#
スケーリングの原則はテキスト生成にとどまらず、現代のコンピュータビジョンや物体検出のパイプラインにも大きな影響を与え、その開発を左右しています。
- 基盤モデルのリソース配分: 自動運転システムを開発する企業は、スケーリングの公式を利用して、平均適合率(mAP)のエラー率を安全で本番運用可能な水準まで低減するために必要なアノテーション済み画像の枚数を正確に算出します。Ultralytics Platformによる共同データアノテーションとクラウドベースの分散トレーニングを活用することで、チームはデプロイ前にコストを数学的に見積もることができます。
- モデルサイズの決定とエッジデプロイ: スケーリングの公式は、Ultralytics YOLO26などの最新モデルのアーキテクチャ設計に直接影響します。Nano(n)からExtra Large(x)まで数学的にスケールされた統一モデルファミリーを提供することで、開発者は特定のエッジハードウェアの制約に基づき、厳格な精度要件と推論レイテンシのトレードオフを予測可能な形で調整できます。
コード例:コンピュータビジョンにおける推論時スケーリング#
コンピュータビジョンでは、テスト時拡張(TTA)と呼ばれる実用的なテスト時スケーリングを活用できます。予測段階で追加の計算を行い、画像の複数の拡張バージョンを評価することで、モデルの検出信頼度を予測可能な形で向上させられます。これは、高度なLLMで見られる推論探索手法を反映したものです。
from ultralytics import YOLO
# Load the recommended YOLO26 model (nano version for high speed)
model = YOLO("yolo26n.pt")
# Perform standard inference (faster, lower test-time compute)
results_standard = model("https://ultralytics.com/images/bus.jpg")
# Perform inference-time scaling via Test-Time Augmentation (TTA)
# Predictably improves accuracy by utilizing more compute during prediction
results_tta = model("https://ultralytics.com/images/bus.jpg", augment=True)
print(f"Standard detections: {len(results_standard[0].boxes)}")
print(f"Scaled TTA detections: {len(results_tta[0].boxes)}")スケーリング則と関連概念の比較#
AIのスケーリング則はハードウェアの能力と密接に関連していますが、ハードウェアに対するソフトウェアおよびアルゴリズムの効率を具体的に測定するものです。
- スケーリング則とムーアの法則の比較: ムーアの法則は、マイクロチップ上のトランジスター数が約2年ごとに2倍になると予測する、長年にわたるハードウェアに関する経験則です。これに対してAIのスケーリングは、拡大するハードウェアのリソースプールにアクセスできる場合に、実際のモデル性能がどのように向上するかを数学的に追跡します。
- トレーニング時スケーリングと推論時スケーリングの比較: トレーニングの公式は、モデルの初期作成時におけるパラメーターとデータの最も計算効率の高い組み合わせを算出します。一方、推論時スケーリングは、再トレーニングを必要とせず、出力を生成する直前に探索および検証のステップへ追加の計算を動的に投入することで、最終結果がどのように改善されるかを測定します。






