Scaling Laws
AI에서 neural scaling law와 test-time compute를 살펴보세요. resource scaling과 optimization이 새로운 Ultralytics YOLO26과 같은 model을 이끄는 방법을 알아보세요.
인공지능에서 신경망 스케일링에 대한 경험적 관찰에 따르면, 컴퓨팅 성능, 데이터셋 크기, 파라미터 수와 같은 특정 리소스를 늘릴수록 모델 성능이 예측 가능한 방식으로 향상됩니다. OpenAI와 Google DeepMind 같은 조직의 연구를 통해 처음 널리 알려진 이러한 멱법칙 관계는 리소스를 확장하면 교차 엔트로피 손실이 수학적으로 예측 가능한 수준으로 감소한다는 것을 보여줍니다. 이러한 원리를 이해하면 연구자와 엔지니어는 수백만 달러 규모의 예산을 효율적으로 배분하고, 대규모 학습을 시작하기 전에 목표 정확도에 도달하는 데 필요한 신경망의 규모를 정확히 예측할 수 있습니다.
사전 학습 스케일링의 발전#
2020년에 도입된 Kaplan 스케일링 법칙으로 알려진 이러한 규칙의 초기 공식은 학습 컴퓨팅을 늘리면 언어 모델 성능이 원활하게 확장된다는 사실을 정립했습니다. 이후 2022년 Chinchilla 스케일링 법칙을 통해 이 프레임워크가 개선되었으며, 최적의 학습을 위해서는 모델 크기와 학습 데이터를 동일한 비율로 확장해야 한다는 사실이 밝혀졌습니다. 예를 들어 모델의 파라미터를 두 배로 늘리면 학습 토큰 수도 두 배로 늘려야 합니다. 이 패러다임은 PyTorch와 TensorFlow 같은 프레임워크를 사용해 구축된 최신 대규모 언어 모델(LLMs)의 개발을 성공적으로 이끌었으며, 대규모 GPU 클러스터를 과적합 위험이나 컴퓨팅 자원 낭비 없이 효과적으로 활용할 수 있도록 했습니다.
패러다임의 전환: 테스트 시점 컴퓨팅 스케일링#
연례 AI 발전 보고서에서 강조된 것처럼, 2024년부터 2025년 사이에 AI 업계는 추론 시점 스케일링으로 크게 전환했습니다. 더 큰 모델의 사전 학습이 수익 감소와 데이터 가용성의 한계에 부딪히기 시작하면서, 연구자들은 LLM 테스트 시점 컴퓨팅을 직접 스케일링하는 방법을 발견했습니다. 추론 중에 모델에 더 많은 처리 능력을 제공하면 복잡한 추론 능력을 크게 향상시킬 수 있습니다.
사고 사슬(CoT) 및 Best-of-N 샘플링과 같은 기법을 사용하면 모델이 답변하기 전에 여러 경로를 탐색할 수 있습니다. OpenAI의 o1과 DeepSeek-R1 같은 고급 모델과 다른 고급 추론 모델이 선도한 이러한 테스트 시점 스케일링 법칙은 예측 단계의 컴퓨팅을 늘리면 훨씬 더 작고 효율적인 아키텍처가 엄격한 논리 벤치마크에서 대규모 레거시 모델을 능가할 수 있음을 입증합니다.
실제 적용 사례#
스케일링 원리는 텍스트 생성을 훨씬 넘어 개발 전반을 지배하며, 최신 컴퓨터 비전 및 객체 감지 파이프라인에도 큰 영향을 미칩니다.
- 파운데이션 모델을 위한 리소스 할당: 자율주행 시스템을 개발하는 기업은 스케일링 공식을 활용해 평균 정밀도(mAP) 오류율을 안전하고 실제 운영에 적합한 수준으로 낮추는 데 필요한 어노테이션 이미지 수를 정확히 계산합니다. Ultralytics Platform을 활용해 협업 데이터 어노테이션과 클라우드 기반 분산 학습을 수행하면, 팀은 배포 전에 비용을 수학적으로 예측할 수 있습니다.
- 모델 크기 결정 및 엣지 배포: 스케일링 공식은 Ultralytics YOLO26과 같은 최신 모델의 아키텍처 설계에 직접적인 영향을 미칩니다. Nano(n)부터 Extra Large(x)까지 수학적으로 확장된 통합 모델군을 제공함으로써, 개발자는 특정 엣지 하드웨어의 제약에 따라 엄격한 정확도 요구사항과 추론 지연 시간 사이의 균형을 예측 가능하게 조정할 수 있습니다.
코드 예제: 컴퓨터 비전의 추론 시점 스케일링#
컴퓨터 비전에서는 테스트 시점 증강(TTA)이라는 실용적인 형태의 테스트 시점 스케일링을 활용할 수 있습니다. 예측 단계에서 추가 컴퓨팅을 사용해 이미지의 여러 증강 버전을 평가하면 모델의 감지 신뢰도가 예측 가능하게 향상되며, 이는 고급 LLM에서 볼 수 있는 추론 탐색 기법과 유사합니다.
from ultralytics import YOLO
# Load the recommended YOLO26 model (nano version for high speed)
model = YOLO("yolo26n.pt")
# Perform standard inference (faster, lower test-time compute)
results_standard = model("https://ultralytics.com/images/bus.jpg")
# Perform inference-time scaling via Test-Time Augmentation (TTA)
# Predictably improves accuracy by utilizing more compute during prediction
results_tta = model("https://ultralytics.com/images/bus.jpg", augment=True)
print(f"Standard detections: {len(results_standard[0].boxes)}")
print(f"Scaled TTA detections: {len(results_tta[0].boxes)}")스케일링 법칙과 관련 개념의 비교#
AI 스케일링 규칙은 하드웨어 기능과 밀접하게 관련되어 있지만, 해당 하드웨어에 대한 소프트웨어 및 알고리즘 효율성을 구체적으로 측정합니다.
- 스케일링 법칙과 무어의 법칙 비교: 무어의 법칙은 마이크로칩의 트랜지스터 수가 대략 2년마다 두 배로 증가할 것이라고 예측하는 오랜 하드웨어 관찰입니다. 반면 AI 스케일링은 확장되는 하드웨어 풀에 접근할 수 있을 때 실제 모델 성능이 어떻게 향상되는지를 수학적으로 추적합니다.
- 학습 스케일링과 추론 스케일링 비교: 학습 공식은 모델을 처음 생성하는 동안 파라미터와 데이터의 컴퓨팅 최적 조합을 계산합니다. 반대로 추론 스케일링은 재학습 없이 출력을 생성하기 직전에 탐색 및 검증 단계에 추가 컴퓨팅을 동적으로 투입하면 최종 결과가 어떻게 향상되는지를 측정합니다.






