Scaling Laws
Изучи законы масштабирования нейронных сетей и вычисления во время тестирования в ИИ. Узнай, как масштабирование ресурсов и оптимизация направляют модели, такие как новая Ultralytics YOLO26.
Эмпирические наблюдения за масштабированием нейросетей в области искусственного интеллекта показывают, что производительность модели предсказуемо улучшается при увеличении определённых ресурсов — таких как вычислительная мощность, размер набора данных и количество параметров. Эти степенные зависимости, первоначально получившие широкую известность благодаря исследованиям таких организаций, как OpenAI и Google DeepMind, показывают, что масштабирование ресурсов приводит к математически предсказуемому снижению кросс-энтропийных потерь. Понимание этих принципов позволяет исследователям и инженерам эффективно распределять бюджеты в несколько миллионов долларов и заранее точно рассчитывать, насколько большой должна быть нейронная сеть, чтобы достичь целевой точности, ещё до запуска масштабного обучения.
Эволюция масштабирования предварительного обучения#
Первоначальная формулировка этих правил, известная как законы масштабирования Kaplan, представленная в 2020 году, установила, что производительность языковой модели плавно масштабируется с увеличением вычислительных ресурсов для обучения. Позднее эта концепция была уточнена в законах масштабирования Chinchilla в 2022 году, которые показали, что для оптимального обучения размер модели и объём обучающих данных необходимо масштабировать в равных пропорциях. Например, если удвоить количество параметров модели, необходимо также удвоить количество обучающих токенов. Эта парадигма успешно помогла разработать современные большие языковые модели (LLMs), созданные с использованием таких фреймворков, как PyTorch и TensorFlow, обеспечивая эффективное использование огромных кластеров GPU без риска переобучения и лишних вычислительных затрат.
Смена парадигмы: масштабирование вычислений во время тестирования#
В период с 2024 по 2025 год, как отмечалось в ежегодных отчётах о прогрессе в области ИИ, индустрия ИИ пережила масштабный переход к масштабированию во время инференса. Когда предварительное обучение всё более крупных моделей начало сталкиваться с убывающей отдачей и ограничениями доступности данных, исследователи обнаружили, как напрямую масштабировать вычисления LLM во время тестирования. Предоставляя моделям больше вычислительных ресурсов во время инференса, можно значительно улучшить их способности к сложным рассуждениям.
Такие методы, как «цепочка рассуждений» (CoT) и выборка Best-of-N, позволяют моделям исследовать несколько вариантов, прежде чем дать ответ. Этот закон масштабирования во время тестирования, впервые применённый в передовых моделях, таких как OpenAI o1 и DeepSeek-R1, а также в других продвинутых моделях рассуждений, доказывает, что увеличение вычислений на этапе предсказания позволяет гораздо меньшей и высокоэффективной архитектуре превосходить устаревшую массивную модель на строгих логических бенчмарках.
Практические применения#
Принципы масштабирования определяют разработку далеко за пределами генерации текста и существенно влияют на современные конвейеры компьютерного зрения и обнаружения объектов.
- Распределение ресурсов для базовых моделей: Компании, разрабатывающие системы автономного вождения, используют формулы масштабирования, чтобы точно рассчитать, сколько размеченных изображений требуется для снижения уровня ошибок средней точности (mAP) до безопасных значений, пригодных для промышленной эксплуатации. Используя платформу Ultralytics для совместной разметки данных и облачного распределённого обучения, команды могут математически спрогнозировать свои затраты ещё до развёртывания.
- Определение размера модели и развёртывание на периферийных устройствах: Формулы масштабирования напрямую влияют на архитектурный дизайн современных моделей, таких как Ultralytics YOLO26. Благодаря единому семейству моделей, математически масштабируемых от Нано (n) до сверхбольшого размера (x), разработчики могут предсказуемо находить компромисс между строгими требованиями к точности и задержкой инференса с учётом ограничений конкретного периферийного оборудования.
Пример кода: масштабирование во время инференса в компьютерном зрении#
В компьютерном зрении можно использовать практическую форму масштабирования во время тестирования, называемую аугментацией во время тестирования (TTA). Дополнительные вычисления на этапе предсказания позволяют оценить несколько аугментированных версий изображения, благодаря чему модель предсказуемо повышает уверенность обнаружения, воспроизводя методы поиска рассуждений, применяемые в продвинутых LLM.
from ultralytics import YOLO
# Load the recommended YOLO26 model (nano version for high speed)
model = YOLO("yolo26n.pt")
# Perform standard inference (faster, lower test-time compute)
results_standard = model("https://ultralytics.com/images/bus.jpg")
# Perform inference-time scaling via Test-Time Augmentation (TTA)
# Predictably improves accuracy by utilizing more compute during prediction
results_tta = model("https://ultralytics.com/images/bus.jpg", augment=True)
print(f"Standard detections: {len(results_standard[0].boxes)}")
print(f"Scaled TTA detections: {len(results_tta[0].boxes)}")Законы масштабирования и связанные концепции#
Хотя правила масштабирования ИИ тесно связаны с возможностями оборудования, они измеряют именно эффективность программного обеспечения и алгоритмов относительно этого оборудования.
- Законы масштабирования и закон Мура: Закон Мура — это давнее наблюдение в области аппаратного обеспечения, согласно которому количество транзисторов на микросхеме примерно удваивается каждые два года. В отличие от него, масштабирование ИИ математически отслеживает, как фактические возможности модели улучшаются при доступе к расширяющемуся набору аппаратных ресурсов.
- Масштабирование обучения и масштабирование инференса: Формулы обучения рассчитывают наиболее оптимальное с точки зрения вычислений сочетание параметров и данных во время первоначального создания модели. Масштабирование инференса, напротив, измеряет, как динамическое использование дополнительных вычислительных ресурсов для поиска и проверки непосредственно перед генерацией результата улучшает итоговый ответ без необходимости повторного обучения.






