YOLO Vision 2026:
Ultralytics YOLO

Как Ultralytics YOLO26 обучается умнее с помощью ProgLoss, STAL и MuSGD

Узнай, как Ultralytics YOLO26 обучается более надежно с помощью ProgLoss, STAL и оптимизатора MuSGD.

ABAbirami Vina5 min read
Инновации в обучении Ultralytics YOLO26: ProgLoss, STAL и MuSGD

На прошлой неделе мы выпустили Ultralytics YOLO26, установив новый стандарт для периферийных моделей компьютерного зрения реального времени. Подобно предыдущим моделям Ultralytics YOLO, таким как Ultralytics YOLO11, YOLO26 поддерживает основные задачи компьютерного зрения, к которым привыкли пользователи, включая детектирование объектов, сегментацию экземпляров и оценку позы.

An example of Ultralytics YOLO26 segmenting objects in an image

Рис. 1. Пример использования Ultralytics YOLO26 для сегментации объектов на изображении.

Однако Ultralytics YOLO26 — это не просто очередное незначительное обновление. Хотя поддерживаемые задачи могут выглядеть знакомо, эта новая модель представляет собой инновационный шаг вперед в том, как обучаются модели computer vision. В YOLO26 фокус смещается с эффективности инференса на повышение стабильности обучения.

Ultralytics YOLO26 создана с учетом полного жизненного цикла обучения. Это означает более быструю сходимость, более надежные запуски обучения и стабильное поведение модели. Эти улучшения особенно важны в реальных рабочих процессах, где надежность обучения напрямую влияет на то, как быстро можно дорабатывать и развертывать модели.

Для этого в Ultralytics YOLO26 внедрен ряд целенаправленных инноваций в области обучения, таких как балансировка прогрессивной функции потерь (ProgLoss), назначение меток с учетом мелких объектов (STAL) и оптимизатор MuSGD. Все эти изменения в совокупности улучшают балансировку потерь обучения, распределение меток и поведение оптимизации во времени.

В этой статье мы разберем, как работает каждый из этих механизмов и почему они делают Ultralytics YOLO26 проще в обучении и надежнее при масштабировании. Давай начнем!

Ultralytics YOLO26: создана для более умного обучения, а не только для ускорения работы#

Ultralytics YOLO26 естественным образом оптимизирует весь конвейер вывода, устраняя зависимость от этапов постобработки, таких как NMS. Вместо создания множества перекрывающихся предсказаний и их последующей фильтрации, YOLO26 выдает финальные результаты обнаружения непосредственно из сети.

Это делает YOLO26 сквозной (end-to-end) моделью, в которой прогнозирование, разрешение дубликатов и итоговые результаты изучаются внутри самой сети. Это упрощает развертывание и повышает эффективность инференса, а также определяет то, как модель обучается в процессе тренировки.

Ultralytics YOLO26 state-of-the-art end-to-end, NMS-free inference

Рис. 2. YOLO26 обеспечивает современный инференс end-to-end без NMS (Источник)

В такой сквозной системе обучение и вывод тесно связаны. Поскольку нет внешнего этапа постобработки для корректировки предсказаний, модель должна учиться принимать четкие и уверенные решения непосредственно во время обучения.

Это делает согласованность между целями обучения и поведением при выводе особенно важной. Любое несоответствие между тем, как модель обучается и как она используется во время вывода, может привести к нестабильному обучению или более медленному схождению.

Ultralytics YOLO26 решает эту задачу, проектируя процесс обучения с учетом реальных сценариев использования с самого начала. Вместо того чтобы фокусироваться только на скорости инференса, система обучения создана для поддержки стабильного обучения на длинных дистанциях, согласованной сходимости для разных размеров моделей от Nano до Extra Large, а также надежной производительности на разнообразных датасетах.

Как две обучающие головы улучшают обучение в Ultralytics YOLO26#

Одна из ключевых инноваций в обучении Ultralytics YOLO26 опирается на подход с двумя обучающими головами, использовавшийся в предыдущих моделях YOLO. В моделях обнаружения объектов «голова» (head) относится к той части сети, которая отвечает за предсказания.

Другими словами, головы обнаружения учатся предсказывать, где в изображении расположены объекты и что это за объекты. Они делают это через регрессию координат ограничивающих рамок (BBox), что означает, что они учатся оценивать положение и размер каждого объекта на входном изображении.

Во время обучения модель учится, минимизируя функцию потерь (loss) — числовую меру того, насколько ее предсказания далеки от правильных ответов (ground truth). Более низкая функция потерь означает, что предсказания модели ближе к истине, а более высокая указывает на большие ошибки. Расчет потерь направляет обновление параметров модели во время обучения.

Ultralytics YOLO26 использует во время обучения две детекционные головы, которые разделяют общую базовую модель, но служат разным целям. Голова «один к одному» — это голова, используемая во время инференса. Она учится сопоставлять каждый объект с единым уверенным предсказанием, что необходимо для сквозного дизайна YOLO26 без использования NMS.

Тем временем голова «один-ко-многим» используется только во время обучения. Она позволяет ассоциировать несколько предсказаний с одним и тем же объектом, обеспечивая более плотный надзор. Этот более богатый обучающий сигнал помогает стабилизировать процесс обучения и улучшить точность, особенно на ранних этапах.

В Ultralytics YOLO26 обе головы используют одинаковый расчет потерь для регрессии баундинг-боксов и классификации. В более ранних реализациях на протяжении всего обучения применялся фиксированный баланс между этими двумя сигналами потерь.

Однако на практике важность каждой головы со временем меняется. Плотный надзор наиболее полезен на ранних этапах, в то время как соответствие поведению инференса становится более важным по мере продвижения обучения. Ultralytics YOLO26 спроектирован с учетом этого понимания, что напрямую определяет то, как он перебалансирует обучающие сигналы по ходу обучения.

Ultralytics YOLO26 использует прогрессивную балансировку потерь (ProgLoss)#

Итак, как Ultralytics YOLO26 справляется с меняющимися потребностями в обучении? Она использует прогрессивную балансировку потерь, чтобы корректировать вес обучающих сигналов с течением времени.

ProgLoss работает за счет динамического изменения того, какой вклад каждая голова вносит в общую функцию потерь по мере прогресса обучения. На ранних этапах больше веса отдается голове «один-ко-многим» для стабилизации обучения и улучшения полноты (recall). По мере продолжения обучения баланс постепенно смещается в сторону головы «один-к-одному», приближая обучение к поведению при выводе.

Этот плавный переход позволяет Ultralytics YOLO26 обучаться в правильном порядке. Вместо того чтобы заставлять модель оптимизировать конкурирующие цели одновременно, прогрессивная балансировка потерь расставляет приоритеты для наиболее полезного сигнала обучения на каждом этапе. В результате достигается более плавная сходимость, меньшее число нестандартных запусков обучения и более стабильная итоговая производительность.

Как STAL помогает Ultralytics YOLO26 учиться на крошечных объектах#

Еще одно интересное улучшение обучения в Ultralytics YOLO26 связано с тем, как модель назначает цели обучения предсказаниям — процесс, известный как назначение меток. Он отвечает за сопоставление реальных объектов с кандидатами-предсказаниями, которые часто называют анкорами (anchors).

Эти сопоставления определяют, какие предсказания получают надзор и вносят вклад в потери. Ultralytics YOLO26 опирается на существующий метод назначения меток под названием Task Alignment Learning (TAL), который был разработан для лучшего согласования классификации и локализации в процессе обучения.

Хотя TAL хорошо работает для большинства объектов, обучение выявило важное ограничение. В процессе сопоставления очень маленькие объекты могли быть полностью проигнорированы. На практике объекты меньше 8 пикселей на 640-пиксельном изображении часто не получали никаких назначений анкоров. Когда это происходит, модель получает мало или вообще не получает надзора для таких объектов, из-за чего ей трудно научиться их обнаруживать.

Чтобы решить эту проблему, Ultralytics YOLO26 представляет метод Small-Target-Aware Label Assignment (STAL). STAL модифицирует процесс назначения меток, чтобы гарантировать, что мелкие объекты не игнорируются во время обучения. В частности, он обеспечивает минимум четыре привязки анкеров для объектов размером менее 8 пикселей. Это гарантирует, что даже крошечные объекты стабильно вносят вклад в потери при обучении.

Усиливая контроль для мелких целей, STAL улучшает стабильность обучения и качество детектирования в сценариях, где мелкие или удаленные объекты встречаются часто. Это улучшение особенно важно для периферийных приложений YOLO26, таких как аэрофотосъемка, робототехника и системы Интернета вещей (IoT), где объекты часто бывают мелкими, удаленными или частично видимыми, а надежное детектирование имеет критическое значение.

Ultralytics YOLO26 представляет оптимизатор MuSGD#

Для поддержки более стабильного и предсказуемого обучения Ultralytics YOLO26 также представляет новый оптимизатор под названием MuSGD. Этот оптимизатор разработан для улучшения схождения и надежности обучения в сквозных моделях обнаружения, особенно по мере увеличения размера модели и сложности обучения.

Чтобы нейронная сеть могла обучаться и, соответственно, менять веса во время тренировки, мы вычисляем ошибку (также называемую «потерями» или loss). Модель оценивает степень ошибочности своих предсказаний с помощью значения функции потерь, вычисляет градиенты, указывающие на необходимость изменения ее параметров, а затем обновляет эти параметры для уменьшения ошибки. Стохастический градиентный спуск (SGD) — это широко используемый оптимизатор, который выполняет такие обновления, делая обучение эффективным и масштабируемым.

Стохастический градиентный спуск против градиентного спуска

Рис. 3. Стохастический градиентный спуск против градиентного спуска (Источник)

MuSGD опирается на этот знакомый фундамент, внедряя идеи оптимизации, вдохновленные Muon — методом, используемым при обучении больших языковых моделей. На эти идеи повлияли недавние достижения, такие как Kimi K2 от Moonshot AI, который продемонстрировал улучшенное поведение при обучении благодаря более структурированным обновлениям параметров.

Ultralytics YOLO26 использует гибридную стратегию обновления. Некоторые параметры обновляются с использованием комбинации обновлений в стиле Muon и SGD, в то время как другие используют только SGD. Это позволяет YOLO26 привнести дополнительную структуру в процесс оптимизации, сохраняя при этом надежность и свойства генерализации, которые сделали SGD эффективным.

Результатом являются более плавная оптимизация, более быстрая сходимость и более предсказуемое поведение обучения для разных размеров моделей, что делает MuSGD ключевой причиной, почему Ultralytics YOLO26 проще обучать и надежнее масштабировать.

Значимость инноваций в обучении Ultralytics YOLO26#

Инновации в обучении Ultralytics YOLO26 в сочетании с ключевыми функциями, такими как сквозная архитектура без NMS и ориентация на edge-устройства, делают модель проще в обучении и надежнее при масштабировании. Возможно, тебе интересно, что это на самом деле означает для приложений компьютерного зрения.

A look at Ultralytics YOLO26's key features

Рис. 4. Обзор ключевых особенностей YOLO26 (Источник)

На практике это значительно упрощает внедрение компьютерного зрения непосредственно туда, где оно будет работать. Модели обучаются более предсказуемо, масштабируются более последовательно по размерам и проще адаптируются к новым наборам данных. Это снижает трения между этапом экспериментов и развертыванием, особенно в средах, где надежность и эффективность важны не меньше, чем чистая производительность.

Например, в robotics и задачах промышленного зрения моделям часто требуется частая переподготовка по мере изменения сред, датчиков или задач. С Ultralytics YOLO26 команды могут итерировать быстрее, не беспокоясь о нестабильных запусках обучения или несогласованном поведении разных размеров моделей.

Основные выводы#

Надежные системы компьютерного зрения зависят как от того, как модели обучаются, так и от их производительности во время инференса. Улучшая балансировку обучающих сигналов, обработку мелких объектов и процесс оптимизации, Ultralytics YOLO26 делает обучение более стабильным и простым в масштабировании. Такой фокус на надежном обучении помогает командам плавнее переходить от экспериментов к развертыванию в реальных условиях, особенно в edge-first приложениях.

Хочешь узнать об искусственном интеллекте? Посети наш репозиторий на GitHub, чтобы узнать больше. Присоединяйся к нашему активному сообществу и узнавай об инновациях в таких сферах, как ИИ в логистике и ИИ для компьютерного зрения в автомобильной промышленности. Чтобы начать работу с компьютерным зрением уже сегодня, ознакомься с нашими вариантами лицензирования.

Explore solutions

Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения