Почему Ultralytics YOLO26 отказывается от NMS и как это меняет развёртывание
Узнай, как Ultralytics YOLO26 обеспечивает настоящий сквозной инференс без NMS и почему удаление постобработки упрощает экспорт и развёртывание на периферийных устройствах.

14 января мы выпустили Ultralytics YOLO26 — новое поколение наших моделей компьютерного зрения. При создании YOLO26 нашей целью было не просто повысить точность или скорость, а переосмыслить принципы построения и развёртывания моделей обнаружения объектов в реальных системах.
По мере того как компьютерное зрение переходит из исследовательской сферы в промышленную эксплуатацию, от моделей всё чаще ожидают работы на CPU, периферийных устройствах, камерах, роботах и встраиваемом оборудовании. В таких средах надёжность, низкая задержка и простота развёртывания важны не меньше производительности.
Ultralytics YOLO26 разработана с учётом этой реальности: в ней используется оптимизированная сквозная архитектура, устраняющая ненужную сложность из конвейера инференса. Одно из важнейших нововведений YOLO26 — удаление подавления немаксимумов, обычно называемого NMS.
Много лет NMS была стандартной частью систем обнаружения объектов и использовалась на этапе постобработки для устранения дублирующихся обнаружений. Хотя этот метод эффективен, он также добавлял вычислительные затраты и усложнял развёртывание, особенно на периферийном оборудовании.
В YOLO26 мы выбрали другой подход. Переосмыслив процесс генерации и обучения предсказаний, мы обеспечили настоящий сквозной инференс без NMS. Модель напрямую выдаёт итоговые обнаружения, не полагаясь на внешние этапы очистки или заданные вручную правила. Это делает YOLO26 быстрее, упрощает экспорт и повышает надёжность развёртывания на широком спектре аппаратных платформ.

Рис. 1. Обнаружение объектов на изображении с использованием Ultralytics YOLO26.
В этой статье мы подробнее рассмотрим, почему традиционные системы обнаружения объектов использовали NMS, как этот метод стал узким местом при развёртывании и как Ultralytics YOLO26 устраняет необходимость в обходных решениях. Начнём!
Традиционное обнаружение объектов порождает дублирующиеся обнаружения#
Прежде чем перейти к тому, что такое NMS и почему мы удалили этот метод из Ultralytics YOLO26, давай сначала разберёмся, как традиционные модели обнаружения объектов формируют свои предсказания.
Традиционные модели обнаружения объектов часто создают несколько перекрывающихся ограничивающих рамок для одного и того же объекта. Каждая такая рамка имеет собственную оценку уверенности, хотя все они относятся к одному объекту на изображении.
Это происходит по нескольким причинам. Во-первых, модель одновременно делает предсказания во множестве пространственных точек и на разных масштабах. Это помогает обнаруживать объекты разного размера, но также означает, что соседние точки могут независимо определить один и тот же объект.
Во-вторых, во многих системах обнаружения объектов используются якорные подходы, которые генерируют большое количество рамок-кандидатов вокруг каждой точки. Хотя это повышает вероятность точного обнаружения объектов, одновременно увеличивается и число перекрывающихся предсказаний.
Наконец, сама сеточная схема обнаружения естественным образом приводит к избыточности. Если объект находится рядом с границей нескольких ячеек сетки, несколько ячеек могут предсказать рамку для этого объекта, что приводит к множественным перекрывающимся обнаружениям.
Поэтому необработанный выход модели часто содержит несколько рамок для одного объекта. Чтобы результаты можно было использовать, эти избыточные предсказания нужно отфильтровать, оставив только одно итоговое обнаружение.
Разбираемся в подавлении немаксимумов#
После того как модель обнаружения объектов создаёт несколько перекрывающихся ограничивающих рамок для одного объекта, результаты нужно очистить перед использованием. Именно здесь применяется подавление немаксимумов.
Подавление немаксимумов — это этап постобработки, который выполняется после того, как модель завершила формирование предсказаний. Его задача — уменьшить число дублирующихся обнаружений, чтобы каждый объект был представлен одной итоговой ограничивающей рамкой.

Рис. 2. Обзор NMS. Изображение автора.
Процесс работает за счёт сравнения ограничивающих рамок по оценкам уверенности и степени их перекрытия. Сначала удаляются предсказания с очень низкой уверенностью.
Затем оставшиеся рамки сортируются по уверенности, и рамка с наивысшей оценкой выбирается как лучшее обнаружение. Выбранная рамка сравнивается с остальными.
Если другая рамка слишком сильно с ней перекрывается, эта рамка подавляется и удаляется. Перекрытие обычно измеряется с помощью пересечения по объединению — метрики, вычисляющей отношение площади, общей для двух рамок, к общей площади, покрываемой обеими рамками. Процесс повторяется, пока не останутся только наиболее уверенные неперекрывающиеся обнаружения.
Почему NMS усложняет развёртывание#
Хотя подавление немаксимумов помогает фильтровать дублирующиеся обнаружения, оно также создаёт проблемы, которые становятся заметнее при переходе моделей из исследовательской среды в реальную эксплуатацию.
Одна из главных проблем — производительность. NMS выполняется после инференса и требует сравнивать ограничивающие рамки друг с другом, чтобы определить, какие из них оставить.
Этот процесс требует значительных вычислений, и его трудно эффективно распараллелить. На периферийных устройствах и системах на базе CPU дополнительные вычисления могут заметно увеличить задержку, из-за чего становится сложнее соответствовать требованиям реального времени.
NMS также усложняет развёртывание. Поскольку этот метод не является частью самой модели, его приходится отдельно реализовывать в коде постобработки.
Разные среды выполнения и платформы обрабатывают NMS по-разному, поэтому для каждой целевой среды часто приходится поддерживать собственные реализации. То, что работает в одной конфигурации, может немного иначе вести себя в другой, из-за чего развёртывание становится менее надёжным и сложнее масштабируется.
Ещё одна проблема — оптимизация под оборудование. NMS плохо подходит для специализированных AI-ускорителей, предназначенных для эффективного выполнения операций нейронных сетей. В результате даже при быстрой работе модели на оптимизированном оборудовании NMS может стать узким местом, ограничивающим общую производительность.
Кроме того, NMS использует параметры, выбранные вручную, например пороги уверенности и перекрытия. Эти настройки могут существенно влиять на результаты и часто требуют подбора для разных наборов данных, приложений или аппаратных платформ. Из-за этого поведение в промышленных системах становится менее предсказуемым, а конфигурация — сложнее.
Объяснение сквозного инференса для обнаружения объектов#
Ограничения подавления немаксимумов заставили нас переосмыслить поведение моделей обнаружения объектов во время инференса. Вместо генерации множества перекрывающихся предсказаний и их последующей очистки мы задали более фундаментальный вопрос.
Что, если модель сможет напрямую выдавать итоговые обнаружения? Этот вопрос лежит в основе сквозного инференса для обнаружения объектов. В сквозной системе модель обучается обрабатывать весь процесс обнаружения от начала до конца, не полагаясь на внешние этапы очистки.
Вместо генерации множества рамок-кандидатов и их фильтрации после инференса модель самостоятельно учится создавать небольшой набор уверенных неперекрывающихся предсказаний. Дублирующиеся обнаружения устраняются внутри сети, а не удаляются на этапе постобработки.
Более новые архитектуры моделей показали, что этот подход возможен и практичен. При правильной стратегии обучения модели могут научиться связывать каждый объект с одним предсказанием вместо множества конкурирующих, устраняя избыточность в самом источнике.

Рис. 3. Пример обнаружения объектов с использованием Ultralytics YOLO26.
Для этого необходимо изменить и процесс обучения. Вместо того чтобы позволять множеству предсказаний конкурировать за один объект, модель учится принимать одно чёткое решение, формируя меньшее количество более уверенных обнаружений.
В итоге получается более простой конвейер инференса. Поскольку дубликаты уже устранены внутри модели, подавление немаксимумов во время инференса не требуется. Выход модели уже является итоговым набором обнаружений.
Такая сквозная архитектура также упрощает развёртывание. Без этапов постобработки и специфичных для платформы реализаций NMS экспортированная модель полностью автономна и одинаково ведёт себя в разных фреймворках инференса и на разных целевых аппаратных платформах.
Как объясняет наш ведущий инженер по партнёрским решениям Francesco Mattioli, «Настоящее сквозное обучение означает, что модель должна обрабатывать всё — от пикселей до предсказаний, — без заданных вручную этапов постобработки, которые нарушают дифференцируемость и усложняют развёртывание».
Как Ultralytics YOLO26 удаляет NMS#
Ultralytics YOLO26 удаляет подавление немаксимумов, изменяя способ обучения и формирования обнаружений вместо использования постобработки для их очистки. Вместо того чтобы позволять множеству предсказаний конкурировать за один объект, YOLO26 обучается устанавливать однозначное соответствие между объектами и выходными данными.
Отчасти это обеспечивается обнаружением на основе обучаемых запросов, которое помогает модели формировать одно уверенное предсказание для каждого объекта, а не множество перекрывающихся кандидатов. Каждый объект связывается с одним предсказанием, что естественным образом уменьшает число дублирующихся обнаружений.
Такое поведение закрепляется согласованными стратегиями сопоставления во время обучения: модель учится принимать одно уверенное решение для каждого объекта, а не генерировать перекрывающиеся предсказания. В итоге модель создаёт меньше предсказаний, но каждое из них является итоговым обнаружением.
Почему удаление DFL сделало обнаружение без NMS возможным#
Ещё одно важное нововведение, обеспечивающее инференс без NMS в Ultralytics YOLO26, — удаление Distribution Focal Loss, или DFL. В более ранних моделях YOLO DFL использовалась для повышения точности регрессии ограничивающих рамок: вместо одного значения предсказывалось распределение возможных положений рамки.
Хотя этот подход повышал точность локализации, он также усложнял конвейер обнаружения. Эта сложность стала ограничением при переходе к настоящему сквозному инференсу.
DFL добавляла дополнительные вычисления и фиксированные диапазоны регрессии, из-за чего модели было сложнее обучаться однозначно сопоставлять объекты и увеличивалась зависимость от этапов постобработки, таких как подавление немаксимумов. В Ultralytics YOLO26 мы удалили DFL и переработали регрессию ограничивающих рамок, сделав её проще и прямее.
Вместо зависимости от выходных данных на основе распределений модель учится предсказывать точные координаты рамок таким образом, чтобы формировать меньшее количество более уверенных обнаружений. Это изменение помогает устранить перекрывающиеся предсказания в самом источнике и согласует регрессию ограничивающих рамок со сквозной архитектурой Ultralytics YOLO26 без NMS.
Ultralytics YOLO26 не использует NMS и легко развёртывается#
Архитектура без NMS делает Ultralytics YOLO26 по-настоящему сквозной моделью. Это существенно влияет на экспорт моделей.
Экспорт означает преобразование обученной модели в формат, который может выполняться за пределами среды обучения, например ONNX, TensorRT, CoreML или OpenVINO. В традиционных конвейерах этот процесс часто даёт сбой, поскольку подавление немаксимумов не является частью самой модели.
Удаляя NMS, Ultralytics YOLO26 полностью избегает этой проблемы. Экспортированная модель уже содержит всё необходимое для формирования итоговых обнаружений.
Благодаря этому экспортированная модель полностью автономна и лучше переносится между фреймворками инференса и целевыми аппаратными платформами. Одна и та же модель ведёт себя одинаково при развёртывании на серверах, системах только с CPU, встраиваемых устройствах или периферийных ускорителях. Развёртывание становится проще, поскольку экспортируется именно то, что затем запускается.
Такая простота особенно важна для периферийных приложений. Например, YOLO26 можно легко развернуть на таких устройствах, как дроны, для задач мониторинга посевов, обследования полей и анализа состояния растений, где ограниченные вычислительные ресурсы и энергобюджет делают сложные конвейеры постобработки непрактичными. Поскольку модель напрямую выдаёт итоговые обнаружения, она надёжно работает на лёгком оборудовании без дополнительных этапов обработки.

Рис. 4. Ultralytics YOLO26 легко развёртывается на периферийных устройствах, таких как дроны.
Короче говоря, инференс без NMS устраняет сложности при экспорте и развёртывании и позволяет создавать более чистые и надёжные системы компьютерного зрения. NMS была обходным решением. Ultralytics YOLO26 больше не нуждается в обходных решениях.
Основные выводы#
Ultralytics YOLO26 удаляет подавление немаксимумов, решая исходную проблему дублирующихся обнаружений, а не устраняя их постфактум. Благодаря сквозной архитектуре модель может напрямую формировать итоговые обнаружения, упрощая экспорт и обеспечивая более согласованную работу на разном оборудовании. NMS была полезным обходным решением для более ранних систем, но YOLO26 больше в ней не нуждается.
Присоединяйся к нашему сообществу и загляни в наш репозиторий GitHub, чтобы узнать больше об AI. Изучи наши страницы решений о AI в сельском хозяйстве и компьютерном зрении в розничной торговле. Ознакомься с нашими вариантами лицензирования и начни использовать AI для компьютерного зрения уже сегодня!






