Исследуем детекцию небольших объектов с помощью Ultralytics YOLO11
Узнай, как Ultralytics YOLO11 обеспечивает быструю и точную детекцию небольших объектов в реальных приложениях, например в системах наблюдения и робототехнике.

Дроны, оснащённые системами компьютерного зрения на базе ИИ, могут летать на высоте сотен метров над землёй, но при этом от них ожидают обнаружения человека, который занимает всего несколько пикселей в видеопотоке. На деле это распространённая задача в таких сферах, как робототехника, наблюдение и дистанционное зондирование, где системам необходимо находить очень маленькие объекты на изображении.
Однако традиционным моделям обнаружения объектов это может даваться с трудом. Маленькие объекты на изображениях и видео содержат очень мало визуальной информации. Проще говоря, когда модель смотрит на них, ей доступно не так много деталей для обучения и распознавания.
В основе такие модели обычно используют архитектуру на базе свёрточной нейронной сети (CNN). Изображения проходят через слои сети и преобразуются в карты признаков — упрощённые представления, выделяющие важные закономерности вместо исходных пикселей.
По мере прохождения изображения вглубь сети карты признаков становятся меньше. Это ускоряет вычисления, но также означает, что мелкие детали могут исчезать.
Для крошечных объектов эти детали критически важны. После их исчезновения модели компьютерного зрения может быть трудно обнаружить объект, что приводит к менее точным или нестабильным ограничивающим рамкам.
Системы компьютерного зрения реального времени с обработкой от начала до конца усложняют задачу ещё сильнее. Изображения высокого разрешения помогают сохранить детали, но замедляют инференс и требуют большей мощности GPU. Более низкое разрешение ускоряет работу, однако обнаруживать маленькие объекты становится ещё сложнее.
Постоянно приходится искать баланс между скоростью, точностью и ограничениями оборудования. Благодаря последним технологическим достижениям модели компьютерного зрения, такие как Ultralytics YOLO11 и готовящаяся к выпуску Ultralytics YOLO26, эффективнее справляются с этим компромиссом.

Рис. 1. Использование YOLO11 для обнаружения малых объектов на аэрофотоснимках (источник)
В этой статье мы разберём, почему обнаружение малых объектов — сложная задача и как Ultralytics YOLO11 может её упростить. Давайте начнём!
Что такое обнаружение малых объектов и почему оно важно?#
Обнаружение малых объектов — это задача компьютерного зрения, области ИИ, посвящённая выявлению и определению местоположения объектов, занимающих очень небольшую часть изображения. На изображении такие объекты часто представлены ограниченным числом пикселей — наименьших элементов цифрового изображения. Поэтому обнаруживать их сложнее, чем более крупные и чёткие цели, которые обычно содержат больше пикселей.
Например, автомобили на аэрофотоснимках, инструменты на заводском этаже или люди, снятые широкоугольными камерами наблюдения, могут выглядеть на изображении как маленькие объекты. Их обнаружение важно, поскольку они часто содержат критически важную информацию, а многие реальные приложения, например системы наблюдения, зависят от этих данных для корректной работы.
Пропуск малых объектов может повлиять на производительность системы и принятие решений. Хороший пример — мониторинг с использованием беспилотных летательных аппаратов (UAV), где пропуск небольшого движущегося объекта на земле может снизить точность навигации или отслеживания.
Проблемы, связанные с обнаружением малых объектов#
Ранние системы использовали созданные вручную признаки и традиционные методы компьютерного зрения, которым было трудно работать в сложных или разнообразных сценах. Даже сегодня, когда модели глубокого обучения показывают гораздо лучшие результаты, обнаружение малых целей остаётся сложным, если они занимают лишь крошечную часть изображения.
Далее рассмотрим некоторые распространённые проблемы, возникающие в разных реальных сценариях при обнаружении малых объектов.
Размер, пиксели и потеря информации#
Маленькие объекты содержат очень мало пикселей, что ограничивает объём визуальных деталей, которые модель может изучить на таких этапах, как извлечение признаков. В результате закономерности вроде контуров, форм и текстур распознаются сложнее, а маленькие объекты с большей вероятностью сливаются с фоном.
По мере прохождения изображений через свёрточные слои нейронной сети визуальная информация в пикселях постепенно сжимается в карты признаков. Это помогает модели сохранять эффективность, но также означает, что мелкие детали постепенно исчезают.

Рис. 2. Карты признаков представляют визуальные закономерности на изображении (источник)
Для малых целей важные признаки могут исчезнуть ещё до того, как сеть обнаружения успеет их обработать. В таком случае локализация становится менее надёжной, а ограничивающие рамки могут смещаться, перекрываться или полностью пропускать целевые объекты.
Перекрытие, вариативность масштаба и контекст#
Проблемы, связанные с размером, часто усугубляются перекрытием. Перекрытие возникает, когда объекты, особенно небольшие, частично скрыты другими объектами в сцене.
Это уменьшает видимую область цели и ограничивает информацию, доступную детектору объектов. Даже небольшое перекрытие может запутать сети обнаружения, особенно в сочетании с входными данными низкого разрешения. Интересный пример можно увидеть в наборах данных UAV, таких как VisDrone, где пешеходы, велосипеды или автомобили могут быть частично закрыты зданиями, деревьями или другими движущимися объектами.

Рис. 3. Пример малых объектов из набора данных VisDrone (источник)
Аналогично, вариативность масштаба создаёт ещё одну сложность: один и тот же объект может выглядеть очень маленьким или относительно крупным в зависимости от расстояния и положения камеры. Несмотря на эти препятствия, алгоритмы обнаружения должны распознавать малые объекты в разных масштабах без потери точности.
Контекст также играет важную роль в обнаружении. Например, крупные объекты обычно находятся в окружении с чёткими границами, которое предоставляет полезные визуальные признаки. Малые цели, напротив, часто лишены такой контекстной информации, что усложняет распознавание закономерностей.
Скрытая проблема метрик при обнаружении малых объектов#
Распространённые метрики оценки, такие как пересечение над объединением (IoU), измеряют, насколько хорошо предсказанная ограничивающая рамка перекрывается с эталонной рамкой. Хотя IoU хорошо работает для крупных объектов, для маленьких объектов эта метрика ведёт себя совсем иначе.
Маленькие объекты занимают всего несколько пикселей, поэтому даже небольшое смещение предсказанной рамки может привести к большой относительной ошибке и резко снизить значение IoU. Поэтому малые объекты часто не достигают стандартного порога IoU, используемого для признания предсказания правильным, даже когда объект виден на изображении.
В результате ошибки локализации с большей вероятностью классифицируются как ложноположительные или ложноотрицательные срабатывания. Эти ограничения побудили исследователей пересмотреть способы оценки и обработки небольших, трудно обнаруживаемых целей в системах обнаружения объектов.
Многоуровневые признаки: ключ к обнаружению малых объектов в реальном времени#
По мере работы над улучшением обнаружения малых объектов стало ясно, что сохранение и представление визуальной информации в нескольких масштабах имеет решающее значение. Эта идея находит отражение в последних исследованиях на arXiv и статьях, представленных на таких площадках, как международные конференции IEEE и Европейская ассоциация компьютерного зрения (ECCV).
По мере прохождения изображений вглубь нейронной сети малые объекты могут терять детали или исчезать полностью, поэтому современные модели компьютерного зрения, такие как Ultralytics YOLO11, уделяют особое внимание улучшенному извлечению признаков. Далее разберём основные идеи карт признаков и пирамидальных сетей признаков, чтобы лучше их понять.
Карты признаков и представление масштаба#
Когда входное изображение, например изображение дистанционного зондирования, поступает в нейронную сеть, оно постепенно преобразуется в карты признаков. Это упрощённые представления изображения, выделяющие визуальные закономерности, такие как контуры, формы и текстуры.
По мере углубления сети карты признаков становятся меньше по пространственному размеру. Это помогает модели работать эффективно и сосредоточиться на информации высокого уровня. Однако уменьшение размера и углубление карт признаков также сокращают пространственную детализацию.

Рис. 4. Извлечение признаков — ключ к обнаружению малых объектов. (источник)
Крупные объекты сохраняют достаточно визуальной информации для точного обнаружения, тогда как малые цели могут потерять важные детали уже после прохождения нескольких слоёв сети. В таком случае модели может быть трудно понять, что маленький объект вообще существует. Это одна из главных причин, по которым малые объекты пропускаются глубокими моделями обнаружения объектов.
Пирамидальные сети признаков и обучение в нескольких масштабах#
Пирамидальные сети признаков, часто называемые FPN, были созданы для решения проблемы потери пространственной детализации. Они работают как вспомогательный модуль, объединяющий информацию из нескольких слоёв, чтобы модели эффективнее обнаруживали малые объекты. Этот процесс также называют агрегацией и слиянием признаков.
Мелкие слои предоставляют точные пространственные детали, а более глубокие добавляют семантический контекст, обеспечивая эффективное обучение признаков в нескольких масштабах. В отличие от наивного апсемплинга, который просто увеличивает карты признаков, FPN сохраняет значимую информацию и улучшает обнаружение малых объектов.
Современные подходы развивают эту идею, используя адаптивное слияние признаков и контекстно-зависимые архитектуры для дальнейшего улучшения обнаружения малых целей. Иными словами, FPN помогает моделям одновременно видеть общую картину и мельчайшие детали. Такая оптимизация необходима, когда объекты имеют небольшой размер.
Как развивались модели обнаружения объектов для работы с малыми объектами#
Ниже кратко показано, как со временем развивались и совершенствовались модели обнаружения объектов, чтобы лучше находить объекты разных размеров, включая очень маленькие:
- Ранние методы обнаружения: Ранние подходы к обнаружению объектов основывались на вручную спроектированных признаках и алгоритмах на основе правил, берущих начало в классической обработке изображений. Поскольку эти признаки были фиксированными, производительность снижалась на разных изображениях.
- Появление машинного и глубокого обучения: Внедрение машинного и глубокого обучения стало значительным поворотом в исследованиях по обнаружению объектов. Вместо заранее заданных правил нейронные сети начали изучать визуальные представления непосредственно из обучающих данных, что повысило адаптивность к разным размерам объектов и сценам.
- Свёрточные сети: Эти нейронные сети учатся распознавать закономерности на изображениях. Каждый слой выявляет разные детали: начиная с простых контуров и цветов, затем форм и в конечном итоге целых объектов, что делает их важной основой современного компьютерного зрения.
- Двухэтапные детекторы объектов: Двухэтапные детекторы, такие как Faster R-CNN, представленные Girshick и Ren, сначала генерировали области-кандидаты, а затем классифицировали их. Этот подход повысил точность для малых объектов, но увеличил вычислительные затраты и снизил производительность в реальном времени.
- Одноэтапные детекторы объектов: Одноэтапные детекторы, такие как SSD (однокадровый детектор) и семейство YOLO (один взгляд — один проход), включая YOLOv3, Ultralytics YOLOv5 и более позднюю Ultralytics YOLOv8, выполняют обнаружение за один проход. Такая архитектура значительно повышает скорость инференса, сохраняя конкурентоспособную точность.
- Современные модели передового уровня: Более новые модели обнаружения объектов уделяют больше внимания производительности в реальном времени и развёртыванию на периферийных устройствах. Последние версии моделей Ultralytics YOLO, например Ultralytics YOLO11 и готовящаяся к выпуску Ultralytics YOLO26, предназначены для сочетания высокой точности с инференсом с малой задержкой, что делает их подходящими для обнаружения объектов любых размеров, включая малые цели, на устройствах с ограниченными вычислительными ресурсами.
Использование Ultralytics YOLO11 для обнаружения малых объектов#
Теперь, когда мы лучше понимаем принцип работы обнаружения малых объектов, рассмотрим несколько реальных приложений, в которых можно использовать Ultralytics YOLO11.
БПЛА и аэрофотосъёмка#
Представь дрон, летящий высоко над оживлённой городской улицей. С такой высоты автомобили, велосипеды и даже люди превращаются на экране всего в несколько пикселей.
Модули для БПЛА и аэрофотосъёмки часто захватывают подобные сцены, где интересующие объекты очень малы и окружены загромождённым фоном, из-за чего моделям компьютерного зрения сложно их обнаруживать.
В таких сценариях Ultralytics YOLO11 может стать идеальным выбором модели. Например, дрон с моделью YOLO11 может в реальном времени следить за дорожным движением, обнаруживая автомобили, велосипедистов и пешеходов по мере их перемещения в сцене, даже если каждый объект занимает лишь небольшую часть изображения. Это обеспечивает более быстрое принятие решений и более точные выводы в таких приложениях, как управление дорожным движением, общественная безопасность и городское планирование.
Робототехника и автоматизация#
Роботов часто используют в средах, где критически важны точность и своевременность. На складах, заводах и фермах роботу может потребоваться распознать очень маленький объект — например, деталь на сборочной линии, этикетку на упаковке или небольшой росток растения в поле — и быстро отреагировать.
Обнаружение объектов такого размера может быть сложным, особенно если в видеопотоке с камеры они занимают всего несколько пикселей или частично перекрыты другими объектами. Пропуск таких мелких деталей может замедлить автоматизацию или помешать роботу выполнить задачу.
Ultralytics YOLO11 может существенно изменить ситуацию в таких случаях. Улучшенное извлечение признаков и быстрый инференс позволяют роботам обнаруживать малые объекты в реальном времени и немедленно предпринимать действия.
Ultralytics YOLO11 также поддерживает сегментацию экземпляров, которая помогает роботам точнее определять границы объектов и точки захвата, а не только находить общие ограничивающие рамки. Например, роботизированная рука с интегрированным YOLO11 может обнаружить небольшие компоненты на конвейере, выделить их точную форму и захватить до того, как они выйдут из зоны досягаемости, помогая системе сохранять эффективность и надёжность.
Что делает Ultralytics YOLO11 эффективной для обнаружения малых объектов#
Сегодня доступно так много моделей компьютерного зрения, что ты можешь задуматься, чем Ultralytics YOLO11 выделяется среди них.
Вот несколько причин, по которым Ultralytics YOLO11 — отличный вариант для приложений, где необходимо обнаруживать малые объекты:
- Улучшенное извлечение признаков: YOLO11 использует улучшенную архитектуру backbone и neck для повышения качества извлечения признаков, обеспечивая более точное обнаружение объектов.
- Экосистема и простота использования: Пакет Ultralytics для Python — это библиотека со встроенными функциями для загрузки, обучения, валидации и развёртывания таких моделей, как YOLO11. Поскольку для этих рабочих процессов требуется всего несколько строк кода, команды могут быстро экспериментировать с моделями обнаружения малых объектов и выполнять их тонкую настройку.
- Оптимизация для периферийного развёртывания: Ultralytics YOLO11 эффективно работает на периферийных устройствах, таких как NVIDIA Jetson, Raspberry Pi и промышленные камерные системы. Проще говоря, модель позволяет выполнять задачи компьютерного зрения на базе ИИ в реальном времени непосредственно на устройстве.
Практические стратегии обнаружения малых объектов с помощью Ultralytics YOLO11#
Помимо выбора такой модели, как Ultralytics YOLO11, существенное влияние на эффективность обнаружения могут оказать подготовка аннотаций, общий состав набора данных и процедура обучения модели.
Кратко рассмотрим, на чём стоит сосредоточиться:
- Корректная аугментация данных: Умеренная аугментация данных, например масштабирование или обрезка, может помочь модели обобщать данные на новые изображения. Однако агрессивная крупномасштабная аугментация может исказить или удалить малые объекты, из-за чего модели будет сложнее их изучать.
- Анализ случаев ошибок: Анализ ситуаций, в которых модель пропускает или неправильно распознаёт объекты, помогает создать базовую линию и понять, вызваны ли проблемы набором данных, потерей информации при извлечении признаков или необходимостью скорректировать параметры обучения.
- Состав набора данных: Твой набор данных должен содержать достаточно примеров малых объектов, чтобы модель могла изучать значимые закономерности, и оставаться сбалансированным, чтобы крупные объекты не затмевали малые во время обучения.
Основные выводы#
Обнаружение малых объектов сложно, потому что небольшие цели теряют детали по мере прохождения изображений через модель компьютерного зрения. Ultralytics YOLO11 улучшает сохранение этих деталей, делая обнаружение малых объектов более надёжным без ущерба для производительности в реальном времени. Благодаря такому балансу YOLO11 обеспечивает точное и эффективное обнаружение в реальных приложениях.
Присоединяйся к нашему растущему сообществу! Посети наш репозиторий на GitHub, чтобы узнать больше об искусственном интеллекте. Узнай об инновациях, таких как компьютерное зрение в розничной торговле и искусственный интеллект в автомобильной отрасли, на наших страницах решений. Чтобы уже сегодня начать создавать решения на основе компьютерного зрения, ознакомься с нашими вариантами лицензирования.









