YOLO12: объяснение, реальные применения и варианты использования
Познакомься с YOLO12 — новейшей моделью компьютерного зрения! Узнай, как архитектура, ориентированная на механизмы внимания, и технология FlashAttention повышают эффективность задач обнаружения объектов в различных отраслях.

Компьютерное зрение — это отрасль искусственного интеллекта (AI), которая помогает машинам понимать изображения и видео. Эта область развивается невероятными темпами, поскольку исследователи и разработчики в сфере AI постоянно расширяют границы возможного. Сообщество AI стремится сделать модели более быстрыми, интеллектуальными и эффективными. Один из последних прорывов — YOLO12, новейшее дополнение к серии моделей YOLO («увидеть с первого взгляда»), выпущенное 18 февраля 2025 года.
YOLO12 разработали исследователи из Университета Буффало при SUNY (Государственный университет штата Нью-Йорк) и Университета Китайской академии наук. В рамках уникального нового подхода YOLO12 внедряет механизмы внимания, позволяя модели сосредоточиться на наиболее важных частях изображения, а не обрабатывать всё одинаково.
В модели также используется FlashAttention — технология, которая ускоряет обработку и одновременно снижает потребление памяти, а также механизм внимания к областям, призванный имитировать естественную способность человека фокусироваться на центральных объектах.
Эти улучшения делают YOLO12n на 2,1% точнее YOLOv10n, а YOLO12m — на 1,0% точнее YOLO11m. Однако это приводит к компромиссу: YOLO12n работает на 9% медленнее YOLOv10n, а YOLO12m — на 3% медленнее YOLO11m.

Рис. 1. Пример использования YOLO12 для обнаружения объектов.
В этой статье мы рассмотрим, чем YOLO12 отличается от предыдущих версий, как он с ними сравнивается и где его можно применять.
Путь к выпуску YOLO12#
Серия моделей YOLO — это набор моделей компьютерного зрения, предназначенных для обнаружения объектов в реальном времени, то есть они могут быстро определять объекты на изображениях и видео и находить их расположение. Со временем каждая версия становилась быстрее, точнее и эффективнее.
Например, Ultralytics YOLOv5, выпущенный в 2020 году, получил широкое распространение благодаря высокой скорости и простоте дообучения и развертывания. Позднее Ultralytics YOLOv8 развил эти возможности, добавив поддержку таких задач компьютерного зрения, как сегментация экземпляров и отслеживание объектов.
В последнее время Ultralytics YOLO11 был ориентирован на улучшение обработки в реальном времени при сохранении баланса между скоростью и точностью. Например, YOLO11m имел на 22% меньше параметров, чем YOLOv8m, но при этом обеспечивал более высокое качество обнаружения на датасете COCO — широко используемом эталоне для оценки моделей обнаружения объектов.
Развивая эти достижения, YOLO12 меняет подход к обработке визуальной информации. Вместо того чтобы одинаково обрабатывать все части изображения, модель отдает приоритет наиболее значимым областям, повышая точность обнаружения. Проще говоря, YOLO12 развивает предыдущие улучшения и стремится стать точнее.
Ключевые особенности YOLO12#
YOLO12 включает несколько улучшений, повышающих эффективность задач компьютерного зрения при сохранении скорости обработки в реальном времени. Ниже представлен обзор ключевых особенностей YOLO12:
- Архитектура, ориентированная на внимание: вместо одинаковой обработки каждой части изображения YOLO12 фокусируется на наиболее важных областях. Это повышает точность и сокращает ненужные вычисления, делая обнаружение более четким и эффективным даже на загроможденных изображениях.
- FlashAttention: YOLO12 ускоряет анализ изображений и одновременно использует меньше памяти. FlashAttention (алгоритм с эффективным использованием памяти) оптимизирует обработку данных, снижает нагрузку на оборудование и делает задачи реального времени более плавными и надежными.
- Сети эффективной агрегации слоев с остаточными связями (R-ELAN): YOLO12 эффективнее организует свои слои с помощью R-ELAN, улучшая обработку данных и обучение модели. Благодаря этому обучение становится стабильнее, распознавание объектов — точнее, а требования к вычислительным ресурсам — ниже, поэтому модель эффективно работает в разных средах.
Чтобы понять, как эти возможности работают в реальных условиях, рассмотрим торговый центр. YOLO12 может помогать отслеживать посетителей, распознавать элементы оформления магазинов, например комнатные растения или рекламные вывески, а также обнаруживать оставленные не на месте или брошенные предметы.
Архитектура, ориентированная на внимание, помогает модели сосредоточиться на наиболее важных деталях, а FlashAttention обеспечивает быструю обработку без перегрузки системы. Это упрощает для операторов торгового центра повышение безопасности, организацию планировки магазинов и улучшение общего качества обслуживания посетителей.

Рис. 2. Обнаружение объектов в торговом центре с помощью YOLO12.
Однако у YOLO12 есть и некоторые ограничения, которые следует учитывать:
- Более длительное обучение: из-за особенностей архитектуры YOLO12 требует больше времени на обучение по сравнению с Ultralytics YOLO11.
- Сложности с экспортом: у некоторых пользователей могут возникнуть трудности при экспорте моделей YOLO12, особенно при интеграции с определенными средами развертывания.
Понимание результатов тестов производительности YOLO12#
YOLO12 выпускается в нескольких вариантах, каждый из которых оптимизирован под разные задачи. Меньшие версии (nano и small) ориентированы на скорость и эффективность, поэтому идеально подходят для мобильных устройств и периферийных вычислений. Версии medium и large обеспечивают баланс между скоростью и точностью, а YOLO12x (extra large) предназначен для приложений, требующих высокой точности, например промышленной автоматизации, медицинской визуализации и продвинутых систем видеонаблюдения.
Благодаря этим вариантам YOLO12 обеспечивает разный уровень производительности в зависимости от размера модели. Результаты тестов показывают, что некоторые варианты YOLO12 превосходят YOLOv10 и Ultralytics YOLO11 по точности, достигая более высокого среднего значения точности (mAP).
Однако некоторые модели, такие как YOLO12m, YOLO12l и YOLO12x, обрабатывают изображения медленнее YOLO11, демонстрируя компромисс между точностью обнаружения и скоростью. Несмотря на это, YOLO12 остается эффективным и требует меньше параметров, чем многие другие модели, хотя их у него всё же больше, чем у YOLO11. Это делает YOLO12 отличным выбором для приложений, в которых точность важнее максимальной скорости.

Рис. 3. Сравнение Ultralytics YOLO11 и YOLO12.
Использование YOLO12 через пакет Ultralytics для Python#
YOLO12 поддерживается пакетом Ultralytics для Python и прост в использовании, поэтому подходит как новичкам, так и профессионалам. С помощью всего нескольких строк кода можно загрузить предварительно обученные модели, выполнять различные задачи компьютерного зрения на изображениях и видео, а также обучать YOLO12 на собственных датасетах. Пакет Ultralytics для Python упрощает этот процесс, устраняя необходимость в сложной настройке.
Например, ниже приведены шаги, которые нужно выполнить, чтобы использовать YOLO12 для обнаружения объектов:
- Установи пакет Ultralytics: сначала установи пакет Ultralytics для Python, который предоставляет инструменты для эффективного запуска YOLO12. Это гарантирует корректную установку всех зависимостей.
- Загрузи предварительно обученную модель YOLO12: выбери подходящий вариант YOLO12 (nano, small, medium, large или extra large) с учетом требуемого для твоей задачи уровня точности и скорости.
- Передай изображение или видео: укажи файл изображения или видео, который нужно проанализировать. YOLO12 также может обрабатывать видеопотоки в реальном времени.
- Запусти процесс обнаружения: модель сканирует визуальные данные, идентифицирует объекты и размещает вокруг них ограничивающие рамки. Для каждого обнаруженного объекта она указывает предсказанный класс и оценку уверенности.
- Настрой параметры обнаружения: можно также изменить такие параметры, как пороги уверенности, чтобы точнее настроить качество и производительность обнаружения.
- Сохрани или используй результат: обработанное изображение или видео с обнаруженными объектами можно сохранить или интегрировать в приложение для дальнейшего анализа, автоматизации или принятия решений.
Эти шаги делают YOLO12 удобным для широкого спектра приложений — от видеонаблюдения и отслеживания посетителей в розничной торговле до медицинской визуализации и автономных транспортных средств.
Практическое применение YOLO12#
YOLO12 можно использовать в самых разных реальных приложениях благодаря поддержке обнаружения объектов, сегментации экземпляров, классификации изображений, оценки позы и обнаружения объектов с учетом их ориентации (OBB).

Рис. 4. YOLO12 поддерживает такие задачи, как обнаружение объектов и сегментация экземпляров.
Однако, как мы уже обсуждали, модели YOLO12 отдают приоритет точности, а не скорости, поэтому обрабатывают изображения немного дольше по сравнению с предыдущими версиями. Благодаря этому компромиссу YOLO12 идеально подходит для приложений, где точность важнее скорости работы в реальном времени, например:
- Медицинская визуализация: YOLO12 можно дообучить для высокоточного обнаружения опухолей или аномалий на рентгеновских снимках и МРТ, что делает модель полезным инструментом для врачей и рентгенологов, которым нужен точный анализ изображений для постановки диагноза.
- Контроль качества на производстве: модель может помогать выявлять дефекты продукции в процессе производства, обеспечивая поступление на рынок только высококачественных товаров, сокращая отходы и повышая эффективность.
- Криминалистический анализ: правоохранительные органы могут дообучить YOLO12 для анализа записей с камер наблюдения и сбора доказательств. В ходе расследований точность критически важна для выявления ключевых деталей.
- Точное земледелие: фермеры могут использовать YOLO12 для анализа состояния посевов, обнаружения болезней или заражения вредителями и мониторинга состояния почвы. Точные оценки помогают оптимизировать стратегии ведения сельского хозяйства, повышая урожайность и улучшая управление ресурсами.
Начало работы с YOLO12#
Перед запуском YOLO12 важно убедиться, что твоя система соответствует необходимым требованиям.
С технической точки зрения YOLO12 может работать на любом выделенном GPU (графическом процессоре). По умолчанию FlashAttention не требуется, поэтому модель может работать на большинстве систем с GPU и без него. Однако включение FlashAttention особенно полезно при работе с большими датасетами или изображениями высокого разрешения: это помогает избежать замедлений, снизить потребление памяти и повысить эффективность обработки.
Чтобы использовать FlashAttention, тебе понадобится GPU NVIDIA одной из следующих серий: Turing (T4, Quadro RTX), Ampere (серия RTX 30, A30, A40, A100), Ada Lovelace (серия RTX 40) или Hopper (H100, H200).
Учитывая удобство и доступность, пакет Ultralytics для Python пока не поддерживает инференс с FlashAttention, поскольку его установка может быть довольно сложной с технической точки зрения. Чтобы узнать больше о начале работы с YOLO12 и оптимизации его производительности, ознакомься с официальной документацией Ultralytics.
Основные выводы#
По мере развития компьютерного зрения модели становятся точнее и эффективнее. YOLO12 улучшает такие задачи компьютерного зрения, как обнаружение объектов, сегментация экземпляров и классификация изображений, благодаря обработке, ориентированной на внимание, и FlashAttention, повышая точность и оптимизируя использование памяти.
Одновременно компьютерное зрение становится доступнее, чем когда-либо. YOLO12 прост в использовании через пакет Ultralytics для Python и благодаря ориентации на точность, а не скорость хорошо подходит для медицинской визуализации, промышленных проверок и робототехники — приложений, где точность имеет ключевое значение.
Интересуешься AI? Посети наш репозиторий на GitHub и присоединись к нашему сообществу. Изучи инновации в таких областях, как AI в беспилотных автомобилях и компьютерное зрение в сельском хозяйстве, на страницах наших решений. Ознакомься с вариантами лицензирования и воплоти свои проекты в области AI-зрения в жизнь. 🚀









