Всё, что нужно знать о задачах компьютерного зрения
Узнай, как работают задачи компьютерного зрения, такие как отслеживание объектов, сегментация экземпляров и классификация изображений, и как Ultralytics YOLO11 их поддерживает.

Благодаря камерам и достижениям в области искусственного интеллекта (AI) компьютеры и машины теперь могут видеть мир подобно людям. Например, они могут распознавать людей, отслеживать объекты и даже понимать контекст происходящего в видео.
В частности, компьютерное зрение — это отрасль AI, которая позволяет машинам понимать и интерпретировать визуальную информацию из окружающего мира. Компьютерное зрение включает множество задач, каждая из которых предназначена для извлечения определённого типа информации из изображений или видео. Например, обнаружение объектов помогает находить и определять местоположение разных предметов на изображении, а другие задачи, такие как трекинг, сегментация и оценка позы, помогают машинам точнее понимать движения, формы и положения объектов.
Выбор задачи компьютерного зрения для конкретного приложения зависит от типа необходимой информации. Модели компьютерного зрения, такие как Ultralytics YOLO11, поддерживают различные задачи компьютерного зрения, что делает их надёжным выбором для создания реальных систем Vision AI.
В этом руководстве мы подробнее рассмотрим задачи компьютерного зрения, поддерживаемые моделями вроде YOLO11. Мы разберём, как работает каждая задача и как они применяются в разных отраслях. Давайте начнём!
Что такое задачи компьютерного зрения?#
Задачи компьютерного зрения по-разному воспроизводят способности человеческого зрения. Они помогают машинам обнаруживать объекты, отслеживать их движения, оценивать позы и даже выделять отдельные элементы на изображениях и видео. Обычно задачи компьютерного зрения выполняются моделями, которые разбивают визуальные данные на более мелкие части, чтобы яснее интерпретировать происходящее.
Модели Vision AI, такие как модели Ultralytics YOLO, поддерживают несколько задач, включая обнаружение, трекинг и сегментацию, в рамках одного фреймворка. Благодаря такой универсальности модели YOLO11 легко адаптировать для широкого спектра вариантов использования.

Рис. 1. Задачи компьютерного зрения, поддерживаемые Ultralytics YOLO11.
Хороший пример — спортивная аналитика. YOLO11 можно использовать для обнаружения каждого игрока на поле с помощью обнаружения объектов, а затем отслеживать их на протяжении матча с помощью трекинга объектов. Кроме того, возможности YOLO11 по оценке позы помогают анализировать движения и технику игроков, а сегментация экземпляров позволяет отделить каждого игрока от фона, повышая точность анализа.
Вместе эти задачи компьютерного зрения на базе YOLO11 создают полную картину происходящего во время игры и дают командам более глубокое понимание эффективности игроков, тактики и общей стратегии.
Обзор задач компьютерного зрения, поддерживаемых Ultralytics YOLO11#
Теперь, когда мы рассмотрели, что такое задачи компьютерного зрения, давайте подробнее разберём каждую задачу, поддерживаемую YOLO11, на примерах из реального мира.
Поддержка классификации изображений в Ultralytics YOLO11#
Глядя на фотографию, большинство людей легко могут определить, изображена ли на ней собака, гора или дорожный знак, потому что мы все знаем, как обычно выглядят такие объекты. Классификация изображений помогает машинам делать то же самое, обучая их классифицировать и маркировать изображение на основе его основного объекта — будь то «автомобиль», «банан» или «рентгеновский снимок с переломом». Эта метка помогает системам компьютерного зрения понимать визуальное содержимое и соответствующим образом реагировать или принимать решения.
Одно из интересных применений этой задачи компьютерного зрения — мониторинг дикой природы. Классификацию изображений можно использовать для определения разных видов животных на фотографиях, снятых в естественной среде. Автоматически маркируя изображения, исследователи могут отслеживать численность популяций, контролировать миграционные маршруты и легче выявлять исчезающие виды, поддерживая природоохранные инициативы.

Рис. 2. Пример использования YOLO11 для классификации изображений.
Возможности Ultralytics YOLO11 по обнаружению объектов#
Классификация изображений помогает получить общее представление о содержимом изображения, но присваивает ему только одну метку целиком. В ситуациях, когда требуется подробная информация, например точное местоположение и идентификация нескольких объектов, обнаружение объектов становится незаменимым.
Обнаружение объектов — это процесс идентификации и определения местоположения отдельных объектов на изображении, часто с помощью ограничивающих рамок. Ultralytics YOLO особенно хорошо подходит для обнаружения объектов в реальном времени, что делает его идеальным решением для широкого спектра приложений.
Например, решения компьютерного зрения в розничных магазинах могут использоваться для пополнения полок. Обнаружение объектов помогает подсчитывать фрукты, овощи и другие товары, обеспечивая точный учёт запасов. На сельскохозяйственных полях та же технология может отслеживать зрелость урожая и помогать фермерам определять лучшее время для сбора, различая даже спелые и неспелые плоды.
Рис. 3. Обнаружение фруктов с помощью Ultralytics YOLO11.
Использование YOLO11 для сегментации экземпляров#
При обнаружении объектов для их идентификации и определения местоположения на изображении используются ограничивающие рамки, но они не передают точную форму объектов. Здесь на помощь приходит сегментация экземпляров. Вместо того чтобы обводить объект рамкой, сегментация экземпляров точно очерчивает его контур.
Представь это так: вместо простого указания «в этой области есть яблоко» система тщательно обводит и заполняет точную форму яблока. Такой подробный процесс помогает системам AI чётко понимать границы объекта, особенно когда объекты находятся близко друг к другу.
Сегментацию экземпляров можно применять во многих областях — от обследования инфраструктуры до геологических исследований. Например, данные геологических исследований можно анализировать с помощью YOLO11, сегментируя крупные и мелкие поверхностные трещины или аномалии. Проводя точные границы вокруг этих аномалий, инженеры могут определить проблемные места и устранить их до начала проекта.

Рис. 4. Сегментация трещин с помощью YOLO11.
Трекинг объектов: отслеживание объектов между кадрами с помощью YOLO11#
До сих пор рассмотренные нами задачи компьютерного зрения были сосредоточены на содержимом одного изображения. Однако для работы с видео нужна информация, выходящая за рамки одного кадра. Для этого можно использовать задачу трекинга объектов.
Трекинг объектов в YOLO11 позволяет отслеживать конкретный объект, например человека или автомобиль, по мере его перемещения через серию видеокадров. Даже если меняется угол обзора камеры или появляются другие объекты, система продолжает отслеживать ту же цель.
Это особенно важно для приложений, требующих мониторинга во времени, например для отслеживания автомобилей в потоке. YOLO11 может точно отслеживать транспортные средства, следуя за каждым автомобилем и помогая оценивать его скорость в реальном времени. Благодаря этому трекинг объектов становится ключевым компонентом таких систем, как мониторинг дорожного движения.

Рис. 5. Поддержку трекинга объектов в YOLO11 можно использовать для оценки скорости.
Обнаружение ориентированных ограничивающих рамок (OBB) с помощью YOLO11#
Объекты в реальном мире не всегда идеально выровнены — они могут быть наклонены, расположены боком или находиться под необычным углом. Например, на спутниковых снимках корабли и здания часто выглядят повёрнутыми.
Традиционные методы обнаружения объектов используют фиксированные прямоугольные рамки, которые не подстраиваются под ориентацию объекта, из-за чего такие повёрнутые формы сложно точно охватить. Обнаружение ориентированных ограничивающих рамок (OBB) решает эту проблему с помощью рамок, которые поворачиваются и плотно соответствуют объекту, выравниваясь по его углу для более точного обнаружения.
При мониторинге гаваней поддержка обнаружения OBB в YOLO11 помогает точно идентифицировать и отслеживать суда независимо от их ориентации, обеспечивая надлежащий контроль каждого корабля, входящего в гавань или выходящего из неё. Такое точное обнаружение предоставляет информацию о положении и движении судов в реальном времени, что крайне важно для управления загруженными портами и предотвращения столкновений.

Рис. 6. Обнаружение лодок с помощью OBB и YOLO11.
Оценка позы и YOLO11: отслеживание ключевых точек#
Оценка позы — это метод компьютерного зрения, который отслеживает ключевые точки, такие как суставы, конечности или другие ориентиры, чтобы понять, как движется объект. Вместо того чтобы рассматривать весь объект или тело как единое целое, этот метод разбивает его на ключевые части. Благодаря этому можно подробно анализировать движения, жесты и взаимодействия.
Одно из распространённых применений этой технологии — оценка позы человека. Отслеживая положение различных частей тела в реальном времени, она даёт чёткое представление о движениях человека. Эту информацию можно использовать для самых разных задач — от распознавания жестов и мониторинга активности до анализа спортивных результатов.
Аналогично, при физической реабилитации специалисты могут использовать оценку позы человека и YOLO11 для мониторинга движений пациентов во время упражнений. Это помогает убедиться, что каждое движение выполняется правильно, и отслеживать прогресс с течением времени.

Рис. 7. YOLO11 может контролировать тренировку с помощью оценки позы.
Как YOLO11 поддерживает различные задачи компьютерного зрения#
Теперь, когда мы подробно рассмотрели все задачи компьютерного зрения, поддерживаемые YOLO11, давайте разберёмся, как YOLO11 их поддерживает.
YOLO11 — это не одна модель, а набор специализированных вариантов моделей, каждый из которых предназначен для конкретной задачи компьютерного зрения. Это делает YOLO11 универсальным инструментом, который можно адаптировать для широкого спектра приложений. Ты также можешь дообучать эти модели на собственных наборах данных, чтобы решать уникальные задачи своих проектов.
Ниже представлены варианты моделей YOLO11, предварительно обученные для конкретных задач компьютерного зрения:
- YOLO11: эта модель обнаруживает и маркирует несколько объектов в реальном времени, что делает её идеальной для высокоскоростного визуального распознавания.
- YOLO11-seg: этот вариант ориентирован на сегментацию и использует подробные маски для отделения объектов от фона.
- YOLO11-obb: эта модель предназначена для обнаружения повёрнутых объектов с помощью ограничивающих рамок, выровненных по ориентации каждого объекта.
- YOLO11-cls: этот вариант классифицирует изображения, присваивая одну категориальную метку на основе их общего содержимого.
- YOLO11-pose: эта модель оценивает ключевые точки тела для отслеживания позы, положения конечностей и движений.
Каждый вариант доступен в разных размерах, поэтому ты можешь выбрать подходящий баланс между скоростью и точностью для своих задач.
Основные выводы#
Задачи компьютерного зрения меняют способы, с помощью которых машины понимают мир и взаимодействуют с ним. Разбивая изображения и видео на ключевые элементы, эти технологии упрощают подробный анализ объектов, движений и взаимодействий.
От повышения безопасности дорожного движения и улучшения спортивных результатов до оптимизации промышленных процессов — модели вроде YOLO11 могут предоставлять информацию в реальном времени, способствующую инновациям. По мере развития Vision AI такие технологии, вероятно, будут играть всё более важную роль в том, как мы ежедневно интерпретируем и используем визуальные данные.
Присоединяйся к нашему сообществу и посети наш репозиторий на GitHub, чтобы увидеть ИИ в действии. Изучи наши варианты лицензирования и узнай больше об ИИ в сельском хозяйстве и компьютерном зрении в производстве на страницах наших решений.









