YOLO Vision 2026:
Vision AI

Исследование различных типов данных для приложений Vision AI

Узнай, как типы визуальных данных, такие как тепловизионная съемка, LiDAR и инфракрасные изображения, расширяют возможности компьютерного зрения в различных отраслях.

ABAbirami Vina4 min read
Типы визуальных данных для приложений Vision AI

Такие технологии, как дроны, раньше были ограничены и доступны лишь исследователям и специалистам, но сегодня передовое оборудование становится доступным более широкой аудитории. Этот сдвиг меняет способы сбора визуальных данных. Благодаря доступности технологий мы можем получать изображения и видео из самых разных источников, а не только с традиционных камер.

Параллельно с этим анализ изображений, поддерживаемый computer vision, ответвлением искусственного интеллекта (ИИ), стремительно развивается, позволяя машинам эффективнее интерпретировать и обрабатывать визуальные данные. Этот прогресс открыл новые возможности для автоматизации, обнаружения объектов и анализа в реальном времени. Теперь машины могут распознавать паттерны, отслеживать движения и осмыслять сложные визуальные входные данные.

Некоторые ключевые типы visual data включают в себя RGB-изображения (красный, зеленый, синий), которые обычно используются для распознавания объектов, тепловизионную съемку, помогающую обнаруживать тепловые следы в условиях низкой освещенности, и данные глубины, позволяющие машинам понимать трехмерные среды. Каждый из этих типов данных играет жизненно важную роль в обеспечении работы различных приложений vision AI, начиная от видеонаблюдения и заканчивая medical imaging.

В этой статье мы рассмотрим основные виды визуальных данных, используемых в компьютерном зрении, и выясним, как каждый из них способствует повышению точности, эффективности и производительности в различных отраслях. Приступим!

Самый распространенный тип датасетов с ИИ-изображениями и видео#

Обычно, когда ты снимаешь фото на смартфон или смотришь запись с камер видеонаблюдения, ты работаешь с RGB-изображениями. RGB расшифровывается как «красный, зеленый и синий» (red, green, blue) — это три цветовых канала, которые представляют визуальную информацию в цифровых изображениях.

RGB-изображения и видео — это тесно связанные типы визуальных данных, используемые в компьютерном зрении, и оба вида захватываются стандартными камерами. Основное различие заключается в том, что изображения фиксируют один момент времени, тогда как видео — это последовательность кадров, показывающая изменения со временем.

RGB-изображения обычно используются для таких computer vision tasks, как обнаружение объектов, сегментация экземпляров и оценка позы, при поддержке таких моделей, как Ultralytics YOLO11. Эти приложения полагаются на выявление паттернов, форм или конкретных особенностей в одном кадре.

Видео, с другой стороны, незаменимы, когда важны движение или время, например, для распознавания жестов, видеонаблюдения или отслеживания действий. Поскольку видео можно рассматривать как последовательность изображений, модели компьютерного зрения, такие как Ultralytics YOLO11, обрабатывают их кадр за кадром, чтобы понимать движение и поведение во времени.

Например, Ultralytics YOLO11 можно использовать для анализа RGB-изображений или видео с целью обнаружения сорняков и подсчета растений на сельскохозяйственных полях. Это улучшает мониторинг посевов и помогает отслеживать изменения в течение циклов роста для более эффективного управления фермой.

Ultralytics YOLO11 detecting and counting plants for crop monitoring

Fig 1. YOLO11 может обнаруживать и подсчитывать растения для более интеллектуального мониторинга посевов.

Данные о глубине в компьютерном зрении: LiDAR и 3D-восприятие#

Данные глубины добавляют третье измерение к визуальной информации, указывая, как далеко находятся объекты от камеры или датчика. В отличие от RGB-изображений, которые фиксируют только capture color и текстуру, данные глубины обеспечивают пространственный контекст. Они демонстрируют расстояние между объектами и камерой, позволяя интерпретировать трехмерную планировку сцены.

Этот тип данных собирается с помощью таких технологий, как LiDAR, стереозрение (использование двух камер для имитации человеческого восприятия глубины) и ToF-камеры (Time-of-Flight, измеряющие время прохождения света до объекта и обратно).

Среди них LiDAR (Light Detection and Ranging — обнаружение и определение дальности с помощью света) часто является наиболее надежным для измерения глубины. Он работает путем отправки быстрых лазерных импульсов и измерения времени их возвращения. Результатом является высокоточная 3D-карта, называемая облаком точек, которая выделяет форму, положение и расстояние до объектов в реальном времени.

Растущая роль LiDAR в системах компьютерного зрения#

Технологию LiDAR можно разделить на два основных типа, каждый из которых предназначен для конкретных задач и сред. Давай подробнее рассмотрим оба типа:

  • Воздушный LiDAR: Обычно используемые для картографирования больших территорий, бортовые сканеры LiDAR устанавливаются на drones или летательные аппараты для сбора высокоразрешающих данных для крупномасштабного топографического картирования. Он идеален для съемки местности, лесов и ландшафтов.
  • Наземный LiDAR: Этот тип LiDAR-данных собирается с датчиков, установленных на транспортных средствах или стационарных платформах, для таких задач, как мониторинг инфраструктуры, строительство и картирование помещений. Он предоставляет очень детальные данные для небольших локальных участков, что полезно для городского планирования и геодезической съемки конкретных объектов.

Эффективным применением данных LiDAR являются autonomous vehicles, где они играют ключевую роль в таких задачах, как обнаружение полосы движения, предотвращение столкновений и идентификация близлежащих объектов. LiDAR создает детальные трехмерные карты окружающей среды в реальном времени, позволяя автомобилю видеть объекты, рассчитывать расстояние до них и безопасно перемещаться.

LiDAR enabling autonomous vehicles to map depth and detect objects

Рис. 2. Технология LiDAR позволяет автономным транспортным средствам отображать глубину и обнаруживать объекты.

Использование тепловых и инфракрасных данных в ИИ-приложениях#

RGB-изображения фиксируют то, что мы видим в видимом спектре света; однако другие технологии визуализации, такие как тепловизионная и инфракрасная, выходят за эти рамки. Инфракрасная визуализация улавливает инфракрасный свет, излучаемый или отражаемый объектами, что полезно в условиях низкой освещенности.

Тепловизионная визуализация, напротив, обнаруживает тепло, излучаемое объектами, и показывает разницу температур, что позволяет работать в полной темноте или сквозь дым, туман и другие препятствия. Этот тип данных особенно полезен для мониторинга и выявления проблем, особенно в тех отраслях, где температурные изменения могут сигнализировать о потенциальных неисправностях.

Интересным примером является использование тепловизионной съемки для мониторинга electrical components на предмет признаков перегрева. Обнаруживая перепады температур, тепловизоры могут выявлять проблемы до того, как они приведут к поломке оборудования, пожарам или дорогостоящим повреждениям.

Thermal imaging used to monitor electrical components

Fig 3. Пример использования тепловизионной съемки для мониторинга электрических компонентов.

Аналогично, инфракрасные изображения помогают обнаруживать утечки в трубопроводах или изоляции, выявляя перепады температур, которые указывают на выход газов или жидкостей, что критически важно для предотвращения опасных ситуаций и повышения энергоэффективности.

Мультиспектральная и гиперспектральная визуализация в ИИ#

В то время как инфракрасная и тепловизионная съемка фиксируют специфические аспекты электромагнитного спектра, мультиспектральная визуализация собирает свет из нескольких выбранных диапазонов длин волн, каждый из которых предназначен для конкретной цели, например, для оценки состояния растительности или идентификации материалов поверхности.

Гиперспектральная визуализация делает еще один шаг вперед, захватывая свет в сотнях очень узких и непрерывных диапазонов длин волн. Это дает детальную световую сигнатуру для каждого пикселя изображения, предлагая гораздо более глубокое понимание наблюдаемого материала.

Comparing multispectral and hyperspectral imaging

Fig 4. Сравнение многоспектральной и гиперспектральной съемки.

И мультиспектральная, и гиперспектральная визуализация используют специальные сенсоры и фильтры для захвата света на разных длинах волн. Затем данные организуются в 3D-структуру, называемую спектральным кубом, где каждый слой представляет отдельную длину волны.

Модели ИИ могут анализировать эти данные для обнаружения особенностей, которые обычные камеры или человеческий глаз не видят. Например, в plant phenotyping гиперспектральная съемка может использоваться для мониторинга здоровья и роста растений путем обнаружения тонких изменений в их листьях или стеблях, таких как дефицит питательных веществ или стресс. Это помогает исследователям оценивать состояние растений и оптимизировать сельскохозяйственные практики без использования инвазивных методов.

Анализ радарных и сонарных изображений с помощью ИИ#

Радарная и сонарная визуализация — это технологии, которые обнаруживают и наносят на карту объекты путем отправки сигналов и анализа их отражений, подобно LiDAR. В отличие от RGB-визуализации, которая опирается на световые волны для захвата визуальной информации, радар использует электромагнитные волны (обычно радиоволны), а сонар — звуковые волны. Обе системы, радарная и сонарная, излучают импульсы и измеряют время возвращения сигнала от объекта, предоставляя информацию о его расстоянии, размере и скорости.

Радарная визуализация особенно полезна при плохой видимости, например, во время тумана, дождя или ночью. Поскольку она не зависит от света, она может обнаруживать самолеты, транспортные средства или рельеф в полной темноте. Это делает радар надежным выбором в авиации, мониторинге погоды и автономной навигации.

Для сравнения, сонарная съемка обычно используется в подводных средах, куда не проникает свет. Она использует звуковые волны, которые распространяются в воде и отражаются от погруженных объектов, позволяя обнаруживать подводные лодки, составлять карты океанского дна и выполнять подводные спасательные операции. Достижения в области computer vision теперь позволяют еще больше улучшить underwater detection путем объединения данных сонара с интеллектуальным анализом для более точного обнаружения и принятия решений.

How a sonar system uses ultrasound pulses to measure sea depth

Рис. 5. Как система SONAR использует ультразвуковые импульсы для измерения глубины моря. (Источник: bbc.co.uk)

Синтетические и симулированные визуальные данные для обучения ИИ-моделей#

До сих пор различные типы данных, которые мы обсуждали, представляли собой то, что можно собрать из реального мира. Тем не менее, как синтетические, так и симулированные визуальные данные являются типами искусственного контента. Синтетические данные генерируются с нуля с использованием 3D modeling или генеративного ИИ для создания реалистично выглядящих изображений или видео.

A look at synthetically generated images

Fig 6. Обзор синтетически сгенерированных изображений.

Симулированные данные похожи, но они включают создание виртуальных сред, имитирующих поведение физического мира, включая отражение света, образование теней и движение объектов. Хотя все симулированные визуальные данные являются синтетическими, не все синтетические данные являются симулированными. Ключевое различие в том, что симулированные данные воспроизводят реалистичное поведение, а не только внешний вид.

Эти типы данных полезны для обучения computer vision models, особенно когда данные реального мира сложно собрать или когда нужно симулировать специфические редкие ситуации. Разработчики могут создавать целые сцены, выбирать типы объектов, позиции и освещение, а также автоматически добавлять метки, такие как ограничивающие рамки, для обучения. Это помогает быстро создавать крупные и разнообразные наборы данных без необходимости использования реальных фотографий или ручной разметки, что может быть дорого и отнимать много времени.

Например, в здравоохранении синтетические данные можно использовать для обучения моделей сегментации клеток рака груди, где сбор и разметка больших наборов реальных изображений затруднены. Синтетические и симулированные данные обеспечивают гибкость и контроль, заполняя пробелы там, где реальные визуальные данные ограничены.

Выбор подходящего типа визуальных данных для твоего ИИ-приложения#

Теперь, когда мы разобрались, как работают различные типы визуальных данных и для чего они нужны, давай подробнее рассмотрим, какие из них лучше всего подходят для конкретных задач:

  • RGB-изображения: Идеально подходят для общих задач computer vision, таких как image classification и обнаружение объектов. Они фиксируют цвет и текстуру, но ограничены в сложных условиях, таких как слабое освещение или плохая видимость.
  • LiDAR: Этот тип визуализации обеспечивает высокоточное 3D-картирование с использованием лазерных импульсов. Отлично подходит для приложений, требующих точных измерений расстояния, таких как робототехника, автономные транспортные средства и инспекция инфраструктуры.
  • Тепловизионная визуализация: Поскольку она может обнаруживать разницу температур, она полезна в условиях плохой видимости, например, при ночном мониторинге, пожаротушении или обнаружении утечек тепла в оборудовании и зданиях.
  • Мультиспектральная и гиперспектральная визуализация: Полезны для задач, требующих детального анализа материалов, таких как сельскохозяйственный мониторинг, контроль качества в фармацевтике или дистанционное зондирование. Эти методы дают более глубокое понимание за счет сбора данных в широком диапазоне длин волн за пределами видимого света.
  • Радарная и сонарная визуализация: Являются предпочтительными в средах с низкой видимостью. Радар использует радиоволны и полезен в авиации и навигации, тогда как сонар использует звуковые волны для работы при подводном обнаружении.
  • Синтетические и симулированные визуальные данные: Идеально подходят для training AI models, когда данные реального мира ограничены, недоступны или их сложно размечать. Эти искусственные визуальные материалы помогают создавать разнообразные наборы данных для сложных сценариев, таких как редкие события или критические для безопасности условия.

Иногда один тип данных может не обеспечить достаточную точность или контекст в реальных ситуациях. Здесь на помощь приходит мультимодальная сенсорная интеграция. Объединяя RGB с другими типами данных, такими как тепловые, данные о глубине или LiDAR, системы могут преодолеть индивидуальные ограничения, повышая надежность и адаптивность.

Например, в warehouse automation использование RGB для распознавания объектов, глубины для измерения расстояний и тепловизионной съемки для обнаружения перегрева оборудования делает операции более эффективными и безопасными. В конечном итоге лучшие результаты достигаются за счет выбора или комбинации типов данных на основе конкретных потребностей твоего приложения.

Основные выводы#

При создании моделей компьютерного зрения выбор правильного типа визуальных данных имеет решающее значение. Задачи, такие как обнаружение объектов, сегментация и отслеживание движения, зависят не только от алгоритмов, но и от качества входных данных. Чистые, разнообразные и точные датасеты помогают снизить уровень шума и повысить производительность.

Комбинируя типы данных, такие как RGB, глубина, тепловые данные и LiDAR, ИИ-системы получают более полное представление об окружающей среде, становясь надежнее в различных условиях. По мере развития технологий это, вероятно, позволит компьютерному зрению стать быстрее, адаптивнее и эффективнее во многих отраслях.

Присоединяйся к нашему community и изучай наш GitHub repository, чтобы узнать больше о computer vision. Узнай о различных приложениях, связанных с AI in healthcare и computer vision in retail, на наших страницах решений. Ознакомься с нашими licensing options, чтобы начать работу с vision AI.

Explore solutions

Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения