Computer Vision (CV)
Узнай, как компьютерное зрение позволяет машинам интерпретировать изображения и видео. Изучи основные задачи, отраслевые применения и начало работы с Ultralytics YOLO.
Компьютерное зрение (CV) — это область искусственного интеллекта (AI), которая позволяет компьютерам и системам извлекать значимую информацию из цифровых изображений, видео и других визуальных данных. Если AI позволяет машинам думать, то компьютерное зрение позволяет им видеть, наблюдать и понимать. В отличие от инструментов обработки изображений на основе правил, современные системы обучаются непосредственно на данных: им никогда явно не объясняют, как выглядит автомобиль или опухоль, вместо этого они выявляют закономерности в тысячах размеченных примеров и обобщают эти знания на изображения, с которыми раньше не сталкивались. Применяя машинное обучение (ML) и глубокое обучение (DL), компьютерное зрение преобразует неструктурированные визуальные данные в решения, на основе которых программное обеспечение может действовать.
Как работает компьютерное зрение#
Компьютер воспринимает изображение как массив числовых значений, представляющих пиксели. Преобразование этого массива в действие проходит через конвейер из пяти этапов.

Получение изображения. Рабочий процесс начинается с оборудования — CMOS-сенсоров, инфракрасных камер или LiDAR-сканеров, которые захватывают свет и преобразуют его в цифровую сетку пикселей. Перед началом анализа выполняется калибровка камеры с учетом геометрии объектива.
Предварительная обработка. Полученные данные нормализуются, чтобы модель получала согласованный ввод: изображение масштабируется, шум уменьшается, а контраст корректируется.
Извлечение признаков. Система выявляет низкоуровневые признаки, такие как границы, градиенты и углы. По мере прохождения данных вглубь сети эти примитивы объединяются в высокоуровневые признаки — текстуры, узоры и сложные геометрические формы. Система может обнаружить вертикальные линии, распознать в них столбы забора, а затем понять, что сцена представляет собой границу периметра. Этот процесс называется извлечением признаков.
Инференс модели. Движущей силой современного компьютерного зрения является сверточная нейронная сеть (CNN). В отличие от обычной нейронной сети, которая рассматривает изображение как плоский список чисел, CNN сохраняют пространственные взаимосвязи между пикселями, используя фильтры, скользящие по изображению и обнаруживающие закономерности независимо от их положения в кадре. В последнее время визуальные Transformer (ViTs) стали мощной альтернативой: они применяют к изображениям механизм внимания из области обработки естественного языка.
Вывод и действие. Модель возвращает структурированный результат — метку, набор ограничивающих рамок или пиксельную маску, — на основе которого внешняя система выполняет действие: отбраковывает дефектную деталь, тормозит автомобиль или поднимает тревогу.
Как обучается модель#
Качество модели не может быть выше качества данных, которые она получает. Для обучения с учителем требуются большие объемы обучающих данных, а такие бенчмарки, как ImageNet и COCO, предоставляют миллионы аннотированных примеров. Во время обучения модель делает предсказание, сравнивает его с истинной меткой и корректирует внутренние веса, чтобы уменьшить ошибку. После обучения та же модель выполняет описанный выше этап инференса.
Переход от систем на основе правил к глубокому обучению#

Ранние системы компьютерного зрения зависели от ручного конструирования признаков: инженеры задавали жесткие геометрические параметры, помогающие машинам распознавать объекты. Такие системы были хрупкими и давали сбои при изменении освещения или появлении объекта под непривычным углом. Публикация AlexNet в 2012 году, обученной более чем на миллионе размеченных изображений ImageNet, стала переломным моментом: она показала, что сверточные сети в больших масштабах превосходят подходы с признаками, заданными вручную. Глубокое обучение заменило настроенные вручную правила архитектурами, которые самостоятельно обучаются признакам и достаточно гибки, чтобы работать в реальных условиях, где невозможно обеспечить идеальный контроль.
Компьютерное зрение, обработка изображений и машинное зрение#
Важно отличать компьютерное зрение от смежных областей, с которыми его часто путают.
- Обработка изображений изменяет изображение, чтобы улучшить его или извлечь из него сигнал, например корректируя яркость и контраст или применяя фильтры. Обычно результатом является другое изображение. Компьютерное зрение получает изображение на входе и выдает интерпретацию ("в этой комнате находятся три человека"). Компьютерное зрение регулярно использует обработку изображений как этап подготовки.
- Машинное зрение — это промышленные системы контроля, работающие в строго контролируемых условиях с фиксированным освещением и известным расположением деталей. Компьютерное зрение — более широкая дисциплина, предназначенная для работы в непредсказуемых и неконтролируемых условиях.
- Обработка естественного языка работает с текстом и речью. Компьютерное зрение полностью сосредоточено на визуальных данных, хотя мультимодальные модели зрения и языка все чаще объединяют эти два направления.
Основные задачи компьютерного зрения#
Компьютерное зрение — это не одна функция, а набор отдельных задач, каждая из которых решает свою проблему. Подробное описание каждой из них смотри в полном руководстве по задачам компьютерного зрения.
- Классификация изображений: присваивает всему изображению одну метку, отвечая на вопрос "что находится на этой картинке?" — например, распределяя товары на дефектные и исправные. Близкая задача — распознавание изображений, которое определяет, что присутствует на изображении.
- Обнаружение объектов: выявляет отдельные объекты и рисует вокруг каждого ограничивающую рамку, позволяя системам подсчитывать и определять местоположение нескольких объектов в одном кадре.
- Сегментация экземпляров: создает маску на уровне пикселей для каждого обнаруженного объекта, разделяя отдельные экземпляры одного класса. Семантическая сегментация, напротив, присваивает класс каждому пикселю, не различая отдельные экземпляры.
- Оценка позы: обнаруживает ключевые точки объекта, например суставы человеческого тела, чтобы отслеживать движение и положение.
- Повернутые ограничивающие рамки: подбирают повернутые рамки для объектов, не выровненных по осям, что особенно важно для аэрофотоснимков и спутниковых изображений.
- Отслеживание объектов: отслеживает объект в видеопотоке, сохраняя постоянный идентификатор между кадрами. Оптический поток расширяет эту возможность, анализируя видимое движение между последовательными кадрами.
- Оптическое распознавание символов (OCR): преобразует изображения печатного или рукописного текста в машиночитаемые данные, автоматизируя обработку документов в больших масштабах.
Выбор подходящей задачи#
Сопоставление технической задачи с бизнес-целью с самого начала помогает избежать дорогостоящей переделки.
| Бизнес-цель | Подходящая задача |
|---|---|
| Распределять товары по категориям | Классификация изображений |
| Подсчитывать предметы или определять их местоположение | Обнаружение объектов |
| Анализировать точную форму или границу объекта | Сегментация экземпляров |
| Отслеживать движение между кадрами видео | Отслеживание объектов |
| Измерять положение тела или углы суставов | Оценка позы |
| Обнаруживать повернутые объекты на аэрофотоснимках | Повернутые ограничивающие рамки |
| Считывать текст с документов или этикеток | Оптическое распознавание символов |
Практические применения#
Сегодня компьютерное зрение лежит в основе производственных систем в большинстве крупных отраслей.

- Производство и контроль качества. Современные производственные линии работают быстрее, чем способен человек визуально воспринимать информацию. Системы машинного зрения выполняют мгновенный контроль качества, выявляя микроскопические трещины или смещенные компоненты со скоростью линии и не испытывая усталости, которая накапливается у человека-инспектора. Мониторинг износа оборудования также обеспечивает предиктивное обслуживание: характерные признаки неисправности обнаруживаются до того, как поломка приведет к незапланированному простою. См. разделы компьютерное зрение в производстве и обнаружение дефектов.
- Здравоохранение и диагностика. Алгоритмы анализа медицинских изображений обрабатывают рентгеновские снимки, МРТ и КТ, выявляя опухоли на ранних стадиях, микротрещины и аномалии сетчатки, которые легко не заметить в условиях нехватки времени. В операционной системы компьютерного зрения обеспечивают пространственное картирование в реальном времени во время малоинвазивных процедур. См. раздел компьютерное зрение в здравоохранении.
- Розничная торговля. Магазины без касс используют объединение данных с датчиков и алгоритмы компьютерного зрения, чтобы отслеживать товары, которые покупатели снимают с полок, и автоматически выставлять счета. Те же системы в реальном времени контролируют уровень запасов на полках и запускают уведомления о необходимости пополнения, поддерживая управление запасами и предотвращение потерь в розничной торговле. См. раздел компьютерное зрение в розничной торговле.
- Автономный транспорт. Слой восприятия — наиболее важный с точки зрения безопасности компонент беспилотного автомобиля. Системы компьютерного зрения в реальном времени распознают дорожную разметку, знаки, пешеходов и другие транспортные средства, объединяя данные камер с радаром и LiDAR для построения 360-градусной модели окружения автомобиля с помощью 3D-обнаружения объектов. См. раздел автономные транспортные средства.
- Безопасность и мониторинг. Инфраструктура безопасности перешла от пассивной записи к активному вмешательству: обнаруживает длительное нахождение людей в закрытых зонах, выявляет необычные модели поведения по мере их возникновения и поддерживает управление очередями в общественных местах. Основной возможностью здесь является обнаружение аномалий.
- Сельское хозяйство. Дроны и тракторы оценивают состояние урожая на уровне отдельных растений, анализируя мультиспектральные изображения для выявления обезвоживания, заражения вредителями или дефицита питательных веществ. Затем вода, пестициды и удобрения вносятся только в необходимых местах, а не на всем поле. См. раздел компьютерное зрение в сельском хозяйстве.
Компьютерное зрение на периферии сети#
Анализ визуальных данных в реальном времени все чаще выполняется на периферии — непосредственно на камере или локальном шлюзе, — вместо передачи видео на централизованный облачный сервер. Это важно по двум причинам.
Задержка сокращается почти до нуля, что критически важно для автономной робототехники или контроля промышленной линии, где задержка в несколько миллисекунд приводит к ошибкам. Кроме того, по сети передаются только метаданные, а не исходное видео, поэтому требования к пропускной способности резко снижаются, а конфиденциальность повышается: чувствительные записи никогда не покидают локальное устройство. Edge AI и инференс в реальном времени делают это практически осуществимым, а такие варианты развертывания моделей, как ONNX и TensorRT, позволяют запускать одну обученную модель на различном оборудовании.
Проблемы и ограничения#
Качество данных. Модель отражает качество обучающих данных. Низкое разрешение, плохая разметка или нерепрезентативность наборов данных приводят к ненадежным моделям, а создание разнообразного аннотированного набора часто требует больше труда, чем разработка самого алгоритма. См. раздел разметка данных.
Факторы окружающей среды. Сильный дождь, блики на объективе, частичное перекрытие и меняющийся масштаб объектов ухудшают производительность. Надежные системы используют аугментацию данных во время обучения, чтобы имитировать эти условия и повысить устойчивость до развертывания, а также тщательно выполняют валидацию, чтобы избежать переобучения.
Этические аспекты и предвзятость. Модель, обученная на наборе данных без демографического разнообразия, будет работать неодинаково для разных групп населения. Организации, внедряющие системы анализа людей — в медицинской визуализации, безопасности труда или общественных местах, — должны проверять свои наборы данных на справедливость и соблюдать новые нормативные требования к автоматизированному принятию решений.
Будущее компьютерного зрения#
Vision Transformers меняют представление о возможностях задач, требующих понимания взаимосвязей между удаленными частями изображения. Кроме того, мультимодальное обучение объединяет визуальные данные с текстом, аудио и глубиной, создавая системы с более глубоким контекстным пониманием. Ранним примером служат мультимодальные модели зрения и языка, отвечающие на вопросы об изображениях.
Генеративный AI напрямую решает проблему нехватки данных. Синтетические данные позволяют создавать гиперреалистичные изображения редких сценариев — конкретных режимов отказа или необычных проявлений заболеваний, — которые невозможно собрать в достаточном объеме в реальном мире. Тем временем камеры с датчиками глубины и LiDAR выводят системы за пределы анализа плоских изображений в область пространственных вычислений, где цифровая информация накладывается на физический мир для таких задач, как техническое обслуживание с поддержкой AR и картографирование конструкций.
Реализация компьютерного зрения с Ultralytics#
Для команд, запускающих пилотный проект по компьютерному зрению, Ultralytics YOLO26 — практичная отправная точка для обнаружения объектов в реальном времени: решение с открытым исходным кодом, подробной документацией и достаточной скоростью для работы на периферии. Показатели точности и задержки для разных аппаратных платформ опубликованы на странице бенчмарков, а в документации доступны сравнения моделей бок о бок. В более широкую экосистему входят OpenCV для классической обработки изображений и PyTorch в качестве основной платформы обучения.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with bounding boxes
results[0].show()Этот скрипт использует предварительно обученную модель для выполнения инференса всего в несколько строк. Команды, переходящие от пилотного проекта к промышленной эксплуатации, могут использовать Ultralytics Platform для аннотирования наборов данных, обучения моделей в облаке и управления развертыванием либо применять дообучение, чтобы адаптировать предварительно обученную модель к пользовательскому набору данных с гораздо меньшим объемом размеченных данных, чем требуется для обучения с нуля.
Часто задаваемые вопросы
Машинное обучение — более широкая дисциплина создания систем, которые обучаются на данных. Компьютерное зрение — это применение этой дисциплины, обычно с помощью глубокого обучения, к визуальным данным, таким как изображения и видео. Почти все современные системы компьютерного зрения основаны на машинном обучении, однако машинное обучение также работает с текстом, аудио и табличными данными.
Нет. Распознавание изображений — одна из задач компьютерного зрения, определяющая, что изображено на картинке. Компьютерное зрение также включает обнаружение объектов, сегментацию, оценку позы, отслеживание и понимание сцены.
Это зависит от сложности задачи и объема вариаций, с которыми должна справляться модель. Перенос обучения с предварительно обученной модели, такой как Ultralytics YOLO26, существенно снижает требования, и полезные пользовательские детекторы часто обучают на нескольких сотнях или нескольких тысячах размеченных изображений на класс, а не на миллионах изображений, использованных для обучения базовых моделей.
Да. Модели можно развернуть непосредственно на периферийных устройствах и запускать полностью автономно, что является стандартной практикой, когда задержка, пропускная способность или требования к конфиденциальности данных не позволяют отправлять видео в облако.
Доминирует Python благодаря зрелости его экосистемы — пакету
ultralytics, PyTorch и OpenCV. C++ используется там, где требуется максимальная производительность инференса, обычно во встраиваемых и автомобильных системах.









