Компьютерное зрение определяет, как Vision AI-агенты принимают решения
Узнай, как AI-агенты используют компьютерное зрение для преобразования различных отраслей. Изучи их применение в таких областях, как безопасность, беспилотные автомобили и не только.

Каждая отрасль — от производства до розничной торговли — сталкивается со своими проблемами в рабочих процессах, и поиск инновационных способов их решения всегда был ключом к успешному ведению бизнеса. В последнее время агенты ИИ стали популярным решением во многих сферах. Эти системы не ограничиваются анализом данных. Они также могут предпринимать действия.
Например, агенты ИИ в производстве могут обнаруживать дефекты в реальном времени и автоматически запускать процедуры контроля качества, чтобы производство продолжалось без сбоев. Аналогичным образом, в логистике и розничной торговле они могут контролировать несколько объектов с помощью интеллектуального видеонаблюдения и мгновенно сообщать командам о необычной активности.
По мере развития этой тенденции агенты ИИ активно меняют отрасли по всему миру. Объём мирового рынка агентов ИИ достиг 5,1 млрд долларов в 2024 году и, согласно прогнозам, вырастет до 47,1 млрд долларов к 2030 году.

Рис. 1. Обзор объёма мирового рынка агентов ИИ.
Одной из ключевых технологий, способствующих этим достижениям, является компьютерное зрение. Благодаря возможности обрабатывать и интерпретировать визуальные данные машины могут выполнять такие задачи компьютерного зрения, как обнаружение объектов в реальном времени, сегментация экземпляров и отслеживание объектов, с невероятной точностью. Эта технология устраняет разрыв между тем, что видят машины, и тем, как они принимают решения, поэтому играет важную роль во многих решениях на базе ИИ.
В этой статье мы рассмотрим агентов ИИ и их связь с компьютерным зрением. Мы также обсудим различные типы агентов ИИ и способы их применения в приложениях на основе визуальных данных. Давай начнём!
Что такое агенты ИИ?#
Прежде чем перейти к агентам ИИ на основе визуальных данных, давай разберёмся, что представляют собой агенты ИИ в целом, чтобы понять, насколько универсальными могут быть эти системы.
Агент ИИ — это интеллектуальная система, которая может понимать задачи или вопросы и отвечать на них без помощи человека. Многие агенты ИИ используют машинное обучение и обработку естественного языка (NLP) для выполнения широкого спектра задач — от ответов на простые вопросы до управления сложными процессами.
Некоторые агенты ИИ даже способны учиться и совершенствоваться со временем, в отличие от традиционных систем ИИ, которым для каждого обновления требуется участие человека. Поэтому агенты ИИ быстро становятся неотъемлемой частью ИИ. Они могут автоматизировать задачи, принимать решения и взаимодействовать с окружающей средой без постоянного контроля. Особенно полезны они при выполнении повторяющихся и трудоёмких задач.
Например, агентов ИИ можно встретить в таких сферах, как обслуживание клиентов и гостиничный бизнес. В сфере обслуживания клиентов агенты ИИ обрабатывают возвраты средств и предлагают персонализированные рекомендации товаров. В гостиничном бизнесе они помогают персоналу отелей обрабатывать запросы гостей, оптимизировать обслуживание номеров и рекомендовать гостям ближайшие достопримечательности. Эти примеры показывают, как агенты ИИ делают повседневные процессы быстрее и эффективнее.
Как работают агенты ИИ на основе визуальных данных#
Теперь давай кратко рассмотрим, как работают агенты ИИ. Хотя каждый агент ИИ уникален и предназначен для конкретных задач, все они выполняют одни и те же три основных шага: восприятие, принятие решений и действие.
Сначала, на этапе восприятия, агенты ИИ собирают информацию из разных источников, чтобы понять, что происходит. Затем следует принятие решений. На основе собранной информации они используют свои алгоритмы для анализа ситуации и выбора оптимального варианта действий. Наконец, выполняется действие. Приняв решение, агент реализует его — отвечает на вопрос, выполняет задачу или отмечает проблему, которую должен обработать человек.
Это может показаться простым, но в зависимости от типа агента ИИ за кулисами часто происходит многое, чтобы эти шаги работали. Каждый агент ИИ создан для выполнения конкретных задач своим способом — от анализа сложных данных до использования продвинутых моделей машинного обучения.
Например, многие агенты ИИ сосредоточены на обработке языка с помощью NLP, тогда как другие — так называемые агенты ИИ на основе визуальных данных — используют компьютерное зрение для работы с визуальными данными. Применяя продвинутые модели компьютерного зрения, такие как Ultralytics YOLO11, агенты ИИ на основе визуальных данных могут выполнять более точный анализ изображений.

Рис. 2. Пример подсчёта яблок на изображении с помощью YOLO11.
Агенты ИИ на основе визуальных данных в беспилотных автомобилях#
Давай рассмотрим беспилотные автомобили как пример, чтобы понять, как агенты ИИ на основе визуальных данных выполняют описанные выше три основных шага:
- Восприятие: Агенты ИИ на основе визуальных данных в беспилотных автомобилях собирают визуальные данные с камер и датчиков, установленных на транспортном средстве. Эти данные включают изображения и видео окружающей обстановки, например других автомобилей, пешеходов, светофоров и дорожных знаков.
- Принятие решений: Агент ИИ обрабатывает эти визуальные данные с помощью таких моделей, как Ultralytics YOLO11. Он распознаёт объекты, например автомобили и пешеходов, обнаруживает препятствия или неожиданные перестроения и выявляет закономерности, такие как транспортный поток и состояние сигналов светофора. Это помогает автомобилю понимать дорожную обстановку в реальном времени.
- Действие: На основе анализа агент ИИ предпринимает действия: поворачивает, чтобы объехать препятствие, регулирует скорость или останавливается на красный сигнал светофора. Эти решения принимаются быстро, чтобы обеспечить безопасное и эффективное движение.
Беспилотные автомобили Waymo — отличный пример этой технологии. Они используют агентов ИИ на основе визуальных данных, чтобы понимать окружающую обстановку, принимать решения в реальном времени и безопасно и эффективно передвигаться по дорогам без участия человека.

Рис. 3. Беспилотное такси Waymo на базе агента ИИ.
Типы агентов ИИ на основе визуальных данных#
Теперь, когда мы увидели, как работают агенты ИИ и как они используют компьютерное зрение, давай рассмотрим различные типы агентов ИИ. Каждый тип предназначен для конкретных задач — от простых действий до более сложного принятия решений и обучения.
Агенты простого рефлекса#
Агенты простого рефлекса — самый базовый тип агентов ИИ. Они реагируют на определённые входные данные заранее заданными действиями, основываясь исключительно на текущей ситуации и не учитывая историю или будущие последствия. Обычно такие агенты используют простые правила «если — то», которые определяют их поведение.
В контексте анализа изображений агента простого рефлекса можно запрограммировать на обнаружение определённого цвета, например красного, и запуск немедленного действия, такого как выделение или подсчёт красных объектов. Хотя это может работать для простых задач, в более сложных средах такой подход неэффективен, поскольку агент не учится и не адаптируется на основе предыдущего опыта.
Агенты рефлекса на основе модели#
Агенты рефлекса на основе модели более продвинуты, чем агенты простого рефлекса, поскольку используют внутреннюю модель окружающей среды для более глубокого понимания ситуации. Эта модель позволяет им работать с отсутствующей или неполной информацией и принимать более обоснованные решения.
Рассмотрим, например, системы камер безопасности с ИИ. Интегрированные в них агенты ИИ на основе визуальных данных могут использовать компьютерное зрение для анализа происходящего в реальном времени. Они могут сравнивать движения и действия с моделью нормального поведения, что помогает им точнее обнаруживать необычную активность, например кражи в магазинах, и отмечать потенциальные угрозы безопасности.

Рис. 4. Пример использования компьютерного зрения для обнаружения краж.
Агенты на основе полезности#
Рассмотрим дрон на основе полезности, используемый для мониторинга посевов. Он корректирует траекторию полёта, чтобы охватить большую площадь и обойти препятствия, а также выбирает оптимальный маршрут для выполнения задачи. Это означает, что дрон оценивает несколько возможных действий — например, какую область считать приоритетной или как эффективно проложить маршрут — и выбирает то, которое максимизирует его эффективность.
Аналогичным образом, агенты на основе полезности предназначены для выбора оптимального действия из нескольких вариантов, чтобы достичь наибольшей пользы или наилучшего результата. Агенты ИИ на основе визуальных данных, разработанные для этой цели, могут обрабатывать и анализировать различные визуальные входные данные, например изображения или данные датчиков, и выбирать наиболее полезный результат на основе заранее заданных критериев.

Рис. 5. Дроны на основе полезности можно использовать для мониторинга посевов.
Агенты на основе целей#
Агенты на основе целей похожи на агентов на основе полезности, поскольку оба типа стремятся достичь конкретных целей. Однако агенты на основе целей сосредоточены исключительно на действиях, которые приближают их к заданной цели. Они оценивают каждое действие по тому, насколько оно помогает достичь цели, не учитывая другие факторы, такие как общая ценность или компромиссы.
Например, беспилотный автомобиль действует как агент на основе целей, когда его задача — добраться до пункта назначения. Он обрабатывает данные с камер ИИ и датчиков, чтобы принимать решения: объезжать препятствия, соблюдать сигналы светофора и выбирать правильные повороты для движения по маршруту. Эти решения полностью определяются тем, насколько хорошо они соответствуют цели безопасно и эффективно добраться до места назначения. В отличие от агентов на основе полезности, агенты на основе целей сосредоточены только на достижении цели и не учитывают дополнительные критерии, такие как эффективность или оптимизация.

Рис. 6. Беспилотный автомобиль, использующий компьютерное зрение для идентификации объектов в окружающей обстановке.
Обучающиеся агенты#
Если ты знаком с компьютерным зрением, то, возможно, слышал о дообучении — процессе, в котором модели улучшаются, обучаясь на новых данных. Обучающиеся агенты работают похожим образом: они адаптируются и совершенствуются со временем по мере накопления опыта. В приложениях, таких как контроль качества на основе визуальных данных, эти агенты с каждой проверкой всё лучше обнаруживают дефекты. Эта способность улучшать свои результаты особенно важна в таких сферах, как авиация, где критически необходимы безопасность и точность.
Иерархические агенты#
Иерархические агенты упрощают сложные задачи, разбивая их на небольшие, более управляемые этапы. Агент верхнего уровня контролирует весь процесс и принимает стратегические решения, а агенты нижнего уровня выполняют конкретные задачи. Такой подход более эффективен для операций, включающих множество этапов и требующих детального выполнения.
Например, на автоматизированном складе робот верхнего уровня может спланировать процесс сортировки, определяя, в какие зоны направить те или иные товары. Одновременно роботы нижнего уровня сосредоточены на идентификации товаров с помощью компьютерного зрения, анализируют такие признаки, как размер, форма или маркировка, и распределяют товары по соответствующим контейнерам. Чёткое разделение обязанностей помогает системе работать без сбоев.

Рис. 7. Пример роботизированного агента ИИ, сортирующего посылки.
Как начать создавать агента ИИ на основе визуальных данных#
Основой агента ИИ со зрительными возможностями является модель компьютерного зрения. Одна из новейших и наиболее надёжных доступных сегодня моделей компьютерного зрения — Ultralytics YOLO11. YOLO11 известна эффективностью и точностью в реальном времени, поэтому идеально подходит для задач компьютерного зрения.
Ниже перечислены различные процессы, необходимые для создания собственного агента ИИ с возможностями Ultralytics YOLO11:
-
Подготовь датасет: собери и предварительно обработай размеченные изображения, относящиеся к задаче, которую будет выполнять твой агент ИИ.
-
Дообучи модель: обучи Ultralytics YOLO11 на своём датасете, чтобы повысить её точность и производительность для конкретного приложения.
-
Интегрируй с платформой принятия решений: подключи обученную модель к системе, которая позволит агенту ИИ принимать решения на основе визуальных входных данных.
-
Протестируй и улучши: разверни агента ИИ, проверь его производительность, собери обратную связь и скорректируй модель, чтобы повысить точность и надёжность.
Основные выводы#
Агенты ИИ, интегрированные с компьютерным зрением, — агенты ИИ на основе визуальных данных — меняют отрасли, автоматизируя задачи, ускоряя процессы и улучшая принятие решений. От умных городов, регулирующих движение, до систем безопасности с распознаванием лиц — эти агенты предлагают новые решения распространённых проблем.
Они также могут постоянно учиться и совершенствоваться, что делает их полезными в меняющихся условиях. Благодаря таким инструментам, как Ultralytics YOLO11, создавать и использовать этих агентов ИИ стало проще, что позволяет разрабатывать более интеллектуальные и эффективные решения.
Присоединяйся к нашему сообществу и загляни в наш репозиторий GitHub, чтобы узнать больше об ИИ. Изучи различные варианты применения компьютерного зрения в здравоохранении и ИИ в сельском хозяйстве на страницах наших решений. Ознакомься с доступными вариантами лицензирования, чтобы начать!






