YOLO Vision 2026:
Назад к глоссарию Ultralytics

Agent Evaluation

Узнай, как оценка агентов тестирует ИИ-агенты на успешность выполнения задач, использование инструментов, безопасность, надежность и эффективность в реальных рабочих процессах и взаимодействиях.

Оценка агентов — это систематическое тестирование способности ИИ-агента решать задачи безопасно, корректно и эффективно за одно или несколько взаимодействий. В отличие от обычной оценки моделей, она исследует всю систему целиком: базовую модель, инструкции, память, инструменты, логику управления и среду. Поэтому полезная оценка проверяет не только то, что в итоге говорит или меняет AI agent, но и те действия, которые он совершает по пути.

Как работает оценка агентов#

Оценка начинается с задачи, такой как обработка обращения в службу поддержки, проверка изображения продукта или обновление записи в базе данных. Агент пытается выполнить задачу в контролируемой тестовой среде, создавая трассировку или траекторию: запись сообщений, промежуточных результатов, вызовов инструментов, аргументов, ошибок и изменений состояния.

Затем оценщик сравнивает попытку с заданными критериями успеха. Как поясняется в руководстве по оценке для ИИ-агентов от Anthropic, в качестве оценщиков могут выступать детерминированные программы, судьи на базе моделей или рецензенты-люди. Детерминированные проверки хорошо подходят для проверяемых результатов, таких как создание записи. Оценщики на базе моделей могут оценивать такие качества, как релевантность или тон, но их следует калибровать по оценкам людей.

Набор тестов для оценки обычно содержит множество репрезентативных задач и может повторять каждую задачу несколько раз, поскольку поведение агента может различаться между запусками. Окружающий обвязочный код агента также необходимо учитывать: изменение описаний инструментов, правил памяти или логики повторных попыток может повлиять на производительность, даже если базовая модель останется прежней.

Что измеряет оценка агентов#

Надежный набор тестов объединяет несколько измерений, а не сводит производительность к одной оценке:

  • Успех задачи: достигла ли среда требуемого конечного состояния?
  • Качество использования инструментов: выбрал ли агент правильный инструмент, предоставил ли верные аргументы и правильно ли интерпретировал результат? Метрики оценки агентов от Google включают отдельные показатели для финальных ответов, использования инструментов, траекторий, галлюцинаций и безопасности.
  • Качество траектории: были ли действия релевантными, правильно упорядоченными и достаточно эффективными? Правильный ответ, полученный с помощью небезопасных или неэффективных шагов, все равно может считаться сбоем.
  • Надежность: как часто агент преуспевает при повторных попытках, перефразированных запросах, сложных случаях и сбоях инструментов?
  • Безопасность и соблюдение политик: уважает ли он разрешения, защищает ли конфиденциальные данные и запрашивает ли одобрение перед выполнением судьбоносных действий? Рекомендации по угрозам агентного ИИ от OWASP помогают командам выявлять такие риски, как чрезмерная автономность и небезопасные взаимодействия с инструментами.
  • Операционная производительность: в продакшене имеют значение задержка, использование токенов, количество вызовов инструментов, частота ошибок и стоимость выполнения одной задачи.

Эталонный набор данных, состоящий из проверенных задач, ожидаемых результатов и граничных случаев, обеспечивает стабильный ориентир. Однако его следует дополнять состязательными примерами и сбоями, выявленными в продакшене. Центр ресурсов по искусственному интеллекту NIST относит тестирование, оценку, верификацию, валидацию и непрерывное измерение к более широкой сфере управления рисками ИИ.

Оценка агентов в сравнении со смежными понятиями#

Оценка агентов шире, чем оценка моделей, которая обычно проверяет результаты работы модели на фиксированном наборе данных. Она также отличается от наблюдаемости: наблюдаемость фиксирует то, что произошло в живой системе, в то время как оценка применяет критерии для определения того, было ли такое поведение приемлемым.

Аналогичным образом, red teaming для ИИ активно ищет уязвимые сбои, в то время как рутинная оценка измеряет известные возможности и регрессии на регулярной основе. Агентные рабочие процессы определяют, как выполняются задачи; оценка проверяет, дают ли эти рабочие процессы надежные результаты.

Компонентные тесты по-прежнему ценны. Например, если агент использует зрение через вызов функций и применение инструментов, разработчики должны отдельно валидировать модель компьютерного зрения перед оценкой всего цикла принятия решений.

from ultralytics import YOLO

# Load the agent's visual perception model
model = YOLO("yolo26n.pt")

# Evaluate it against labeled reference data
metrics = model.val(data="coco8.yaml", split="val")

# Report a useful component-level detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")

Этот задокументированный рабочий процесс валидации Ultralytics YOLO измеряет компонент восприятия. Он не устанавливает, выбрал ли агент правильное изображение, правильно ли интерпретировал обнаруженные объекты или предпринял ли он подходящее действие.

Реальные приложения#

  • Визуальный контроль на производстве: агент захватывает изображение продукта, вызывает детектор, проверяет правила качества и направляет сомнительные элементы на ручную проверку. Оценка может подтвердить точность обнаружения дефектов, правильность аргументов инструментов, поведение при эскалации и то, попадают ли отклоненные продукты в очередь на проверку.

  • Горячие линии клиентской поддержки с голосовыми агентами: голосовой агент может аутентифицировать звонящего, извлекать информацию об учетной записи и обрабатывать запрос за несколько шагов. Тесты должны варьировать акценты, прерывания, двусмысленные инструкции и сбои в работе инструментов, измеряя при этом завершенность задач, качество диалога, несанкционированные действия и задержку. Рабочий процесс оценки агентов от Google описывает оценку полных трассировок, а не только финальных ответов.

Создание практического процесса оценки#

Начните с небольшого набора нормальных задач, важных граничных случаев и ранее наблюдавшихся сбоев. Определите наблюдаемые условия успешного прохождения перед запуском агента, а затем объедините детерминированные проверки с проверкой по рубрикам и периодическим экспертным анализом. Повторно запускайте набор тестов всякий раз, когда меняются подсказки, модели, инструменты или навыки агента.

После развертывания объедините офлайн-тесты с выборочным анализом трассировок и мониторингом моделей. Для агентов с поддержкой зрения платформа Ultralytics поддерживает разметку наборов данных, обучение моделей, развертывание и мониторинг служб восприятия, к которым обращаются агенты. Эффективная оценка непрерывна: сбои в продакшене становятся новыми тестовыми примерами, и каждое изменение системы должно демонстрировать улучшение без нарушения устоявшегося поведения.

Explore solutions

Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения