YOLO Vision 2026:
Назад к глоссарию Ultralytics

Group Relative Policy Optimization (GRPO)

Открой для себя метод оптимизации групповой относительной политики (GRPO). Узнай, как этот эффективный по памяти RL-алгоритм без критика улучшает рассуждения LLM и сокращает затраты на обучение.

Group Relative Policy Optimization (GRPO) — это эффективный по памяти алгоритм обучения с подкреплением, разработанный для улучшения возможностей рассуждения больших языковых моделей (LLM) и более широких систем искусственного интеллекта (AI). Впервые представленный в работе DeepSeekMath 2024 года, GRPO совершенствует традиционные методы оптимизации, устраняя необходимость в отдельной сети оценок (модели-критике). Вместо этого алгоритм нормализует награды группы сгенерированных ответов, полученных из одного и того же промпта. Оценивая ответы относительно их сородичей внутри группы, GRPO значительно снижает вычислительные затраты при одновременном повышении производительности в сложных задачах рассуждения в современных архитектурах глубокого обучения (DL).

Чем GRPO отличается от PPO#

Хотя GRPO имеет сходства с Proximal Policy Optimization (PPO) — стандартным алгоритмом оптимизации, часто используемым в обучении с подкреплением на основе отзывов людей (RLHF), эти два метода существенно различаются по архитектуре. PPO требует наличия вторичной модели-«критика», которая работает параллельно с основной сетью политик для оценки ценности заданного состояния. Это почти удваивает объем памяти, требуемый на этапе обучения.

В отличие от этого, GRPO является алгоритмом без критика. Путем сэмплирования нескольких выводов для одного промпта и их оценки с помощью системы вознаграждения на основе правил или верификатора, GRPO вычисляет преимущество путем нормализации оценок внутри этой конкретной группы. Такое относительное сравнение служит базовой линией, экономя огромные объемы памяти, которые занимала бы сеть оценок, и ускоряя общее обучение модели.

Реальные применения GRPO#

GRPO стал причиной нескольких недавних прорывов в генеративном ИИ и обработке естественного языка. Два примечательных приложения включают в себя:

  1. Модели математических рассуждений: В широко цитируемом релизе DeepSeek-R1 и DeepSeekMath алгоритм GRPO использовался для стимулирования моделей к развитию длинных рассуждений по цепочке мыслей и самопроверке, что соответствует производительности проприетарных моделей вроде OpenAI o1. Вознаграждая правильные финальные ответы и форматирование, алгоритм позволил модели органично находить продвинутые стратегии решения задач без масштабной тонкой настройки на аннотированных человеком данных.
  2. Генерация кода и агентская логика: Для моделей, пишущих код или поддерживающих автономные агентские воркфлоу, оценка абсолютной правильности представляет собой сложную задачу. GRPO позволяет моделям обучаться путем выполнения вариаций кода и их относительной оценки на основе успешности компиляции или пройденных тестов, что ускоряет развертывание высоконадежных ИИ-ассистентов для программирования.

Внедрение концепций GRPO в PyTorch#

По своей сути GRPO вычисляет относительное преимущество ответов, нормализуя их награды. Вот базовая реализация на PyTorch, демонстрирующая эту нормализацию с использованием стандартных тензорных операций:



def compute_grpo_advantages(rewards):
    # 'rewards' is a tensor of shape (batch_size, group_size)
    group_mean = rewards.mean(dim=1, keepdim=True)
    group_std = rewards.std(dim=1, keepdim=True)

    # Normalize rewards within the group to calculate relative advantages
    advantages = (rewards - group_mean) / (group_std + 1e-8)
    return advantages

Развитие ИИ с помощью интеллектуальной оптимизации#

Подобно тому как GRPO переосмысливает эффективность генерации текста, передовые методы машинного обучения (ML) постоянно преобразуют визуальное восприятие. Оптимизация архитектур и функций потерь позволяет разработчикам создавать более легкие и быстрые модели во всех областях.

Для современных задач компьютерного зрения изучение сквозных оптимизаций имеет не менее важное значение. Например, Ultralytics YOLO26 представляет архитектуру, изначально не использующую NMS, и гибридные оптимизаторы, вдохновленные исследованиями LLM, что значительно улучшает развертывание на периферийных устройствах. Разработчики, желающие задействовать эффективные воркфлоу компьютерного зрения, могут легко создавать, обучать и развертывать модели с помощью платформы Ultralytics Platform. Этот облачный инструмент упрощает сложное управление датасетами и настройку гиперпараметров для надежных приложений визуализации в реальном времени.

Explore solutions

Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения