Group Relative Policy Optimization (GRPO)
Оптимизация политики с относительной оценкой в группе (GRPO) — это метод RL без критика, который оценивает каждый ответ относительно ответов группы, улучшая рассуждения LLM. Метод сравнивается с PPO.
Оптимизация политики с учетом относительных преимуществ в группе (GRPO) — алгоритм обучения с подкреплением с эффективным использованием памяти, созданный для улучшения способностей к рассуждению у больших языковых моделей (LLM) и более широкого спектра систем искусственного интеллекта (AI). Впервые представленный в статье DeepSeekMath за 2024 год, GRPO превосходит традиционные методы оптимизации, поскольку не требует отдельной сети ценности (модели-критика). Вместо этого он нормализует вознаграждения для группы ответов, сгенерированных по одному и тому же промпту. Сравнивая ответы друг с другом внутри группы, GRPO значительно снижает вычислительные затраты и повышает производительность современных архитектур глубокого обучения (DL) при решении сложных задач на рассуждение.
Чем GRPO отличается от PPO#
Хотя GRPO похож на проксимальную оптимизацию политики (PPO) — стандартный алгоритм оптимизации, часто используемый в обучении с подкреплением на основе отзывов людей (RLHF), — их архитектуры существенно различаются. Для PPO нужна дополнительная модель-критик, которая работает параллельно с основной сетью политики и оценивает ценность данного состояния. Это почти вдвое увеличивает объем памяти, необходимый на этапе обучения.
В отличие от них, GRPO — алгоритм без критика. Для одного запроса он генерирует несколько вариантов ответа и оценивает их с помощью системы вознаграждений на основе правил или верификатора, а затем вычисляет преимущество, нормализуя оценки внутри конкретной группы. Это относительное сравнение служит базовым уровнем, экономит огромный объём памяти, который иначе занимала бы сеть ценности, и ускоряет общее обучение модели. Одно обновление GRPO состоит из следующих шагов:
Практическое применение GRPO#
GRPO способствовал нескольким недавним прорывам в генеративном ИИ и обработке естественного языка. Вот два примечательных примера:
- Модели математических рассуждений: В широко цитируемой работе DeepSeek-R1 и DeepSeekMath GRPO использовали, чтобы побуждать модели к длинным цепочкам рассуждений и самопроверке; модели достигли уровня закрытых моделей, таких как o1 от OpenAI. Поощряя правильные итоговые ответы и форматирование, алгоритм позволил модели самостоятельно освоить продвинутые стратегии решения задач без масштабной тонкой настройки на данных с разметкой от людей.
- Генерация кода и агентная логика: Для моделей, которые пишут код или управляют автономными агентными рабочими процессами, сложно оценивать абсолютную правильность. GRPO позволяет моделям учиться, выполняя различные варианты кода и сравнивая их результаты по успешности компиляции или пройденным тестам, что ускоряет развертывание надежных ИИ-ассистентов для программирования.
Реализация принципов GRPO в PyTorch#
По сути, GRPO вычисляет относительное преимущество ответов, нормализуя их вознаграждения. Ниже приведена базовая реализация на PyTorch, демонстрирующая такую нормализацию с помощью стандартных операций над тензорами:
def compute_grpo_advantages(rewards):
# 'rewards' — это тензор формы (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Нормализуй вознаграждения внутри группы, чтобы вычислить относительные преимущества
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesРазвиваем ИИ с помощью интеллектуальной оптимизации#
Подобно тому как GRPO повышает эффективность генерации текста, передовые методы машинного обучения (ML) постоянно меняют подходы к визуальному восприятию. Оптимизация архитектур и функций потерь помогает разработчикам создавать более компактные и быстрые модели для любых задач.
Для передовых задач компьютерного зрения не менее важно изучать сквозную оптимизацию. Например, Ultralytics YOLO26 поддерживает изначально сквозной инференс без NMS с головой один-к-одному (nms=False) и обучается с помощью гибридных оптимизаторов, вдохновлённых исследованиями LLM, что упрощает развёртывание на периферийных устройствах. Разработчики могут использовать эффективные рабочие процессы компьютерного зрения, легко создавая, обучая и развёртывая модели с помощью платформы Ultralytics. Этот облачный инструмент упрощает сложное управление наборами данных и настройку гиперпараметров для надёжных приложений компьютерного зрения, работающих в реальном времени.










