Group Relative Policy Optimization (GRPO)
Grup Göreli Politika Optimizasyonu (GRPO), LLM'lerin akıl yürütme yeteneğini geliştirmek için her yanıtı kendi grubuna göre puanlayan, eleştirmen gerektirmeyen bir RL yöntemidir. PPO ile karşılaştırır.
Grup Göreli Politika Optimizasyonu (GRPO), Büyük Dil Modellerinin (LLM) ve daha geniş Yapay Zekâ (AI) sistemlerinin akıl yürütme becerilerini geliştirmek için tasarlanmış, bellek açısından verimli bir pekiştirmeli öğrenme algoritmasıdır. İlk kez 2024 tarihli DeepSeekMath makalesinde tanıtılan GRPO, ayrı bir değer ağına (eleştirmen modele) duyulan ihtiyacı ortadan kaldırarak geleneksel optimizasyon yöntemlerini geliştirir. Bunun yerine aynı istemden türetilen bir grup yanıtın ödüllerini normalleştirir. Yanıtları grup içindeki diğer yanıtlarla karşılaştırarak değerlendiren GRPO, modern Derin Öğrenme (DL) mimarilerindeki karmaşık akıl yürütme görevlerinde performansı artırırken hesaplama yükünü önemli ölçüde azaltır.
GRPO, PPO'dan Nasıl Ayrılır?#
GRPO, pekiştirmeli insan geri bildiriminde (RLHF — insan geri bildiriminden pekiştirmeli öğrenme) sık kullanılan standart bir optimizasyon algoritması olan Yakınsal Politika Optimizasyonu (PPO) ile benzerlikler taşısa da mimari açısından önemli ölçüde farklıdır. PPO, belirli bir durumun değerini tahmin etmek için ana politika ağıyla paralel çalışan ikincil bir "eleştirmen" modeli gerektirir. Bu, eğitim aşamasında gereken belleği neredeyse iki katına çıkarır.
Buna karşılık GRPO, eleştirmen kullanmayan bir algoritmadır. Tek bir istem için birden fazla çıktı örnekleyip bunları kural tabanlı bir ödül sistemi veya doğrulayıcıyla puanlayan GRPO, belirli grup içindeki puanları normalleştirerek avantajı hesaplar. Bu göreli karşılaştırma temel çizgi işlevi görür; böylece bir değer ağının kullanacağı devasa bellek miktarından tasarruf edilir ve genel model eğitimi hızlanır. Bir GRPO güncellemesi şu adımları izler:
GRPO'nun Gerçek Dünyadaki Uygulamaları#
GRPO, üretken yapay zekâ ve doğal dil işleme alanlarında yakın zamanda kaydedilen çeşitli atılımlara katkıda bulundu. Öne çıkan iki uygulaması şunlardır:
- Matematiksel Akıl Yürütme Modelleri: Çokça atıfta bulunulan DeepSeek-R1 sürümünde ve DeepSeekMath'te GRPO, modellerin uzun düşünce zincirleriyle akıl yürütme ve kendi yanıtlarını doğrulama becerilerini teşvik etmek için kullanıldı ve OpenAI'nin o1'i gibi tescilli modellerle aynı performansa ulaştı. Doğru nihai yanıtları ve biçimlendirmeyi ödüllendiren algoritma, modelin insan eliyle açıklama eklenmiş veriler üzerinde kapsamlı ince ayar yapmadan gelişmiş problem çözme stratejilerini kendiliğinden keşfetmesini sağladı.
- Kod Üretimi ve Ajan Tabanlı Mantık: Kod yazan veya otonom ajan iş akışlarına güç veren modellerde mutlak doğruluğu değerlendirmek zordur. GRPO, modellerin kod çeşitlerini çalıştırıp derleme başarısına veya geçilen testlere göre bunları göreli biçimde puanlayarak öğrenmesini sağlar ve son derece güvenilir yapay zekâ kodlama asistanlarının dağıtımını hızlandırır.
PyTorch ile GRPO Kavramlarını Uygulama#
GRPO, yanıtların göreli avantajını temel olarak ödüllerini normalleştirerek hesaplar. Standart tensor işlemlerini kullanarak bu normalleştirme işlemini gösteren temel bir PyTorch uygulaması şöyle:
def compute_grpo_advantages(rewards):
# 'rewards', (batch_size, group_size) boyutlarında bir tensördür
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Göreli avantajları hesaplamak için ödülleri grup içinde normalize et
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesAkıllı Optimizasyonla Yapay Zekâyı İleriye Taşımak#
GRPO'nun metin üretimi verimliliğini yeniden tanımlaması gibi, gelişmiş Makine Öğrenmesi (ML) teknikleri de görsel algıyı sürekli yeniden şekillendiriyor. Mimarileri ve kayıp fonksiyonlarını optimize etmek, geliştiricilerin tüm alanlarda daha hafif ve hızlı modeller oluşturmasını sağlar.
En gelişmiş bilgisayarlı görü görevleri için uçtan uca optimizasyonları incelemek de aynı derecede önemlidir. Örneğin Ultralytics YOLO26, bire bir başlığıyla (nms=False) yerel uçtan uca ve NMS kullanmayan çıkarımı destekler; ayrıca LLM araştırmalarından esinlenen hibrit optimize edicilerle eğitilerek uçta dağıtımı kolaylaştırır. Verimli bilgisayarlı görü iş akışlarından yararlanmak isteyen geliştiriciler, Ultralytics Platformu ile modelleri kolayca oluşturabilir, eğitebilir ve dağıtabilir. Bu bulut tabanlı araç, sağlam ve gerçek zamanlı görüntü uygulamaları için karmaşık veri kümesi yönetimini ve hiperparametre ayarlamayı kolaylaştırır.










