Humanity's Last Exam (HLE)
İnsanlığın Son Sınavı’nın (HLE) neleri ölçtüğünü, yapay zekâ ölçütünün uzman düzeyinde akıl yürütme ve güven puanlarını nasıl değerlendirdiğini ve sonuçlarının neleri ortaya koyup neleri koymadığını öğren.
İnsanlığın Son Sınavı (HLE), doğrulanabilir yanıtları olan zor sorularla uzman düzeyindeki akademik bilgi ve akıl yürütme becerisini ölçen bir yapay zekâ kıyaslamasıdır. Bunu, genel kültür sınavından ziyade pek çok uzmanlık alanını kapsayan zorlu bir sınav gibi düşünebilirsin. Yapay zekâ sistemlerinin zorlu problemleri nerede çözebildiğini ve akıcı, kendinden emin yanıtların hataları nerede gizlediğini ortaya çıkarmaya yardımcı olur. (labs.scale.com)
İnsanlığın Son Sınavı Nasıl Çalışır?#
HLE bir kıyaslama veri kümesidir: sistemleri tanımlanmış koşullar altında karşılaştırmak için kullanılan standartlaştırılmış bir koleksiyon. Yapay Zekâ Güvenliği Merkezi ve Scale AI tarafından geliştirilen, ilk hâliyle tamamlanmış kamuya açık koleksiyon; matematik, doğa bilimleri, mühendislik ve beşerî bilimler dâhil 100'den fazla konu alanına yayılan 2.500 soru içerir. (agi.safe.ai)
Sorular çoktan seçmeli maddeler ve kısa yanıtlı problemler içerir. Kapalı uçludurlar; yani çözüme ulaşmak ciddi bir akıl yürütme gerektirse bile doğru yanıt kontrol edilebilir. Uzman katkı sunanlar ve inceleyenler, zorluk düzeyinin ve yanıt kalitesinin belirlenmesine yardımcı olur. HLE çok modludur: bazı sorular yalnızca dili işlemeyi değil, metinle birlikte görselleri yorumlamayı gerektirir. (labs.scale.com)
Bu nedenle HLE, dili işleyip üreten büyük dil modelleri ve görsel işleyebilen sistemler açısından önem taşır. Görsel soruları, bir sistemin görsel hakkındaki soruları yanıtladığı görsel soru yanıtlama alanıyla kesişir. Ancak bir diyagramdaki bileşenleri tanımak, uzmanlık gerektiren bir akademik problemi çözmenin yalnızca bir parçasıdır. (labs.scale.com)
Puanları ve Güveni Anlama#
İki ölçüm özellikle önemlidir:
- Yanıt doğruluğu: Doğru yanıtlanan soruların oranı. Açıklamadaki her adımın sağlam olup olmadığını değil, doğru yanıtların oranını ölçer.
- Güven kalibrasyonu: Güven düzeyinin gözlemlenen doğrulukla ne ölçüde örtüştüğü. İyi kalibre edilmiş bir sistemde, %80 güven atanan yanıtların yaklaşık %80'i doğru olmalıdır. (scikit-learn.org)
HLE değerlendirmelerinde nihai bir yanıt ve güven tahmini istenebilir. Bunlar farklı özellikleri ölçer: Bir sistem, yanlış yanıt verdiğinde aşırı güvenli kalırken doğruluğunu artırabilir. Bu nedenle belirtilen güven yüzdesi, otomatik olarak güvenilir bir olasılık anlamına gelmez. (agi.safe.ai)
HLE değerlendirme metodolojisini incelerken soru sürümünü, yalnızca metin içeren ve çok modlu kapsamı, istemleri ve puanlama sürecini kontrol et. Harici araçlara izin verilip verilmediğini de kontrol et; araç destekli ve araçsız sonuçlar farklı sistemleri tanımlar. (labs.scale.com)
HLE'nin İlgili Kavramlardan Farkı#
HLE, birçok sistem bir testin tavan puanına yakın puan aldığında ve test bu sistemlerin yeteneklerini ayırt etmede daha az işe yarar hâle geldiğinde ortaya çıkan kıyaslama doygunluğunu ele alır. Daha zor sorular, farklılıkları ölçmek için daha fazla alan sağlar. Adı bu hedefi yansıtır; yapay zekâ değerlendirmesinin bu sınavla sona erdiği anlamına gelmez. (labs.scale.com)
HLE, görevler genelinde geniş çapta uygulanabilen zekâ anlamına gelen yapay genel zekânın kanıtı değildir. Akademik sorulara verilen güçlü yanıtlar; özerk keşfi, güvenilir planlamayı veya güvenli davranışı kanıtlamaz. NIST Yapay Zekâ Risk Yönetimi Çerçevesi, güvenilirlik ve bağlama özgü risk gibi daha geniş kapsamlı konuları ele alır. (agi.safe.ai)
HLE, görsellerdeki nesneleri tanımlayan ve konumlarını belirleyen nesne tespitinden de farklıdır. Akademik sorulardaki yanıt doğruluğu, bir tespit modelinin dağıtım ortamındaki görsellerde doğru nesneleri bulup bulmadığının ölçülmesinin yerini tutamaz. (docs.ultralytics.com)
İki Pratik Uygulama Örneği#
Bilimsel asistan seçimi. İleri düzey fizik problemlerini açıklayacak bir asistan seçen bir ekibi düşün. HLE, akademik yetkinliğe ilişkin ilk izlenimi sağlayabilir; ancak ekip, kendi çalışmalarından temsilî sorularla da test yapmalıdır. Kendinden emin ama yanlış bir yanıt hesaplamaları veya deneyleri yanlış yönlendirebilir; bu nedenle uzman incelemesi önemini korur. Bunu, belirli bir asistanın uygun olduğunun kanıtı değil, bir ön eleme örneği olarak değerlendir. (agi.safe.ai)
Görsel mühendislik desteği. Ekipman diyagramlarını yorumlayan bir asistanı düşün. HLE'nin görsel tabanlı soruları, sembolleri görmenin ve aralarındaki ilişkileri anlamanın neden ayrı zorluklar olduğunu gösterir. Bir sistem bir bileşeni doğru tanımlasa bile çalışma biçimi hakkında yanlış çıkarım yapabilir. Bu nedenle değerlendirme, yalnızca görsel tanımayı değil, yorumlar ve sonuçlar dâhil görevin tamamını kapsamalıdır. (labs.scale.com)
Pratik Değerlendirme Rehberi#
Eğitim, doğrulama ve test kümelerini ayrı tutarak değerlendirme bütünlüğünü koru. Değerlendirme bilgilerinin model geliştirmeyi etkileyip performansın genelleme başarısından daha iyi görünmesine yol açtığı veri sızıntısından kaçın. HLE'nin kamuya açık soruları, daha önce görülmüş olma ihtimali açısından benzer bir özen gerektirir. (developers.google.com)
Bilgisayarlı görü için, akıl yürütme kıyaslamalarının yanı sıra göreve özgü değerlendirmeler kullan. ultralytics kurduktan sonra, belgelenmiş bu Ultralytics YOLO doğrulama iş akışı, YOLO26 modelini küçük COCO8 örnek veri kümesinde değerlendirir: (docs.ultralytics.com)
from ultralytics import YOLO
if __name__ == "__main__":
model = YOLO("yolo26n.pt")
# Tespitleri veri kümesinin doğrulama etiketleriyle karşılaştır.
metrics = model.val(data="coco8.yaml")
# Tespit modelinin konum belirleme ve sınıflandırma metriğini raporla.
print("mAP50-95:", metrics.box.map)Çıktı, HLE puanı değil, çeşitli sınırlayıcı kutu örtüşme eşikleri genelinde ortalama ortalama hassasiyettir. COCO8 iş akışını gösterir; dağıtımın anlamlı biçimde değerlendirilmesi için uygulamayı temsil eden ve eğitimde kullanılmamış veriler gerekir. Temel ders, her performans iddiasını gerçekten test edilen yetenekle eşleştirmektir. (docs.ultralytics.com)









