Semantic Entropy
Anlambilimsel entropinin, bir LLM'in anlamındaki belirsizliği nasıl ölçtüğünü, çelişen yanıtları nasıl ayırdığını ve daha güvenli yapay zeka değerlendirmesini ve halüsinasyon tespiti nasıl desteklediğini öğren.
Anlamsal entropi, üretken bir yapay zeka modelinin yanıtının anlamı konusunda ne kadar belirsiz olduğunu ölçer. Her ifade çeşidini farklı bir sonuç olarak ele almak yerine, anlamsal olarak eşdeğer yanıtları gruplandırır ve olasılığın ortaya çıkan anlamlar arasında ne kadar geniş bir alana yayıldığını ölçer. Yinelenen yanıtlar tutarlı bir fikri ifade ediyorsa anlamsal entropi düşüktür. Birbiriyle çelişen birkaç fikri destekliyorsa, modelin hangi yanıtın doğru olduğunu bilemeyebileceğini gösteren bir şekilde yüksektir.
Bu ölçüm, serbest biçimli dil üreten ve aynı anlama gelen ifadelerin birçok farklı kelime dizisiyle aktarılabildiği büyük dil modeli (LLM) veya diğer sistemler için özellikle geçerlidir.
Anlamsal Entropi Nasıl Çalışır?#
Entropi, bir olasılık dağılımındaki belirsizliğin genel bir ölçüsüdür: Olasılık tek bir sonuç üzerinde yoğunlaştığında düşük, birkaç sonuç geçerliliğini koruduğunda ise yüksektir. NIST entropi tanımı, temel bilgi teorisi kavramını sağlar. (csrc.nist.gov)
Anlamsal entropi iş akışı tipik olarak dört adım izler:
- Örnekleme kullanarak aynı girdi için birkaç yanıt üretin.
- Aynı anlama gelen yanıtları gruplandırın.
- Her anlamın olasılığını sıklığından veya üretim olasılığından tahmin edin.
- Bu anlamsal gruplar arasındaki entropiyi hesaplayın.
"Paris", "Cevap Paris" ve "Fransa'nın başkenti Paris'tir" ifadeleri örneğin tek bir anlam grubuna aittir. "Lyon" başka bir gruba aittir. Sözcüksel entropi, dört dizeyi de farklı ele alarak belirsizliği abartabilir; anlamsal entropi ise ilk üçünün hemfikir olduğunu fark eder.
Gruplandırma aşaması insan değerlendirmesini, metinsel çıkarımı veya scikit-learn kosinüs benzerliği gibi bir benzerlik ölçüsüyle birleştirilmiş sayısal gömmeleri kullanabilir.
from collections import Counter
from scipy.stats import entropy
# Equivalent answers have already been assigned the same meaning label.
meaning_labels = [
"Paris",
"Paris",
"Paris",
"Lyon",
"Unknown",
]
counts = Counter(meaning_labels)
probabilities = [count / len(meaning_labels) for count in counts.values()]
score = entropy(probabilities, base=2)
print(f"Semantic entropy: {score:.3f} bits")Bu basitleştirilmiş örnek, belgelenmiş SciPy entropi fonksiyonunu kullanır. Bir üretim sisteminde, yanlış gruplama nihai puanı bozabileceğinden anlamsal gruplandırma dikkatle doğrulanmalıdır.
İlgili Kavramlar ve Temel Farklar#
Anlamsal entropi, daha geniş belirsizlik nicelleştirme alanına aittir, ancak yalnızca etiketler, belirteçler veya sayısal tahminler yerine anlamlar üzerindeki belirsizliği ele alır.
- Belirteç entropisi, sonraki belirteç veya tam belirteç dizisi üzerindeki belirsizliği ölçer. Zararsız ifade farklılıklarına yüksek belirsizlik atayabilir.
- Öz-tutarlılık, yinelenen üretimlerin uyumlu yanıtlar üretip üretmediğini kontrol eder. Anlamsal entropi, farklı anlamların göreceli dağılımını temsil ederek bu fikri genişletir.
- Güven genellikle tek bir tahmine eklenen bir puandır. Anlamsal entropi ise bunun yerine birden çok olası üretimi karşılaştırır. Hiçbiri otomatik olarak kalibre edilmiş bir olasılık olarak yorumlanmamalıdır; kalibrasyon gözlemlenen sonuçlara karşı değerlendirilmelidir. (scikit-learn.org)
- Yapay Zekalarda Halüsinasyon, üretilen içeriğin yanlış, desteklenmemiş veya yanıltıcı olduğu bir hatadır. Anlamsal entropi bir uyarı sinyalidir, hatanın kendisi değildir. Model aynı yanlış iddiayı sürekli olarak tekrarlayabileceğinden, düşük entropi doğruluğu kanıtlamazken, yüksek entropi çelişkili yanıtları ortaya çıkarabilir. Dolayısıyla halüsinasyonlar kendine güvenen ve kendi içinde tutarlı kalabilir. (openai.com)
- Anlamsal segmentasyon, her görüntü pikseline bir sınıf atar. "Anlamsal" kelimesini paylaşmasına rağmen, bir bilgisayarlı görü görevidir ve üretilen anlamlar üzerindeki entropi ile ilgisi yoktur.
Gerçek Dünya Uygulamaları#
Soru-cevap asistanları: Bir müşteri destek asistanı yanıt vermeden önce birkaç yanıt örneği alabilir. Çıktılar bir garantinin kazara hasarı kapsayıp kapsamadığı konusunda anlaşmazlığa düşerse, yüksek anlamsal entropi belge getirmeyi, netleştirmeyi veya insan incelemesini tetikleyebilir. Üretim artırılmış oluşturma (RAG) ile birleştirildiğinde, bu, desteklenmeyen bir ilke iddiasının müşteriye ulaşma şansını azaltır.
Görüntü-dil karar desteği: Bir görüntü-dil modeli (VLM), endüstriyel bir görüntüyü yinelenen nesiller boyunca "yüzey korozyonu", "yağ kalıntısı" veya "normal renk solması" gösteriyor şeklinde tanımlayabilir. Yüksek anlamsal entropi, yanlış bir bakım kararına yol açabilecek anlamlı bir anlaşmazlığa işaret eder. Sistem, akıcı bir tanımı kesin olarak ele almak yerine görüntüyü bir denetçiye yönlendirebilir.
Pratik Kullanım ve Sınırlamalar#
Anlamsal entropi, risk tabanlı bir değerlendirme hattının bir bileşeni olarak ele alınmalıdır. Ekipler, daha yüksek puanların kendi alanlarında gerçekten daha fazla hataya karşılık gelip gelmediğini test etmeli, hataların sonuçlarına göre eşikler seçmeli ve bir çekimser kalma veya insan incelemesi yolu bırakmalıdır. NIST Yapay Zeka Risk Yönetimi Çerçevesi Çekirdeği, belirsizliği ölçmeyi ve değerlendirme sonuçlarını devam eden risk izlemeye bağlamayı vurgular. (airc.nist.gov)
Ucu açık üretilen çıktılar için en uygundur. Yapılandırılmış bilgisayarlı görü tahminleri farklı değerlendirme yöntemleri gerektirir: Ultralytics doğrulama modu etiketli verilere karşı performansı ölçerken, anlamsal entropi çok modlu bir bileşen tarafından eklenen herhangi bir serbest metin açıklamasını değerlendirebilir.
Üretim ekipleri ayrıca puan dağılımlarını, hata kategorilerini, gecikmeyi ve girdi verilerindeki değişiklikleri takip etmelidir. Google'ın üretim ML sistemlerini izleme konusundaki kılavuzu, tahmin kayması ve kalite bozulması için günlüğe kaydetme ve uyarı vermeyi önerir. Ultralytics Platform dağıtım izleme, görü modellerini çevreleyen daha geniş açıklama ekleme, eğitim, dağıtım ve izleme iş akışını destekleyebilir. Anlamsal entropi bu iş akışı içindeki belirsiz durumları belirleyebilir, ancak olgu doğrulaması ve temsilci testi esprili olmaya devam etmektedir.






