Perplexity
تعرف على معنى الحيرة، وكيف تقيس أداء نماذج اللغات، وطريقة حسابها، وأفضل الممارسات لتفسير النتائج.
الارتباك هو مقياس تقييم يقيس مدى جودة تنبؤ النموذج الاحتمالي لتسلسل الرموز. وغالباً ما يُستخدم في نمذجة اللغة، حيث تعني القيمة الأقل أن النموذج يجد النص المقيم أقل إثارة للدهشة. بديهياً، يشير الارتباك البالغ 10 إلى أنه في كل خطوة تنبؤ، يكون النموذج غير مؤكد بالقدر نفسه تقريباً كما لو كان يختيار من بين 10 بدائل متساوية الاحتمال. هذا التفسير تقريبي، لكنه يجعل المقياس أسهل في الفهم.
كيف يعمل الارتباك#
يخصص نموذج اللغة احتمالاً لكل رمز تالٍ محتمل استناداً إلى السياق السابق. وكما هو موضح في مقدمة جوجل لنماذج اللغة، يتنبأ النموذج التراجعي ذاتياً مراراً وتكراراً بالرمز التالي ويضيفه إلى السياق.
يلخص الارتباك الاحتمالات المخصصة للرموز الصحيحة عبر تسلسل التقييم. وهو مستمد من متوسط اللوغاريتم السلبي للاحتمال، والذي يُعبر عنه عادةً بالإنتروبيا المتقاطعة:
- إذا كانت الإنتروبيا المتقاطعة تستخدم اللوغاريتمات الطبيعية، فإن الارتباك هو الأس e مرفوعاً إلى الإنتروبيا المتقاطعة.
- إذا كانت الإنتروبيا المتقاطعة تستخدم اللوغاريتمات الأساس 2، فإن الارتباك هو الأس 2 مرفوعاً إلى الإنتروبيا المتقاطعة.
يقدم مسرد جوجل للتعلم الآلي تفسيراً ذي صلة: يقارب الارتباك عدد التخمينات التي سحتاج إليها النموذج لتضمين التنبؤ الصحيح. وقد تحسب المكتبات ذلك مباشرةً أيضاً، كما يوضح واجهة برمجة تطبيقات ارتباك نموذج لغة NLTK.
يحسب مثال Python البسيط هذا الارتباك من الاحتمالات المخصصة لأربعة رموز صحيحة:
import math
# Probability assigned to the correct token at each position
token_probabilities = [0.50, 0.25, 0.80, 0.40]
negative_log_probs = [-math.log(probability) for probability in token_probabilities]
cross_entropy = sum(negative_log_probs) / len(negative_log_probs)
perplexity = math.exp(cross_entropy)
print(f"Cross-entropy: {cross_entropy:.3f}")
print(f"Perplexity: {perplexity:.3f}")The calculation uses Python's documented math.exp exponential function. In model training code, frameworks such as PyTorch's cross-entropy loss usually calculate the average loss before it is exponentiated.
كيفية تفسير الارتباك#
يشير الارتباك المنخفض عموماً إلى أن النموذج يخصص احتمالات أعلى للرموز المرصودة. ومع ذلك، فإن الرقم لا يكون له معنى إلا ضمن مقارنة خاضعة للرقابة.
فرط أن النموذج أ لديه ارتباك بقيمة 20 والنموذج ب لديه ارتباك بقيمة 30 على بيانات التحقق من الصحة نفسها. يتنبأ النموذج أ بتلك البيانات بشكل أكثر فعالية. وهو لا ينتج بالضرورة إجابات أكثر واقعية، أو فائدة، أو أماناً، أو قابلية للقراءة.
يختلف الارتباك أيضاً عن عدة مفاهيم ذات صلة:
- دالة الخسارة: الإنتروبيا المتقاطعة هي خسارة التدريب أو التقييم الأساسية، بينما الارتباك هو تمثيلها الأسي والأكثر سهولة في الفهم.
- الدقة: تحقق الدقة مما إذا كان التنبؤ المحدد صحيحاً. يقيم الارتباك توزيع الاحتمالات المتنبأ به بالكامل، بما في ذلك مقدار الاحتمال الذي يخصصه النموذج للبدائل.
- الثقة: تصف الثقة عادةً اليقين لتنبؤ واحد. يجمع الارتباك عدم اليقين التنبؤي عبر العديد من مواضع التسلسل.
- جودة التوليد: قد ينتج نموذج منخفض الارتباك نصاً بليغاً ولكنه متكرر أو غير صحيح أو غير مفيد. لا يقيس الارتباك بشكل مباشر الواقعية أو الاستدلال.
التطبيقات الواقعية#
-
النص التنبؤي وتوليد التسلسل: يمكن للمطورين مقارنة نماذج اللغة لاقترحات لوحة المفاتيح، أو النسخ، أو الإكمال التلقائي باستخدام نص محتفظ به من النطاق المقصود. على سبيل المثال، قد يوفر النموذج ذو الارتباك الأقل على المصطلحات الطبية تنبؤات أفضل للرمز التالي في الإملاء السريري. يمكن أن يساعد المقياس في اختيار نموذج قبل تقييم زمن الوصول وقبول المستخدم بشكل منفصل.
-
التعليق على الصور مع الانتباه البصري: غالباً ما يستخدم نظام التعليق على الصور مُشفراً بصرياً يليه مُفكك شفرات لغوي. يمكن أن يقيس الارتباك مدى جودة تفكيك شفرات رموز التعليق المرجعي بالنظر إلى ميزات الصورة. وهذا ذو صلة بـ نماذج الرؤية واللغة، على الرغم من أن الارتباك المنخفض وحده لا يمكنه تحديد ما إذا كان التعليق يحدد كل كائن بشكل صحيح أو يتجنب التفاصيل المهلوسة.
يمكن أن يدعم التقييم القائم على الاحتمالات التشخيصات المتخصصة أيضاً. توضح إرشادات تقييم الاحتمال اللوغاريتمي الخاصة بـ NVIDIA كيفية تجميع احتمالات الرموز في مقاييس مثل الارتباك دون الحاجة إلى توليد حر الشكل.
القيود وأفضل الممارسات#
يجب عدم مقارنة قيم الارتباك عندما تستخدم نماذج مخططات ترميز الرموز مختلفة. يقسّم نموذج مستوى الكلمة، ونموذج مستوى الحرف، والنموذج اللغوي الكبير القائم على الرموز الفرعية الجملة نفسها بشكل مختلف، مما يغير عدد وصعوبة خطوات التنبؤ.
يجب أن تتطابق بيانات التقييم مع النطاق المستهدف أيضاً. قد يحقق النموذج ارتباهاً منخفضاً في المقالات الإخبارية ولكنه يؤدي بشكل سيء في الكود المصدر أو محادثات الدعم الفني. اتبع إرشادات جودة التعلم الآلي المعمول بها باستخدام بيانات تقييم ممثلة ومنفصلة ومعالجة مسبقة متسقة.
في الأنظمة متعددة الوسائط ورؤية الكمبيوتر، اربط الارتباك بالمقاييس الخاصة بالمهمة. يغطي دليل Ultralytics حول تقييم النموذج الضبط الدقيق مقاييس مثل الدقة، والاسترجاع، ومتوسط الدقة للتنبؤات المرئية. معاً، توفر مقاييس اللغة والرؤية تقييماً أكثر اكتمالاً من الارتباك وحده.






