Linear Probing
تعلّم كيف يقيّم الاستقصاء الخطي التمثيلات المجمدة للذكاء الاصطناعي باستخدام الانحدار اللوجستي، واستخراج السمات، وتضمينات Ultralytics YOLO26 للتعلّم بالنقل.
الاستقصاء الخطي هو تقنية للتقييم والتكييف تقيس مدى فائدة التمثيلات التي تعلمها النموذج، وذلك بتدريب متنبئ خطي بسيط فوق الميزات المجمّدة. يظل المُرمِّز المدرَّب مسبقًا دون تغيير، بينما لا تُلائم البيانات المصنَّفة سوى طبقة خطية—وغالبًا ما يكون ذلك عبر الانحدار اللوجستي للتصنيف. يشير الأداء القوي للاختبار إلى أن التضمينات الخاصة بالمُرمِّز تنظم المفاهيم ذات الصلة مسبقًا، بحيث يمكن فصلها باستخدام حدود قرار بسيطة.
في تعلّم الآلة، لا يرتبط المصطلح بالاستقصاء الخطي في جداول التجزئة، حيث تُفحَص مواقع التخزين المجاورة بعد حدوث تصادم. أما في الذكاء الاصطناعي والتعلّم العميق، فيشير تحديدًا إلى استقصاء تمثيل باستخدام نموذج خطي.
كيفية عمل الاستقصاء الخطي#
تحتوي الشبكة العصبية النموذجية على مُرمِّز أو جذع يحوّل المُدخل الخام إلى متجه ميزات، يتبعه رأس تنبؤ خاص بالمهمة. ويتبع الاستقصاء الخطي أربع خطوات:
- درِّب مُرمِّزًا مسبقًا أو حمّله.
- جمّد معلماته بحيث لا يتمكن التدريب من تحديثها.
- نفّذ استخراج الميزات على أمثلة مصنَّفة.
- درِّب مصنِّفًا خطيًا باستخدام تلك الميزات الثابتة.
بالنسبة إلى التصنيف متعدد الفئات، يكون المسبار عادةً طبقة كثيفة واحدة ذات مخرج softmax أو مصنِّف انحدار لوجستي من scikit-learn. وعلى الرغم من أن الانحدار اللوجستي يتضمن تحويلًا احتماليًا غير خطي، فإن درجات الفئات وحدود القرار فيه دوال خطية لميزات الإدخال.
يشيع استخدام الاستقصاء الخطي بوجه خاص في التعلّم الذاتي الإشراف، حيث يتعلم المُرمِّز من البيانات غير المصنَّفة. ويوضح مثال Keras NNCLR ذلك من خلال تدريب مصنِّف كثيف على ميزات مُرمِّز مجمّد. ونظرًا إلى أن سعة المسبار محدودة، فإنه لا يستطيع بسهولة تعويض ضعف التمثيلات من خلال تعلّم تحويلات غير خطية معقدة.
ما الذي يكشفه أداء المسبار الخطي#
يختبر المسبار الخطي ما إذا كانت المعلومات موجودة في التمثيل ويمكن الوصول إليها بسهولة في الوقت نفسه. فإذا شكّلت صور القطط والكلاب مجموعات قابلة للفصل في فضاء التضمين، أمكن لمصنِّف خطي التمييز بينها باستخدام عدد قليل من المعلمات القابلة للتدريب. أما إذا كانت المعلومات مُرمَّزة ضمن ترتيب أكثر تعقيدًا، فقد ينجح مصنِّف غير خطي حتى عندما يكون أداء المسبار الخطي ضعيفًا.
لذلك ينبغي التعامل مع دقة المسبار بوصفها أداة تشخيصية، لا مقياسًا شاملًا لجودة النموذج. ويمكن أن تتأثر بما يلي:
- طبقة المُرمِّز المحددة وبُعد التضمين.
- دقة الإدخال والمعالجة المسبقة.
- حجم بيانات التدريب المصنَّفة وتوازنها.
- التنظيم المطبَّق على النموذج الخطي.
- تسرُّب البيانات بين مجموعتي التدريب والتقييم.
استخدم مجموعة بيانات تحقق محتجزة، ويُفضَّل إنشاؤها باستخدام إجراء قابل لإعادة الإنتاج ومُقسَّم طبقيًا، مثل أداة تقسيم التدريب والاختبار في scikit-learn. وإلى جانب الدقة، يمكن أن يكشف تقرير مقاييس التصنيف عن الفئات التي لا يفصلها التمثيل باستمرار.
الاستقصاء الخطي مقابل الأساليب ذات الصلة#
ينتمي الاستقصاء الخطي إلى العائلة الأوسع لأساليب النقل وتقييم التمثيلات، إلا أن عدة فروق مهمة تستحق الانتباه:
- الاستقصاء الخطي مقابل الضبط الدقيق: لا يحدّث المسبار سوى الرأس الخطي. أما الضبط الدقيق فيحدّث بعض أوزان المُرمِّز أو كلها، ما يمنح النموذج مرونة أكبر، لكنه يتطلب موارد حسابية إضافية ويزيد خطر فرط التكيّف. ويصف دليل TensorFlow للتعلّم بالنقل تجميد نموذج أساسي قبل إلغاء تجميده اختياريًا لإجراء الضبط الدقيق.
- الاستقصاء الخطي مقابل استخراج الميزات: ينتج استخراج الميزات التضمينات، بينما يدرّب الاستقصاء الخطي متنبئًا على تلك التضمينات ويقيّمه.
- الاستقصاء الخطي مقابل الانحدار الخطي: يتنبأ الانحدار الخطي بقيم مستمرة. أما مجسات التصنيف فتتنبأ عمومًا بفئات منفصلة باستخدام الانحدار اللوجستي أو طبقة softmax.
- الاستقصاء الخطي مقابل التقييم بأقرب جار: يتعلم المسبار الخطي حدود الفئات. أما أساليب أقرب جار فتصنّف العينات وفقًا للتضمينات المخزنة القريبة منها، من دون تعلّم تلك الحدود. ويطلق دليل PyTorch للتعلّم بالنقل على سير العمل ذي المُرمِّز المجمّد والمرتبط بذلك اسم مستخرج ميزات ثابت.
الاستقصاء الخطي باستخدام Ultralytics YOLO#
يمكن لـ نموذج تصنيف Ultralytics YOLO26 المدرَّب مسبقًا إنشاء تضمينات للصور من خلال واجهة API الموثَّقة model.embed(). يجمّد المثال التالي المُرمِّز ضمنيًا من خلال الحساب المسبق للميزات، ثم يلاءم مسبارًا خطيًا للتمييز بين القطط والكلاب في CIFAR-10:
import numpy as np
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import accuracy_score
from sklearn.model_selection import train_test_split
from torchvision.datasets import CIFAR10
from ultralytics import YOLO
dataset = CIFAR10(root="data", train=False, download=True)
samples = [(image, label) for image, label in dataset if label in (3, 5)][:400]
images, labels = zip(*samples, strict=True)
encoder = YOLO("yolo26n-cls.pt")
embeddings = encoder.embed(list(images), verbose=False)
features = np.stack([embedding.cpu().numpy() for embedding in embeddings])
x_train, x_test, y_train, y_test = train_test_split(features, labels, test_size=0.25, random_state=42, stratify=labels)
probe = LogisticRegression(max_iter=1000)
probe.fit(x_train, y_train)
predictions = probe.predict(x_test)
print(accuracy_score(y_test, predictions))يتعلم نموذج الانحدار اللوجستي وحده من تسميات القطط والكلاب؛ وتظل أوزان مُرمِّز YOLO26 ثابتة. ويعزل ذلك مدى فائدة تمثيله البصري، بدلًا من قياس قدرته على التكيّف من خلال التدريب الشامل من البداية إلى النهاية.
التطبيقات الواقعية والإرشادات العملية#
-
تقييم التدريب المسبق غير المصنَّف: قد يدرّب فريق روبوتات مُرمِّزًا مسبقًا على كميات كبيرة من فيديوهات المستودعات غير المصنَّفة، ثم يختبر ميزاته باستخدام مجموعة بيانات صغيرة مصنَّفة للرافعات الشوكية والعاملين والمنصات النقالة. وتشير دقة المسبار المرتفعة إلى أن التمثيل قد يدعم تصنيف الصور أو الكشف اللاحق بكمية محدودة من التعليقات التوضيحية.
-
مقارنة الملاءمة للمجال: يمكن لفريق تصوير طبي تجميد عدة مُرمِّزات مرشحة وتدريب مجسات خطية متطابقة لفئات الأنسجة. فإذا كان أداء أحد المُرمِّزات أفضل بكثير ضمن التقسيم والمعالجة المسبقة نفسيهما، فسيكون تمثيله نقطة بداية أقوى للضبط الدقيق لاحقًا.
لإجراء مقارنات عادلة، حافظ على ثبات تقسيم مجموعة البيانات، وطبقة الميزات، والمعالجة المسبقة، والمصنِّف، وإعدادات التحسين. وقيّم كلًا من الاستقصاء الخطي والضبط الدقيق الكامل متى أمكن: إذ يقيس المسبار المعلومات التي يمكن الوصول إليها في الميزات الثابتة، بينما يقيس الضبط الدقيق مدى فعالية تكيّف النموذج الكامل.









