One-Shot Learning
استكشف التعلّم من لقطة واحدة في الذكاء الاصطناعي. وتعلّم كيفية تصنيف الكائنات من صورة واحدة باستخدام Ultralytics YOLO26 والشبكات السيامية لتحقيق رؤية حاسوبية فعّالة.
التعلُّم بمثال واحد هو تقنية متخصصة في التصنيف ضمن التعلُّم الآلي (ML)، صُمِّمت لتعلُّم معلومات حول فئات الكائنات من مثال تدريبي واحد. وعلى خلاف خوارزميات التعلُّم العميق (DL) التقليدية، التي تتطلب [مجموعات بيانات](https://ultralytics-translation-2.invalid ضخمة تحتوي على آلاف الصور المشروحة للتعميم بفعالية، يحاكي التعلُّم بمثال واحد القدرةَ الإدراكية البشرية على استيعاب مفهوم جديد فورًا. فعلى سبيل المثال، يستطيع الشخص عادةً التعرّف إلى طائر غريب محدد بعد رؤيته مرة واحدة فقط؛ وتسعى هذه المنهجية إلى محاكاة تلك الكفاءة في أنظمة الذكاء الاصطناعي (AI). وتكتسب هذه المنهجية قيمة خاصة في السيناريوهات التي يكون فيها وسم البيانات مكلفًا، أو تكون البيانات نادرة، أو يلزم إضافة فئات جديدة ديناميكيًا من دون إعادة تدريب النموذج بأكمله.
الآليات الكامنة وراء المفهوم#
يتمثل المبدأ الأساسي للتعلُّم بمثال واحد في تحويل الهدف من التصنيف القياسي إلى تقييم التشابه. فبدلًا من تدريب شبكة عصبية (NN) لإخراج تسمية فئة محددة (مثل "كلب" أو "قطة")، يتعلم النموذج دالة مسافة. ومن البنى الشائعة المستخدمة لهذا الغرض الشبكة العصبية السيامية، التي تتألف من شبكتيْن فرعيتيْن متطابقتيْن تشتركان في أوزان النموذج نفسها.
أثناء التشغيل، تنفذ الشبكة استخراج السمات لتحويل الصور المُدخلة إلى متجهات عددية مدمجة تُعرف باسم التضمينات. ثم يقارن النظام تضمين صورة استعلام جديدة بتضمين "المثال" المرجعي الوحيد. فإذا كانت المسافة الرياضية—التي تُحسب غالبًا باستخدام المسافة الإقليدية أو التشابه الجيبي—أقل من عتبة معينة، عُدَّت الصورتان من الفئة نفسها. ويتيح ذلك للنموذج التحقق من الهوية أو تصنيف الكائنات استنادًا إلى قربها في فضاء السمات المتعلَّمة.
يوضح كود Python التالي كيفية استخراج التضمينات وحساب التشابه باستخدام نموذج تصنيف YOLO26 من الحزمة ultralytics.
import numpy as np
from ultralytics import YOLO
# Load a pre-trained YOLO26 classification model for feature extraction
model = YOLO("yolo26n-cls.pt")
# Extract embeddings for a reference 'shot' and a query image
# The embed() method returns the feature vector directly
shot_vec = model.embed("reference_img.jpg")[0]
query_vec = model.embed("query_img.jpg")[0]
# Calculate similarity (higher dot product implies greater similarity)
similarity = np.dot(shot_vec, query_vec) / (np.linalg.norm(shot_vec) * np.linalg.norm(query_vec))
print(f"Similarity Score: {similarity:.4f}")تمييز النماذج ذات الصلة#
من المهم التمييز بين التعلُّم بمثال واحد وتقنيات التعلُّم الأخرى الكفؤة من حيث البيانات، إذ تحل مشكلات متشابهة من خلال قيود مختلفة:
- التعلُّم بعدد قليل من الأمثلة (FSL): هذه هي الفئة الأوسع التي يندرج تحتها التعلُّم بمثال واحد. في FSL، يُزوَّد النموذج بمجموعة "دعم" صغيرة من الأمثلة، تتراوح عادةً بين صورتين وخمس صور لكل فئة. والتعلُّم بمثال واحد هو ببساطة الحالة القصوى التي يكون فيها حجم مجموعة الدعم مساويًا لمثال واحد تمامًا.
- التعلُّم من دون أمثلة (ZSL): يتعامل ZSL مع التعرّف إلى فئات لم يرَها النموذج بصريًا من قبل. وبدلًا من صورة مرجعية، يعتمد ZSL على السمات الدلالية أو الأوصاف النصية (مثل تحديد "حمار وحشي" من خلال ربط السمات البصرية بالوصف النصي "حصان مخطط") عبر معالجة اللغة الطبيعية (NLP).
- التعلُّم بالنقل: يتضمن ذلك أخذ نموذج مُدرَّب مسبقًا على قاعدة بيانات كبيرة مثل ImageNet وضبطه على مهمة جديدة. وبينما يوفّر التعلُّم بالنقل مستخرجات السمات المستخدمة في التعلُّم بمثال واحد، فإن التعلُّم بالنقل القياسي يتطلب عادةً أكثر من مثال واحد لتحديث الأوزان بفعالية من دون فرط التكيّف.
التطبيقات الواقعية#
أتاح التعلُّم بمثال واحد إمكانات جديدة في القطاعات التي يتعذر فيها عمليًا جمع كميات هائلة من بيانات التدريب.
التعرّف إلى الوجوه والأمن#
يتمثل التطبيق الأكثر شيوعًا للتعلُّم بمثال واحد في الأمن البيومتري. عند إعداد Face ID على هاتف ذكي أو التسجيل في نظام وصول الموظفين، يلتقط الجهاز تمثيلًا رياضيًا واحدًا لوجه المستخدم. وأثناء الاستخدام اليومي، يقارن نظام التعرّف إلى الوجوه بث الكاميرا المباشر بهذا "المثال الواحد" المخزن للتحقق من الهوية. ويعتمد ذلك على تقنيات تضمين قوية، مثل تلك التي نوقشت في أبحاث FaceNet التأسيسية، لضمان ألا تؤدي التغيّرات في الإضاءة أو الزاوية إلى إفساد مطابقة التشابه.
مراقبة الجودة الصناعية#
في الذكاء الاصطناعي في التصنيع، يصعب إنشاء مجموعة بيانات متوازنة للأجزاء "المعيبة" لأن العيوب نادرة وغير متسقة. يتيح التعلُّم بمثال واحد لأنظمة الرؤية الحاسوبية (CV) تعلُّم تمثيل جزء مرجعي "مثالي" واحد. ويُعلَّم أي عنصر على خط التجميع ينتج تضمينًا بعيدًا بدرجة ملحوظة عن هذا المرجع بهدف اكتشاف الحالات الشاذة. ويتيح ذلك ضمان الجودة الفوري من دون الحاجة إلى آلاف الصور للأجزاء التالفة، ويمكن إدارة هذه العملية ونشرها عبر منصة Ultralytics.
التحديات والتوقعات المستقبلية#
على الرغم من قوة التعلُّم بمثال واحد، فإنه يتأثر بالضوضاء؛ فإذا كانت الصورة المرجعية الوحيدة ضبابية أو محجوبة أو غير ممثلة، تتدهور قدرة النموذج على التعرّف إلى تلك الفئة بدرجة كبيرة. وغالبًا ما يستخدم الباحثون التعلُّم الفوقي، أو "التعلُّم من أجل التعلُّم"، لتحسين استقرار النموذج وقابليته للتعميم. ومع تطور البنى، تدمج نماذج أحدث مثل YOLO26 مستخرجات سمات أكثر متانة تجعل الاستدلال بمثال واحد أسرع وأكثر دقة، مما يمهد الطريق أمام أجهزة الذكاء الاصطناعي الطرفي الأكثر تكيفًا وذكاءً.









