Zero-Shot Learning
استكشف التعلّم من دون أمثلة (ZSL) لاكتشاف الكائنات وتصنيفها من دون بيانات تدريب. تعلّم كيف يتيح Ultralytics YOLO-World اكتشافًا فوريًا بمفردات مفتوحة.
التعلّم من دون أمثلة (ZSL) هو نمط من أنماط تعلّم الآلة يتيح لنماذج الذكاء الاصطناعي التعرّف على الكائنات التي لم تواجهها قط، أو تصنيفها أو اكتشافها، خلال مرحلة التدريب. في التعلّم الخاضع للإشراف التقليدي، يحتاج النموذج إلى آلاف الأمثلة المصنّفة لكل فئة محددة يراد منه التعرّف عليها. يلغي ZSL هذا الاعتماد الصارم من خلال الاستفادة من معلومات مساعدة—تتمثل عادةً في أوصاف نصية أو سمات دلالية أو تضمينات—لسد الفجوة بين الفئات المرئية وغير المرئية. تتيح هذه القدرة لأنظمة الذكاء الاصطناعي (AI) أن تكون أكثر مرونة وقابلية للتوسع بدرجة كبيرة، وأن تتعامل مع البيئات الديناميكية التي يكون فيها جمع بيانات شاملة لكل كائن محتمل أمرًا غير عملي.
كيفية عمل التعلّم من دون أمثلة#
تتمثل الآلية الأساسية لـ ZSL في نقل المعرفة من المفاهيم المألوفة إلى المفاهيم غير المألوفة باستخدام فضاء دلالي مشترك. فبدلًا من تعلّم التعرّف على «حمار وحشي» من خلال حفظ أنماط البكسلات الخاصة بالخطوط السوداء والبيضاء فقط، يتعلّم النموذج العلاقة بين السمات البصرية والسمات الدلالية (مثل «شكل شبيه بالحصان» و«نمط مخطط» و«أربع قوائم») المستمدة من معالجة اللغة الطبيعية (NLP).
تعتمد هذه العملية غالبًا على نماذج متعددة الوسائط توائم بين تمثيلات الصور والنصوص. فعلى سبيل المثال، توضّح أبحاث تأسيسية مثل CLIP من OpenAI كيف يمكن للنماذج تعلّم المفاهيم البصرية من الإشراف باللغة الطبيعية. عندما يواجه نموذج ZSL كائنًا غير مرئي، يستخرج السمات البصرية ويقارنها بقاموس من المتجهات الدلالية. فإذا تطابقت السمات البصرية مع الوصف الدلالي للفئة الجديدة، أمكن للنموذج تصنيفها تصنيفًا صحيحًا، منفّذًا بذلك تنبؤًا «من دون أمثلة». ويُعد هذا النهج أساسيًا في النماذج التأسيسية الحديثة التي تعمم قدراتها عبر مجموعة واسعة من المهام.
التطبيقات الواقعية#
يسهم التعلّم من دون أمثلة في دفع عجلة الابتكار عبر مختلف القطاعات من خلال تمكين الأنظمة من التعميم إلى ما يتجاوز بيانات تدريبها الأولية.
-
كشف الكائنات بالمفردات المفتوحة: تستفيد البنى الحديثة مثل YOLO-World من ZSL لاكتشاف الكائنات استنادًا إلى المطالبات النصية التي يحددها المستخدم. ويتيح ذلك إجراء كشف الكائنات في سيناريوهات يستحيل فيها تحديد قائمة ثابتة من الفئات مسبقًا، مثل البحث عن عناصر محددة في أرشيفات فيديو ضخمة. ويواصل الباحثون في Google Research توسيع حدود هذه القدرات ذات المفردات المفتوحة.
-
التشخيص الطبي: في مجال الذكاء الاصطناعي في الرعاية الصحية، غالبًا ما يكون الحصول على بيانات مصنّفة للأمراض النادرة صعبًا ومكلفًا. ويمكن تدريب نماذج ZSL على الحالات الشائعة وأوصاف الأعراض النادرة الواردة في الأدبيات الطبية الموجودة في قواعد بيانات مثل PubMed، مما يتيح للنظام الإشارة إلى الحالات الشاذة النادرة المحتملة في التصوير الطبي من دون الحاجة إلى مجموعة بيانات ضخمة من الحالات الإيجابية.
-
الحفاظ على الحياة البرية: في مجالَي الذكاء الاصطناعي في الزراعة وعلم البيئة، يُعد تحديد الأنواع المهددة بالانقراض التي نادرًا ما تُصوَّر أمرًا بالغ الأهمية. ويتيح ZSL لخبراء الحفاظ على البيئة اكتشاف هذه الحيوانات باستخدام أوصاف قائمة على السمات ومحددة في قواعد بيانات بيولوجية مثل موسوعة الحياة.
الكشف من دون أمثلة باستخدام Ultralytics#
يُجسّد نموذج Ultralytics YOLO-World تطبيق التعلّم من دون أمثلة عمليًا. فهو يتيح للمستخدمين تحديد فئات مخصصة ديناميكيًا أثناء التشغيل من دون إعادة تدريب النموذج. ويتحقق ذلك من خلال ربط شبكة أساسية قوية للكشف بمرمّز نصي يفهم اللغة الطبيعية.
يوضح مثال Python التالي كيفية استخدام YOLO-World لاكتشاف كائنات لم تكن جزءًا صريحًا من مجموعة تدريب قياسية، وذلك باستخدام الحزمة ultralytics.
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of Zero-Shot Learning
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes via text prompts (e.g., specific accessories)
# The model adjusts to detect these new classes without retraining
model.set_classes(["blue backpack", "red apple", "sunglasses"])
# Run inference on an image to detect the new zero-shot classes
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()التمييز عن المفاهيم ذات الصلة#
لفهم ZSL فهمًا كاملًا، من المفيد تمييزه عن استراتيجيات التعلّم المماثلة المستخدمة في الرؤية الحاسوبية (CV):
- التعلّم من أمثلة قليلة (FSL): بينما لا يتطلب ZSL أي أمثلة من الفئة المستهدفة، يزوّد FSL النموذج بمجموعة دعم صغيرة جدًا (تتراوح عادةً بين مثال واحد و5 أمثلة) للتكيّف. ويُعد ZSL عمومًا أكثر تحديًا لأنه يعتمد كليًا على الاستدلال الدلالي بدلًا من الأمثلة البصرية.
- التعلّم من مثال واحد: هو مجموعة فرعية من FSL يتعلّم فيها النموذج من مثال واحد مصنّف بالضبط. ويختلف ZSL اختلافًا جوهريًا لأنه يعمل من دون صورة واحدة حتى للفئة الجديدة.
- التعلّم بالنقل: يشير هذا المصطلح العام إلى نقل المعرفة من مهمة إلى أخرى. ويُعد ZSL نوعًا محددًا من التعلّم بالنقل يستخدم السمات الدلالية لنقل المعرفة إلى الفئات غير المرئية من دون الحاجة إلى إجراء ضبط دقيق تقليدي على بيانات جديدة.
التحديات والتوقعات المستقبلية#
على الرغم من الإمكانات الهائلة التي يوفرها ZSL، فإنه يواجه تحديات مثل مشكلة تحوّل المجال، حيث لا تتطابق السمات الدلالية التي تعلّمها أثناء التدريب تمامًا مع المظهر البصري للفئات غير المرئية. بالإضافة إلى ذلك، قد تعاني نماذج ZSL من التحيّز، إذ تكون دقة التنبؤ أعلى بكثير للفئات المرئية مقارنةً بالفئات غير المرئية.
تواصل جهات مثل مختبر الذكاء الاصطناعي بجامعة ستانفورد وجمعية IEEE للحاسوب معالجة هذه القيود من خلال الأبحاث. ومع ازدياد متانة أدوات الرؤية الحاسوبية، يُتوقع أن يصبح ZSL ميزة قياسية، مما يقلل الاعتماد على جهود وسم البيانات الضخمة. وبالنسبة إلى الفرق التي تسعى إلى إدارة مجموعات البيانات بكفاءة قبل نشر النماذج المتقدمة، توفر منصة Ultralytics أدوات شاملة لإضافة التعليقات التوضيحية وإدارة مجموعات البيانات.









