CLIP (Contrastive Language-Image Pre-training)
استكشف CLIP (التدريب المسبق التبايني للغة والصورة) لربط الرؤية باللغة. تعلّم كيف يتيح التعلّم صفري اللقطة ويدعم Ultralytics YOLO26.
CLIP (التدريب المسبق التبايني للغة والصورة) هو بنية شبكة عصبية ثورية طوّرتها OpenAI، وتعمل على سد الفجوة بين البيانات المرئية واللغة الطبيعية. وعلى خلاف أنظمة الرؤية الحاسوبية (CV) التقليدية التي تتطلب وسم البيانات المكثف للعمالة ضمن مجموعة ثابتة من الفئات، يتعلم CLIP فهم الصور من خلال التدريب على ملايين أزواج الصور والنصوص المُجمّعة من الإنترنت. يتيح هذا النهج للنموذج تنفيذ التعلم الصفري، أي يمكنه تحديد الكائنات أو المفاهيم أو الأنماط التي لم يرها صراحةً أثناء التدريب، وذلك بمجرد قراءة وصف نصي. ومن خلال إسقاط المعلومات المرئية واللغوية في فضاء ميزات مشترك، يعمل CLIP بوصفه نموذجًا أساسيًا قويًا لمجموعة واسعة من المهام اللاحقة، من دون الحاجة إلى الضبط الدقيق المكثف الخاص بكل مهمة.
كيفية عمل البنية#
تتضمن الآلية الأساسية لـ CLIP مُرمّزين متوازيين: مُرمّزًا للصور، يستند عادةً إلى محوّل الرؤية (ViT) أو ResNet، وTransformer للنص مشابهًا لتلك المستخدمة في نماذج اللغة الكبيرة (LLMs) الحديثة. ومن خلال عملية تُعرف باسم التعلم التبايني، يُدرَّب النظام على التنبؤ بمقطع النص المطابق لكل صورة ضمن الدفعة.
أثناء التدريب، يحسّن النموذج معلماته لتقريب تضمينات المتجهات لأزواج الصور والنصوص المتطابقة، مع إبعاد الأزواج غير المتطابقة بعضها عن بعض. وينشئ ذلك فضاءً كامنًا متعدد الوسائط، حيث يقع التمثيل الرياضي لصورة «كلب جولدن ريتريفر» مكانيًا بالقرب من تضمين النص «صورة لكلب». ومن خلال حساب التشابه الجيبي بين هذه المتجهات، يستطيع النموذج قياس مدى توافق الصورة مع مطالبة باللغة الطبيعية، مما يتيح تصنيف الصور واسترجاعها بمرونة.
التطبيقات الواقعية#
لقد جعلت القدرة على الربط بين الرؤية واللغة من CLIP تقنية محورية في تطبيقات الذكاء الاصطناعي الحديثة:
- البحث الدلالي الذكي: يتيح CLIP للمستخدمين البحث في قواعد بيانات الصور الكبيرة باستخدام استعلامات معقدة لمعالجة اللغة الطبيعية (NLP). فعلى سبيل المثال، في الذكاء الاصطناعي في قطاع التجزئة، يمكن للمتسوق البحث عن «فستان صيفي زهري بطابع عتيق» واسترجاع نتائج دقيقة بصريًا، حتى إذا لم تتضمن الصور وسوم البيانات الوصفية المحددة تلك. وغالبًا ما تدعم ذلك قواعد بيانات المتجهات عالية الأداء.
- التحكم في الذكاء الاصطناعي التوليدي: تعتمد نماذج مثل Stable Diffusion على CLIP لتفسير مطالبات المستخدمين وتوجيه عملية التوليد. ويعمل CLIP بوصفه مقيّمًا، إذ يقوّم مدى توافق الناتج المرئي المُولَّد مع الوصف النصي، وهو أمر ضروري لتوليد النص إلى الصورة عالي الجودة.
- اكتشاف الكائنات ذي المفردات المفتوحة: تدمج البنى المتقدمة مثل YOLO-World تضمينات CLIP لاكتشاف الكائنات استنادًا إلى مدخلات نصية عشوائية. ويتيح ذلك الاكتشاف الديناميكي في مجالات مثل الذكاء الاصطناعي في الرعاية الصحية، حيث يلزم تحديد المعدات أو الحالات الشاذة الجديدة من دون إعادة التدريب.
استخدام ميزات CLIP مع Ultralytics#
في حين تقتصر كاشفات الكائنات القياسية على الفئات التي تدربت عليها، يتيح استخدام الميزات المستندة إلى CLIP الاكتشاف ذي المفردات المفتوحة. يوضح كود Python التالي كيفية استخدام الحزمة ultralytics لاكتشاف الكائنات باستخدام مطالبات نصية مخصصة:
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model utilizing CLIP features
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])
# Run inference on an image to detect the text-defined objects
results = model.predict("travelers.jpg")
# Display the results
results[0].show()التمييز بين المفاهيم ذات الصلة#
من المفيد التمييز بين CLIP ونماذج الذكاء الاصطناعي الشائعة الأخرى لفهم فائدته المحددة:
- CLIP مقابل التعلم الخاضع للإشراف: تتطلب النماذج التقليدية الخاضعة للإشراف تعريفات دقيقة وأمثلة موسومة لكل فئة (مثل «قطة» و«سيارة»). يتعلم CLIP من أزواج النصوص والصور الخام الموجودة على الويب، مما يوفر مرونة أكبر ويزيل عنق الزجاجة المتمثل في التعليق اليدوي، والذي تُدار عملياته غالبًا باستخدام أدوات مثل Ultralytics Platform.
- CLIP مقابل YOLO26: بينما يوفر CLIP فهمًا عامًا للمفاهيم، فإن YOLO26 كاشف متخصص للكائنات في الوقت الفعلي، ومُحسّن للسرعة وتحديد المواقع بدقة. وغالبًا ما يُستخدم CLIP مستخرجًا للميزات أو مُصنِّفًا صفري اللقطات، في حين أن YOLO26 هو المحرك المسؤول عن الاستدلال في الوقت الفعلي عالي السرعة في بيئات الإنتاج.
- CLIP مقابل التعلم التبايني القياسي: تقارن أساليب مثل SimCLR عمومًا بين نسختين معززتين من الصورة نفسها لتعلم الميزات. أما CLIP فيقارن الصورة بوصف نصي، رابطًا بين نمطي بيانات متميزين بدلًا من نمط واحد فحسب.









