SigLIP
استكشف SigLIP، وهو نهج فعّال من حيث الذاكرة لخسارة سيغمويد لنماذج الرؤية واللغة. تعرّف على كيفية تحسينه للتوسع والتدريب في مشاريع Ultralytics YOLO.
SigLIP، وهو اختصار لـ«خسارة السيغمويد للتدريب التمهيدي للغة والصورة»، نهج عالي الكفاءة لتدريب نماذج الرؤية واللغة. وقد قدّم هذا النهج في الأصل باحثون في Google Research، ويغيّر بصورة جوهرية كيفية تعلّم نماذج الذكاء الاصطناعي للعلاقة بين الصور وأوصافها النصية المقابلة. ومن خلال استبدال دوال الاحتمال التقليدية بنهج أبسط للتصنيف الثنائي، يتيح SigLIP للمطورين تدريب بنيات متعددة الوسائط ضخمة مع استهلاك أقل بكثير للذاكرة وكفاءة حسابية أعلى.
فهم البنية#
في مسارات تعلّم الآلة القياسية التي تجمع بين البيانات المرئية والنصية، تعتمد النماذج عادةً على نظرة شاملة إلى جميع البيانات في دفعة معينة كي تتعلم بصورة صحيحة. ويزيل SigLIP عنق الزجاجة هذا من خلال التعامل مع كل زوج من الصور والنصوص على أنه مسألة تصنيف ثنائي مستقلة. وباستخدام دالة sigmoid قياسية، يتنبأ النموذج ببساطة بما إذا كانت صورة معينة ووصف نصي معين متطابقين أم غير متطابقين.
يعني هذا النهج الموضعي في دالة الخسارة أن الذاكرة المطلوبة أثناء تدريب النموذج تتوسع خطيًا بدلًا من توسعها تربيعيًا. وبالتالي، يستطيع المهندسون استخدام أحجام دفعات أكبر بكثير على تكوينات الأجهزة القياسية التي تدعمها أطر عمل مثل PyTorch، مما يؤدي إلى تحسين الأداء على مجموعات البيانات المتنوعة دون الحاجة إلى زيادات أسية في موارد GPU.
التمييز بين SigLIP وCLIP#
عند استكشاف بنيات الذكاء الاصطناعي الحديثة، من الضروري التمييز بين SigLIP وسلفه، CLIP (التدريب التمهيدي التبايني للغة والصورة).
- CLIP: يعتمد على دالة خسارة softmax، التي تتطلب من النموذج مقارنة صورة واحدة بجميع الأوصاف النصية في الدفعة في الوقت نفسه. وينشئ ذلك عنق زجاجة حادًا في الذاكرة أثناء تدريب التعلّم العميق مع زيادة أحجام الدفعات.
- SigLIP: يستخدم خسارة sigmoid زوجية. ولا يحتاج إلا إلى تقييم ما إذا كان زوج واحد من الصور والنصوص متطابقًا تطابقًا حقيقيًا أو زائفًا، مما يجعله قابلًا للتوسع بدرجة كبيرة وأسهل في التوزيع عبر أجهزة متعددة عند تحسين مسارات عمل الذكاء الاصطناعي.
التطبيقات الواقعية#
يجعل تصميم SigLIP الموفر للذاكرة منه أساسًا قويًا لمجموعة متنوعة من التطبيقات العملية في قطاع التقنية:
- تصنيف الصور دون تدريب مسبق على الفئات: يتفوق SigLIP في تصنيف الصور ضمن فئات جديدة لم يرها صراحةً من قبل أثناء التدريب. ويفيد ذلك بدرجة كبيرة أنظمة تصنيف الصور الديناميكية التي تتغير فئاتها باستمرار، إذ يلغي الحاجة إلى وسم البيانات يدويًا بصورة متواصلة.
- محركات البحث الدلالي: من خلال إنشاء تمثيلات متعددة الوسائط عالية الدقة، يشغّل SigLIP أنظمة استرجاع متقدمة. ويمكن للمستخدمين إدخال استعلامات نصية معقدة للبحث بدقة عالية في قواعد بيانات صور ضخمة وغير منظمة.
عند إدارة البيانات المخصصة لهذه الأنواع من مهام الرؤية المعقدة، تلجأ الفرق غالبًا إلى منصة Ultralytics لتبسيط وسم مجموعات البيانات السحابية ودمج الرؤى النصية والمرئية بسلاسة قبل نشر نماذج متقدمة مثل Ultralytics YOLO26 للاستدلال الطرفي عالي السرعة.
مثال على التنفيذ#
لفهم كيفية حساب SigLIP للخسارة على المستوى الأساسي، يمكنك محاكاة العملية باستخدام عمليات PyTorch الأساسية. يوضح هذا المقتطف كيف يحل النهج القائم على sigmoid محل منطق الاحتمالات التقليدي متعدد الفئات.
import torch
import torch.nn.functional as F
# Simulate image and text embeddings from a vision-language model
image_embeddings = torch.randn(4, 256)
text_embeddings = torch.randn(4, 256)
# Calculate pairwise similarities (logits)
logits = torch.matmul(image_embeddings, text_embeddings.T)
# SigLIP uses a binary formulation: 1 for positive pairs, -1 for negative pairs
labels = torch.eye(4) * 2 - 1
loss = -F.logsigmoid(labels * logits).mean()
print(f"Calculated SigLIP Loss: {loss.item():.4f}")ومن خلال الاستفادة من هذا النهج المبسّط، يواصل مجتمع الذكاء الاصطناعي الأوسع، بما في ذلك الباحثون الذين ينشرون أبحاثهم في مؤسسات مثل IEEE وACM، دفع حدود التعلّم متعدد الوسائط، ووضع نصائح جديدة لتدريب النماذج وأفضل الممارسات للجيل القادم من ذكاء الرؤية الاصطناعي.









