Multi-Modal Model
استكشف كيفية دمج النماذج متعددة الوسائط للنصوص والصور والصوت. وتعرّف على بنيات مثل Ultralytics YOLO26 وانشر ذكاءً اصطناعيًا للرؤية على منصة Ultralytics.
النموذج متعدد الوسائط هو نوع متقدم من أنظمة الذكاء الاصطناعي (AI) القادرة على معالجة المعلومات من أنواع بيانات متعددة أو «وسائط» متعددة، وتفسيرها ودمجها في الوقت نفسه. وبينما تتخصص الأنظمة أحادية الوسيط التقليدية في مجال واحد—مثل معالجة اللغة الطبيعية (NLP) للنصوص أو الرؤية الحاسوبية (CV) للصور—تهدف النماذج متعددة الوسائط إلى محاكاة الإدراك البشري من خلال توليف الإشارات البصرية والسمعية واللغوية معًا. ويتيح هذا التقارب للنموذج تكوين فهم شامل للعالم، ما يمكّنه من استنتاج ارتباطات معقدة بين مشهد بصري ووصف منطوق. وتُعد هذه القدرات خطوات أساسية نحو تحقيق الذكاء الاصطناعي العام (AGI).
الآليات والبنية الأساسية#
تعتمد فعالية النموذج متعدد الوسائط على قدرته على إسقاط أنواع البيانات المتنوعة في فضاء دلالي مشترك. وتبدأ هذه العملية عادةً بإنشاء التضمينات، وهي تمثيلات رقمية تلتقط المعنى الأساسي لبيانات الإدخال. ومن خلال التدريب على مجموعات بيانات ضخمة من الأمثلة المزدوجة، مثل مقاطع الفيديو المرفقة بترجمات، يتعلم النموذج محاذاة التمثيل المتجهي لصورة «قطة» مع تضمين النص للكلمة «قطة».
تجعل عدة مفاهيم معمارية أساسية هذا التكامل ممكنًا:
- بنية Transformer: تستخدم العديد من الأنظمة متعددة الوسائط المحوّلات، التي توظّف آليات الانتباه لترجيح أهمية الأجزاء المختلفة من الإدخال ديناميكيًا. ويتيح ذلك للنموذج التركيز على مناطق محددة من الصورة تتوافق مع الكلمات ذات الصلة في مطالبة نصية، وهو مفهوم موضّح في الورقة البحثية الرائدة «الانتباه هو كل ما تحتاج إليه».
- دمج البيانات: يشير هذا إلى استراتيجية الجمع بين المعلومات من مصادر مختلفة. ويمكن أن يحدث دمج المستشعرات في مرحلة مبكرة عبر دمج البيانات الخام، أو في مرحلة متأخرة عبر الجمع بين قرارات نماذج فرعية منفصلة. وتوفر أطر العمل الحديثة مثل PyTorch المرونة اللازمة لبناء مسارات العمل المعقدة هذه.
- التعلم التبايني: تعمل التقنيات التي تستخدمها نماذج مثل CLIP من OpenAI على تدريب النظام لتقليل المسافة بين أزواج النصوص والصور المتطابقة في الفضاء المتجهي، مع زيادة المسافة بين الأزواج غير المتطابقة.
التطبيقات الواقعية#
أتاحت النماذج متعددة الوسائط قدرات كان يتعذر على الأنظمة أحادية الوسيط تحقيقها سابقًا.
- الإجابة عن الأسئلة المرئية (VQA): تتيح هذه الأنظمة للمستخدمين طرح أسئلة بلغة طبيعية حول صورة. فعلى سبيل المثال، قد يحمّل مستخدم ضعيف البصر صورة لخزانة مؤن ويسأل: «هل توجد علبة حساء على الرف العلوي؟» ويستخدم النموذج اكتشاف الأجسام لتحديد العناصر وNLP لفهم الاستعلام وتقديم إجابة مفيدة.
- المركبات ذاتية القيادة: تعمل السيارات ذاتية القيادة كوكلاء متعددَي الوسائط في الوقت الفعلي. فهي تجمع بين التدفقات البصرية من الكاميرات، ومعلومات العمق من LiDAR، وبيانات السرعة من الرادار. ويضمن هذا التكرار أنه إذا أعاق الطقس أحد المستشعرات، فبوسع المستشعرات الأخرى الحفاظ على سلامة الطرق.
- الاكتشاف واسع المفردات: تتيح نماذج مثل Ultralytics YOLO-World للمستخدمين اكتشاف الأجسام باستخدام مطالبات نصية عشوائية بدلًا من قائمة ثابتة من الفئات. ويسد ذلك الفجوة بين الأوامر اللغوية والتعرّف البصري.
مثال: الاكتشاف واسع المفردات#
يوضح المثال التالي كيفية استخدام مكتبة ultralytics لإجراء اكتشاف واسع المفردات، حيث يفسر النموذج المطالبات النصية لتحديد الأجسام في صورة:
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing a hat", "blue backpack"])
# Run inference: The model aligns text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Visualize the detection results
results[0].show()الفروق عن المصطلحات ذات الصلة#
من المفيد التمييز بين «النموذج متعدد الوسائط» والمفاهيم ذات الصلة في مسرد الذكاء الاصطناعي:
- التعلم متعدد الوسائط: يشير هذا إلى العملية وتقنيات التعلم الآلي (ML) المستخدمة لتدريب هذه الأنظمة. أما النموذج متعدد الوسائط فهو المنتج البرمجي أو الأثر الناتج عن عملية التعلم تلك.
- نماذج اللغة الكبيرة (LLMs): تعالج نماذج LLMs التقليدية النصوص فقط. وبينما يتطور كثير منها إلى نماذج الرؤية واللغة (VLMs)، يظل نموذج LLM القياسي أحادي الوسيط.
- النماذج الأساسية: هذه فئة أوسع تصف النماذج واسعة النطاق القابلة للتكييف مع العديد من المهام اللاحقة. ورغم أن النموذج متعدد الوسائط يكون غالبًا نموذجًا أساسيًا، فإن النماذج الأساسية لا تتعامل جميعها مع وسائط متعددة.
مستقبل الذكاء الاصطناعي متعدد الوسائط#
يتقدم هذا المجال بسرعة نحو أنظمة قادرة على معالجة تدفقات مستمرة من الصوت والفيديو والنص في الوقت الفعلي. وتواصل الأبحاث التي تجريها مؤسسات مثل Google DeepMind توسيع حدود الإدراك الآلي. وفي Ultralytics، ندعم هذا النظام البيئي باستخدام ركائز رؤية عالية الأداء مثل YOLO26. أُطلق YOLO26 في عام 2026، ويوفر سرعة ودقة فائقتين لمهام مثل تجزئة المثيلات، ليعمل مكوّنًا بصريًا فعالًا ضمن مسارات عمل متعددة الوسائط أكبر. ويمكن للمطورين إدارة البيانات والتدريب والنشر لمسارات العمل المعقدة هذه باستخدام منصة Ultralytics الموحدة.









