Multimodal AI
استكشف الذكاء الاصطناعي متعدد الوسائط وكيف يدمج النص والرؤية لفهم يراعي السياق. وتعلّم استخدام Ultralytics YOLO26 والنماذج ذات المفردات المفتوحة اليوم.
يشير الذكاء الاصطناعي متعدد الوسائط إلى فئة متقدمة من أنظمة الذكاء الاصطناعي (AI) المصممة لمعالجة المعلومات وتفسيرها وتركيبها من أنواع متعددة ومختلفة من البيانات، أو «الوسائط»، في الوقت نفسه. وعلى خلاف الأنظمة أحادية الوسيط التقليدية التي تتخصص في مصدر إدخال واحد—مثل معالجة اللغة الطبيعية (NLP) للنصوص أو الرؤية الحاسوبية (CV) للصور—يحاكي الذكاء الاصطناعي متعدد الوسائط الإدراك البشري من خلال دمج تدفقات بيانات متنوعة. ويمكن أن يشمل هذا الدمج الجمع بين البيانات المرئية (الصور والفيديو) والبيانات اللغوية (النصوص والصوت المنطوق) والمعلومات الحسية (LiDAR والرادار والبيانات الحرارية). ومن خلال الاستفادة من هذه المدخلات المدمجة، تحقق هذه النماذج فهمًا أعمق وأكثر وعيًا بالسياق للسيناريوهات المعقدة في العالم الحقيقي، مقتربةً من القدرات الواسعة لـالذكاء الاصطناعي العام (AGI).
كيفية عمل الأنظمة متعددة الوسائط#
تكمن القوة الأساسية للذكاء الاصطناعي متعدد الوسائط في قدرته على إسقاط أنواع مختلفة من البيانات في فضاء رياضي مشترك، حيث يمكن مقارنتها ودمجها. وتتضمن هذه العملية عادةً ثلاث مراحل رئيسية: الترميز، والمحاذاة، والدمج.
-
استخراج السمات: تعالج الشبكات العصبية المتخصصة كل وسيط على حدة لتحديد الأنماط الرئيسية. فعلى سبيل المثال، قد تستخرج الشبكة العصبية الالتفافية (CNN) السمات المرئية من صورة فوتوغرافية، بينما يعالج Transformer التعليق المصاحب.
-
المحاذاة والتضمينات: تُحوَّل السمات المستخرجة إلى متجهات عددية عالية الأبعاد. ويتعلم النموذج محاذاة هذه المتجهات بحيث تتموضع المفاهيم المتشابهة دلاليًا (مثل صورة قطة وكلمة «قطة» في النص) بالقرب من بعضها بعضًا في فضاء المتجهات. وغالبًا ما يتحقق ذلك باستخدام تقنيات مثل التعلم التبايني، وهي طريقة استُخدمت على نحو بارز في نماذج مثل CLIP من OpenAI.
-
دمج البيانات: يدمج النظام البيانات المتحاذية باستخدام تقنيات الدمج المتقدمة. وتستخدم البنى الحديثة آليات الانتباه لترجيح أهمية أحد الوسائط مقارنةً بوسيط آخر ديناميكيًا، اعتمادًا على السياق، مما يتيح للنموذج التركيز على النص عندما تكون الصورة ملتبسة، أو العكس.
التطبيقات الواقعية#
أتاح الذكاء الاصطناعي متعدد الوسائط إمكانات كانت مستحيلة سابقًا باستخدام الأنظمة أحادية الوسيط، مما يدفع عجلة الابتكار في مختلف الصناعات.
- الإجابة عن الأسئلة المرئية (VQA): في هذا التطبيق، يمكن للمستخدم عرض صورة على نظام ذكاء اصطناعي وطرح أسئلة باللغة الطبيعية عنها. فعلى سبيل المثال، قد يحمّل مستخدم يعاني ضعف البصر صورة لمخزن مؤن ويسأل: «هل تبقى لديّ أي معكرونة؟» يعالج النموذج المحتوى المرئي والاستعلام النصي لتقديم إجابة محددة.
- المركبات ذاتية القيادة: تعتمد السيارات ذاتية القيادة اعتمادًا كبيرًا على المدخلات متعددة الوسائط، إذ تجمع البيانات من الكاميرات وسُحب نقاط LiDAR والرادار للتنقل بأمان. ويضمن هذا التكرار أنه إذا تعطل أحد المستشعرات (مثل كاميرا حجبتها وهج الشمس)، فيمكن للمستشعرات الأخرى الحفاظ على معايير السلامة التي تحددها جمعية مهندسي السيارات (SAE).
- التشخيص الطبي: تحلل أنظمة الذكاء الاصطناعي الطبية المتقدمة الصور الطبية (مثل صور التصوير بالرنين المغناطيسي أو الأشعة السينية) إلى جانب التاريخ المرضي النصي غير المنظم للمريض والبيانات الجينية. وتساعد هذه الرؤية الشاملة الأطباء على إجراء تشخيصات أكثر دقة، وهو موضوع يُناقش كثيرًا في Nature Digital Medicine.
- الذكاء الاصطناعي التوليدي: تعتمد الأدوات التي تنشئ صورًا من مطالبات نصية، مثل Stable Diffusion، اعتمادًا كاملًا على قدرة النموذج على فهم العلاقة بين الأوصاف اللغوية والأنسجة المرئية.
الكشف عن المفردات المفتوحة باستخدام Ultralytics#
في حين تعتمد كاشفات الأجسام القياسية على قوائم محددة مسبقًا من الفئات، تتيح الأساليب متعددة الوسائط مثل YOLO-World للمستخدمين اكتشاف الأجسام باستخدام مطالبات نصية ذات مفردات مفتوحة. ويسد ذلك الفجوة بين الأوامر اللغوية والتعرف المرئي ضمن منظومة Ultralytics.
يوضح المثال التالي كيفية استخدام مكتبة ultralytics لإجراء الكشف عن المفردات المفتوحة، حيث يكتشف النموذج الأجسام استنادًا إلى مدخلات نصية مخصصة:
from ultralytics import YOLOWorld
# Load a pretrained YOLO-World model (Multimodal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")
# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person wearing a red hat", "blue backpack"])
# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show the results
results[0].show()التمييز بين المصطلحات ذات الصلة#
للتنقل في مشهد التعلم الآلي الحديث، من المفيد التمييز بين «الذكاء الاصطناعي متعدد الوسائط» والمفاهيم ذات الصلة:
- التعلم متعدد الوسائط: يشير هذا إلى المجال الأكاديمي والمنهجية الخاصة بتدريب الخوارزميات على أنواع مختلطة من البيانات. ويشير «الذكاء الاصطناعي متعدد الوسائط» عمومًا إلى التطبيق العملي أو النظام الناتج نفسه.
- النماذج اللغوية الكبيرة (LLMs): النماذج اللغوية الكبيرة التقليدية أحادية الوسيط، وقد دُرّبت حصريًا على بيانات نصية. إلا أن القطاع يتجه نحو «النماذج الكبيرة متعددة الوسائط» (LMMs) التي تستطيع معالجة الصور والنصوص بشكل أصلي، وهو توجه تدعمه أطر عمل مثل PyTorch وTensorFlow.
- نماذج الرؤية المتخصصة: تُعد نماذج مثل Ultralytics YOLO26 المتطورة حاليًا خبراء متخصصين بدرجة عالية في المهام المرئية. وبينما قد يصف نموذج متعدد الوسائط عام مشهدًا وصفًا واسعًا، تتفوق النماذج المتخصصة في الكشف عن الأجسام عالي السرعة والدقة وفي المعالجة الآنية على الأجهزة الطرفية.
التوقعات المستقبلية#
يشير مسار تطور الذكاء الاصطناعي متعدد الوسائط إلى أنظمة تمتلك قدرات أكبر على الاستدلال. ومن خلال إرساء اللغة بنجاح في الواقع المرئي والمادي، تتجاوز هذه النماذج الارتباط الإحصائي نحو فهم حقيقي. وتواصل الأبحاث التي تجريها مؤسسات مثل Google DeepMind ومركز ستانفورد لأبحاث النماذج الأساسية دفع حدود كيفية إدراك الآلات للبيئات المعقدة.
في Ultralytics، ندمج هذه التطورات في منصة Ultralytics، مما يتيح للمستخدمين إدارة البيانات وتدريب النماذج ونشر الحلول التي تستفيد من النطاق الكامل للوسائط المتاحة، مع الجمع بين سرعة YOLO26 وتعدد استخدامات المدخلات متعددة الوسائط.









