Multimodal RAG
استكشف استرجاع الجيل المعزز متعدد الوسائط (Multimodal RAG) لمعالجة النص والصور والفيديو. تعلم كيف يعزز Ultralytics YOLO26 خطوط أنابيب استرجاع الذكاء الاصطناعي للحصول على استجابات أكثر دقة ووعيًا بالسياق.
الاسترجاع المعزز بالتوليد متعدد الوسائط (Multimodal RAG) هو إطار عمل متقدم للذكاء الاصطناعي (AI) يوسع أنظمة RAG التقليدية لمعالجة والتدبر عبر أنواع بيانات متنوعة، مثل النصوص، والصور، والفيديو، والصوت. وفي حين أن أنظمة الاسترجاع المعزز بالتوليد (RAG) القياسية تحسن دقة نموذج اللغة الكبير (LLM) عن طريق استرجاع مستندات نصية ذات صلة، فإن Multimodal RAG يمكن النماذج من "الرؤية" و"السمع" عبر استرجاع السياق من قاعدة معرفية مختلطة الوسائط. هذا النهج يثبت عملية توليد النموذج في أدلة بصرية أو سمعية ملموسة، مما يقلل بشكل كبير من الهلوسة في نماذج LLMs ويمكن من مهام معقدة مثل الإجابة على الأسئلة المرئية عبر مجموعات البيانات الخاصة. ومن خلال الاستفادة من التعلم متعدد الوسائط، يمكن لهذه الأنظمة تجميع المعلومات من استعلام المستخدم (مثل النص) والأصول المسترجعة (مثل رسم بياني أو إطار مراقبة) لإنتاج استجابات شاملة وواعية بالسياق.
كيف يعمل Multimodal RAG#
تعكس هندسة نظام Multimodal RAG عادةً خط أنابيب "الاسترجاع ثم التوليد" القياسي ولكنها تكيّفه للبيانات غير النصية. تعتمد هذه العملية بشكل كبير على قواعد بيانات المتجهات والمساحات الدلالية المشتركة.
-
الفهرسة: تتم معالجة البيانات من مصادر مختلفة - ملفات PDF، ومقاطع الفيديو، والعروض التقديمية. تقوم نماذج استخراج الميزات بتحويل هذه الوسائط المختلفة إلى متجهات رقمية عالية الأبعاد تُعرف باسم التضمينات (embeddings). على سبيل المثال، يقوم نموذج مثل OpenAI's CLIP بمحاذاة تضمينات الصور والنصوص بحيث تكون صورة الكلب وكلمة "كلب" متقاربين رياضياً.
-
الاسترجاع: عندما يطرح المستخدم سؤالاً (على سبيل المثال، "أرني العيب في لوحة الدوائر هذه"), يقوم النظام بإجراء بحث دلالي عبر قاعدة بيانات المتجهات للعثور على الصور أو مقاطع الفيديو الأكثر صلة والتي تتطابق مع نية الاستعلام.
-
التوليد: يتم تغذية السياق البصري المسترجع إلى نموذج الرؤية واللغة (VLM). يعالج نموذج VLM كلاً من موجه نص المستخدم وميزات الصورة المسترجعة لتوليد إجابة نهائية، مما يتيح "الدردشة" بفعالية مع البيانات.
تطبيقات العالم الحقيقي#
يعمل Multimodal RAG على تحويل الصناعات من خلال تمكين وكلاء الذكاء الاصطناعي (AI agents) من التفاعل مع العالم المادي من خلال البيانات المرئية.
- الصيانة الصناعية والتصنيع: في مجال الذكاء الاصطناعي في التصنيع، يمكن للمنهجيين الاستعلام عن النظام باستخدام صورة لقطعة آلة مكسورة. يقوم نظام Multimodal RAG باسترجاع سجلات صيانة تاريخية مماثلة، ومخططات تقنية، ودروس فيديو توجيهية لإرشاد عملية الإصلاح. هذا يقلل من وقت التوقف عن العمل ويضفي طابع الديمقراطية على المعرفة الخبيرة.
- اكتشاف قطاع التجزئة والتجارة الإلكترونية: تسمح التطبيقات التي تستخدم الذكاء الاصطناعي في قطاع التجزئة للعملاء بتحميل صورة لزي يعجبهم. يسترجع النظام عناصر مشابهة بصريًا من المخزون الحالي ويولد نصائح حول تنسيق المظهر أو مقارنات المنتجات، مما يخلق تجربة تسوق مخصصة للغاية.
التمييز بين المصطلحات ذات الصلة#
لفهم المجال المحدد لـ Multimodal RAG، من المفيد تمييزه عن المفاهيم ذات الصلة:
- Multimodal RAG مقابل نموذج متعدد الوسائط: ينشئ النموذج متعدد الوسائط (مثل GPT-4o أو Gemini) الاستجابة. بينما Multimodal RAG هو البنية الأساسية التي تغذي هذا النموذج ببيانات خارجية وخاصة (صور، مستندات) لم يتم التدريب عليها. النموذج هو المحرك؛ وRAG هو خط الوقود.
- Multimodal RAG مقابل الضبط الدقيق (Fine-Tuning): يقوم الضبط الدقيق بتحديث أوزان النموذج بشكل دائم لتعلم مهمة أو نمط جديد. بينما توفر تقنية RAG معرفة مؤقتة في وقت الاستدلال. تُفضل تقنية RAG للبيانات الديناميكية (مثل المخزون اليومي) حيث يكون إعادة التدريب المتكرر غير عملي.
التنفيذ باستخدام Ultralytics#
يمكن للمطورين بناء مكون الاسترجاع الخاص بخط أنابيب Multimodal RAG باستخدام Ultralytics YOLO. من خلال اكتشاف وتصنيف الكائنات داخل الصور، يوفر YOLO بيانات وصفية منظمة يمكن فهرستها للبحث النصي أو استخدامها لاقتصاص مناطق الصور ذات الصلة لنموذج VLM. تتيح منصة Ultralytics (Ultralytics Platform) تبسيط تدريب هذه النماذج المرئية المتخصصة للتعرف على كائنات مخصصة بالغة الأهمية لمجالك المحدد.
يوضح المثال التالي استخدام YOLO26 لاستخراج السياق البصري (الكائنات المكتشفة) من صورة، والتي يمكن بعد ذلك تمريرها إلى نموذج LLM كجزء من سير عمل RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personمزيد من القراءة والموارد#
- توثيق LangChain: دليل شامل لبناء خطوط أنابيب الاسترجاع، بما في ذلك الدعم متعدد الوسائط.
- دليل LlamaIndex متعدد الوسائط: توثيق مفصل حول فهرسة واسترجاع أنواع البيانات المعقدة لنماذج LLM.
- بحث Google Cloud Vertex AI: إمكانيات بحث متجهة على مستوى المؤسسات لبناء تطبيقات RAG قابلة للتوسع.
- حلول Ultralytics: استكشف كيف تدمج رؤية الكمبيوتر مع أنظمة الذكاء الاصطناعي الأوسع عبر مختلف الصناعات.






