Multimodal RAG
استكشف RAG متعدد الوسائط لمعالجة النصوص والصور والفيديو. وتعلّم كيف يعزز Ultralytics YOLO26 مسارات استرجاع الذكاء الاصطناعي للحصول على استجابات أدق وأكثر مراعاة للسياق.
يُعدّ الاسترجاع والتوليد المعززان متعددا الوسائط (Multimodal RAG) إطارًا متقدمًا في الذكاء الاصطناعي (AI) يوسّع نطاق أنظمة RAG التقليدية لمعالجة أنواع متنوعة من البيانات والاستدلال بشأنها، مثل النصوص والصور والفيديو والصوت. وبينما يحسّن الاسترجاع والتوليد المعززان (RAG) القياسي دقة نموذج اللغة الكبير (LLM) من خلال استرجاع المستندات النصية ذات الصلة، يتيح الاسترجاع والتوليد المعززان متعددا الوسائط للنماذج "الرؤية" و"الاستماع" عبر استرجاع السياق من قاعدة معرفية متعددة الوسائط. ويؤسّس هذا النهج عملية توليد النموذج على أدلة مرئية أو سمعية ملموسة، ما يقلّل بدرجة كبيرة من الهلوسات في نماذج LLM ويمكّن من تنفيذ مهام معقدة، مثل الإجابة عن الأسئلة المرئية ضمن مجموعات بيانات خاصة. ومن خلال الاستفادة من التعلّم متعدد الوسائط، تستطيع هذه الأنظمة توليف المعلومات من استعلام المستخدم (مثل النص) والأصول المسترجعة (مثل مخطط أو إطار من تسجيل للمراقبة) لإنتاج استجابات شاملة وواعية بالسياق.
كيفية عمل الاسترجاع والتوليد المعززين متعددي الوسائط#
تعكس بنية نظام الاسترجاع والتوليد المعززين متعددي الوسائط عادةً مسار العمل القياسي "الاسترجاع ثم التوليد"، لكنها تكيّفه مع البيانات غير النصية. وتعتمد هذه العملية بدرجة كبيرة على قواعد البيانات المتجهية والفضاءات الدلالية المشتركة.
-
الفهرسة: تُعالَج البيانات من مصادر متنوعة—مثل ملفات PDF ومقاطع الفيديو وعروض الشرائح. وتحول نماذج استخراج السمات هذه الأنماط المختلفة إلى متجهات عددية عالية الأبعاد تُعرف باسم التضمينات. فعلى سبيل المثال، يعمل نموذج مثل CLIP من OpenAI على محاذاة تضمينات الصور والنصوص بحيث تكون صورة كلب وكلمة "dog" متقاربتين رياضيًا.
-
الاسترجاع: عندما يطرح المستخدم سؤالًا (مثل: "أرني العيب الموجود في لوحة الدوائر هذه")، يُجري النظام بحثًا دلاليًا عبر قاعدة البيانات المتجهية للعثور على الصور أو مقاطع الفيديو الأكثر صلةً، والتي تتوافق مع مقصد الاستعلام.
-
التوليد: يُمرَّر السياق المرئي المسترجع إلى نموذج الرؤية واللغة (VLM). ويعالج VLM كلًا من المطالبة النصية للمستخدم وسمات الصورة المسترجعة لتوليد إجابة نهائية، فيحاكي بذلك إجراء "محادثة" مع البيانات.
التطبيقات الواقعية#
يُحدث الاسترجاع والتوليد المعززان متعددا الوسائط تحولًا في الصناعات، إذ يمكّن وكلاء الذكاء الاصطناعي من التفاعل مع العالم المادي من خلال البيانات المرئية.
- الصيانة الصناعية والتصنيع: في مجال الذكاء الاصطناعي في التصنيع، يستطيع الفنيون الاستعلام من نظام باستخدام صورة لجزء مكسور من آلة. ويسترجع نظام الاسترجاع والتوليد المعززين متعددي الوسائط سجلات صيانة تاريخية مشابهة، ومخططات فنية، ودروسًا تعليمية بالفيديو لتوجيه عملية الإصلاح. ويقلّل ذلك من وقت التوقف ويتيح نشر المعرفة المتخصصة.
- اكتشاف المنتجات في قطاع التجزئة والتجارة الإلكترونية: تتيح التطبيقات التي تستخدم الذكاء الاصطناعي في قطاع التجزئة للعملاء تحميل صورة لملابس أعجبتهم. ويسترجع النظام عناصر متشابهة بصريًا من المخزون الحالي، ويولّد نصائح لتنسيق الملابس أو مقارنات بين المنتجات، ما يوفّر تجربة تسوق شديدة التخصيص.
تمييز المصطلحات ذات الصلة#
لفهم المجال المتخصص للاسترجاع والتوليد المعززين متعددي الوسائط، من المفيد تمييزه عن المفاهيم ذات الصلة:
- الاسترجاع والتوليد المعززان متعددا الوسائط مقابل النموذج متعدد الوسائط: ينشئ النموذج متعدد الوسائط (مثل GPT-4o أو Gemini) الاستجابة. أما الاسترجاع والتوليد المعززان متعددا الوسائط فهو البنية التي تزوّد ذلك النموذج ببيانات خارجية خاصة (صور ومستندات) لم يُدرَّب عليها. النموذج هو المحرك؛ والاسترجاع والتوليد المعززان هو خط الوقود.
- الاسترجاع والتوليد المعززان متعددا الوسائط مقابل الضبط الدقيق: يحدّث الضبط الدقيق أوزان النموذج تحديثًا دائمًا لتعلّم مهمة أو أسلوب جديد. أما الاسترجاع والتوليد المعززان فيوفّر معرفة مؤقتة أثناء الاستدلال. ويُفضَّل الاسترجاع والتوليد المعززان للبيانات الديناميكية (مثل المخزون اليومي)، عندما تكون إعادة التدريب المتكررة غير عملية.
التنفيذ باستخدام Ultralytics#
يمكن للمطورين إنشاء مكوّن الاسترجاع في مسار عمل الاسترجاع والتوليد المعززين متعددي الوسائط باستخدام Ultralytics YOLO. فمن خلال اكتشاف الكائنات داخل الصور وتصنيفها، يوفّر YOLO بيانات وصفية منظمة يمكن فهرستها للاسترجاع القائم على النصوص أو استخدامها لاقتصاص مناطق الصور ذات الصلة لصالح VLM. وتبسّط منصة Ultralytics تدريب نماذج الرؤية المتخصصة هذه للتعرّف على الكائنات المخصصة المهمة لمجالك المحدد.
يوضح المثال التالي استخدام YOLO26 لاستخراج السياق المرئي (الكائنات المكتشفة) من صورة، والذي يمكن بعد ذلك تمريره إلى LLM باعتباره جزءًا من سير عمل RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personقراءات وموارد إضافية#
- وثائق LangChain: دليل شامل لإنشاء مسارات الاسترجاع، بما في ذلك دعم الوسائط المتعددة.
- دليل LlamaIndex متعدد الوسائط: وثائق تفصيلية حول فهرسة أنواع البيانات المعقدة واسترجاعها لصالح نماذج LLM.
- بحث Google Cloud Vertex AI: إمكانات بحث متجهي بمستوى المؤسسات لإنشاء تطبيقات RAG قابلة للتوسع.
- حلول Ultralytics: استكشف كيفية تكامل الرؤية الحاسوبية مع أنظمة الذكاء الاصطناعي الأوسع نطاقًا في مختلف الصناعات.









