Retrieval Augmented Generation (RAG)
استكشف كيف تحسّن عملية التوليد المعزّز بالاسترجاع (RAG) نماذج اللغة الكبيرة بالبيانات في الوقت الفعلي. تعلّم بناء مسارات عمل متعددة الوسائط باستخدام Ultralytics YOLO26 لتطبيق RAG البصري.
التوليد المعزز بالاسترجاع (RAG) هو تقنية متقدمة في مجال الذكاء الاصطناعي تعمل على تحسين مخرجات نموذج اللغة الكبير (LLM) من خلال الرجوع إلى قاعدة معرفة موثوقة خارج بيانات التدريب الخاصة به. تعتمد النماذج التوليدية التقليدية حصريًا على المعلومات الثابتة التي تعلّمتها أثناء تدريبها الأولي، مما قد يؤدي إلى إجابات قديمة أو معلومات غير دقيقة تُقدَّم بثقة، وتُعرف باسم الهلوسات. يسد RAG هذه الفجوة من خلال استرجاع معلومات ذات صلة ومحدّثة من مصادر خارجية—مثل قواعد بيانات الشركات، والأخبار الحالية، أو الأدلة التقنية—وإدخالها إلى النموذج باعتبارها سياقًا قبل توليد الاستجابة. تضمن هذه العملية أن تكون مخرجات الذكاء الاصطناعي متماسكة لغويًا ودقيقة من الناحية الواقعية، ومستندة إلى بيانات محددة.
كيفية عمل أنظمة RAG#
تتضمن بنية نظام RAG عادةً مرحلتين رئيسيتين: الاسترجاع والتوليد. يتيح سير العمل هذا للمطورين الحفاظ على نموذج أساس من دون الحاجة المكلفة إلى إعادة التدريب المتكرر.
-
الاسترجاع: عندما يرسل المستخدم استعلامًا، يُجري النظام أولًا بحثًا دلاليًا عبر نظام تخزين متخصص يُسمى قاعدة بيانات المتجهات. تحتوي قاعدة البيانات هذه على بيانات حُوِّلت إلى تمثيلات رقمية تُعرف باسم التضمينات، مما يتيح للنظام العثور على معلومات متشابهة من حيث المفهوم بدلًا من مطابقة الكلمات المفتاحية فحسب.
-
التوليد: تُدمج المستندات أو مقتطفات البيانات ذات الصلة التي عُثر عليها أثناء الاسترجاع مع سؤال المستخدم الأصلي. ثم تُرسل هذه المطالبة المُثرَاة إلى النموذج التوليدي. يستخدم النموذج هذا السياق المقدم لتوليف إجابة، مما يضمن اعتماد الاستجابة على الحقائق المسترجعة. ولمزيد من التعمق في الآليات، تقدم IBM دليلًا شاملًا حول سير عمل RAG.
RAG المرئي: دمج الرؤية الحاسوبية#
في حين يعتمد RAG تقليديًا على النصوص، أدى انتشار التعلم متعدد الوسائط إلى ظهور «RAG المرئي». في هذا السيناريو، تعمل نماذج الرؤية الحاسوبية كآلية للاسترجاع. إذ تحلل الصور أو تدفقات الفيديو لاستخراج بيانات نصية منظمة—مثل أسماء الكائنات أو أعدادها أو الأنشطة—ثم تُدخل هذه البيانات إلى LLM للإجابة عن الأسئلة المتعلقة بالمشهد المرئي.
على سبيل المثال، يمكن للمطور استخدام YOLO26 لاكتشاف الكائنات في صورة وتمرير قائمة تلك الكائنات إلى نموذج نصي لإنشاء تقرير وصفي.
from ultralytics import YOLO
# Load the YOLO26 model for state-of-the-art detection
model = YOLO("yolo26n.pt")
# Perform inference to 'retrieve' visual facts from an image
results = model("https://ultralytics.com/images/bus.jpg")
# Extract class names to build a text context for an LLM
detected_classes = [model.names[int(c)] for c in results[0].boxes.cls]
context_string = f"The scene contains: {', '.join(detected_classes)}."
print(context_string)
# Output example: "The scene contains: bus, person, person, person."التطبيقات الواقعية#
يُحدث RAG تحولًا في الصناعات من خلال تمكين وكلاء الذكاء الاصطناعي من الوصول إلى البيانات الخاصة أو الآنية بأمان.
- قواعد المعرفة المؤسسية: تستخدم الشركات RAG لإنشاء روبوتات محادثة داخلية تجيب عن أسئلة الموظفين حول سياسات الموارد البشرية أو الوثائق التقنية. ومن خلال ربط LLM بمستودع مستندات حي، يتجنب النظام تقديم معلومات قديمة عن السياسات. ولمزيد من المعلومات حول تطبيقات المؤسسات، راجع نظرة عامة من Google Cloud حول RAG في Vertex AI.
- دعم القرارات السريرية: في مجال الذكاء الاصطناعي في الرعاية الصحية، يمكن لأنظمة RAG استرجاع التاريخ المرضي للمريض وأحدث الأوراق البحثية الطبية لمساعدة الأطباء في التشخيص، مما يضمن أن تراعي المشورة أحدث الدراسات السريرية.
- مساعدو البيع بالتجزئة الأذكياء: تستفيد التطبيقات التي تستخدم الذكاء الاصطناعي في البيع بالتجزئة من RAG للتحقق من قواعد بيانات المخزون المباشرة. فإذا سأل عميل روبوت محادثة: «هل تتوفر لديكم أحذية الجري هذه بالمقاس 10؟» يسترجع النموذج مستويات المخزون الآنية قبل الإجابة، مما يمنع الإحباط الناتج عن نفاد المنتجات.
RAG مقابل الضبط الدقيق#
من الضروري التمييز بين RAG والضبط الدقيق، إذ إنهما يحلان مشكلات مختلفة.
- RAG (التوليد المعزز بالاسترجاع): هو الأفضل للوصول إلى البيانات الديناميكية التي تتغير باستمرار، مثل أسعار الأسهم والأخبار، أو البيانات الخاصة غير الموجودة في مجموعة بيانات التدريب العامة. ويركز على توفير معلومات جديدة أثناء التشغيل.
- الضبط الدقيق: هو الأفضل لتكييف سلوك النموذج أو أسلوبه أو مصطلحاته. ويتضمن تحديث أوزان النموذج باستخدام مجموعة بيانات محددة. وعلى الرغم من أن الضبط الدقيق يساعد النموذج على تعلم نمط لغوي محدد، مثل المصطلحات الطبية، فإنه لا يمنحه إمكانية الوصول إلى الحقائق الآنية. راجع دليل OpenAI حول الضبط الدقيق مقابل RAG للاطلاع على أطر اتخاذ القرار.
المفاهيم ذات الصلة#
- LangChain: إطار عمل شائع مفتوح المصدر مصمم خصيصًا لتبسيط إنشاء تطبيقات RAG من خلال ربط أدوات الاسترجاع وLLMs معًا.
- الرسم البياني للمعرفة: أسلوب منظم لتمثيل البيانات يمكن استخدامه مصدرًا للاسترجاع، ويوفر علاقات أكثر ثراءً من حيث السياق مقارنةً بالتشابه المتجهي البسيط.
- هندسة المطالبات: فن صياغة المدخلات لتوجيه النموذج. ويُعد RAG في الأساس شكلًا آليًا من هندسة المطالبات، حيث تُثرى «المطالبة» بالبيانات المسترجعة برمجيًا.
- منصة Ultralytics: بينما يتولى RAG جانب توليد النصوص، تُعد منصات مثل هذه ضرورية لإدارة المعالجة المسبقة للبيانات وتدريب نماذج الرؤية التي تُدخل البيانات المرئية في مسارات عمل RAG متعدد الوسائط.









