Retrieval Augmented Generation (RAG)
استكشف كيف يعمل التوليد المعزز بالاسترجاع (RAG) على تحسين النماذج اللغوية الكبيرة (LLMs) بالبيانات في الوقت الفعلي. تعلم كيفية بناء خطوط أنابيب متعددة الوسائط باستخدام Ultralytics YOLO26 لـ RAG البصري.
الRetrieval Augmented Generation (RAG) هو تقنية متقدمة في مجال الذكاء الاصطناعي تعمل على تحسين مخرجات Large Language Model (LLM) من خلال الإشارة إلى قاعدة معرفية موثوقة خارج بيانات التدريب الخاصة به. تعتمد نماذج التوليد التقليدية فقط على المعلومات الثابتة التي يتم تعلمها أثناء تدريبها الأولي، مما قد يؤدي إلى إجابات قديمة أو أخطاء واثقة تعرف بـ hallucinations. يسد الRAG هذه الفجوة عن طريق استرجاع معلومات ذات صلة ومحدثة من مصادر خارجية - مثل قواعدข้อมูล الشركات، أو الأخبار الحالية، أو الأدلة التقنية - وتغذيتها للنموذج كـ context قبل توليد الاستجابة. تضمن هذه العملية أن مخرجات الذكاء الاصطناعي ليست متسقة لغويًا فحسب، بل دقيقة أيضًا من الناحية الواقعية ومبنية على بيانات محددة.
كيف تعمل أنظمة RAG#
تتضمن بنية نظام الR عادةً مرحلتين رئيسيتين: الاسترجاع والتوليد. يتيح هذا التدفق للمطورين الحفاظ على foundation model دون الحاجة المكلفة لإعادة التدريب المتكررة.
-
Retrieval: عندما يرسل المستخدم استعلامًا، يقوم النظام أولاً بإجراء semantic search عبر نظام تخزين متخصص يسمى vector database. تحتوي هذه القاعدة على بيانات تم تحويلها إلى تمثيلات رقمية تعرف بـ embeddings، مما يتيح للنظام العثور على معلومات متشابهة مفهوماً بدلاً من مجرد مطابقة الكلمات الرئيسية.
-
Generation: تتم دمج المستندات ذات الصلة أو قطاعات البيانات التي تم العثور عليها أثناء الاسترجاع مع سؤال المستخدم الأصلي. يتم بعد ذلك إرسال هذا الprompt المعزز إلى نموذج التوليد. يستخدم النموذج هذا السياق المقدم لتوليف إجابة، مما يضمن أن الاستجابة تعتمد على الحقائق المسترجعة. للحصول على الغوص العميق في الآليات، IBM provides a comprehensive guide on RAG workflows.
RAG المرئي: دمج الرؤية الحاسوبية#
بينما يعتمد الRAG تقليديًا على النصوص، فإن صعود multi-modal learning قد أدى إلى تقديم "Visual RAG". في هذا السيناريو، تعمل نماذج computer vision كآلية استرجاع. فهي تحلل الصور أو تدفقات الفيديو لاستخراج بيانات نصية مهيكلة - مثل أسماء الكائنات، أو العدد، أو الأنشطة - والتي يتم بعد ذلك تغذيتها إلى LLM للإجابة على الأسئلة حول المشهد البصري.
على سبيل المثال، يمكن للمطور استخدام YOLO26 لاكتشاف الكائنات في الصورة وتمرير قائمة الكائنات تلك إلى نموذج نصي لتوليد تقرير وصفي.
from ultralytics import YOLO
# Load the YOLO26 model for state-of-the-art detection
model = YOLO("yolo26n.pt")
# Perform inference to 'retrieve' visual facts from an image
results = model("https://ultralytics.com/images/bus.jpg")
# Extract class names to build a text context for an LLM
detected_classes = [model.names[int(c)] for c in results[0].boxes.cls]
context_string = f"The scene contains: {', '.join(detected_classes)}."
print(context_string)
# Output example: "The scene contains: bus, person, person, person."تطبيقات العالم الحقيقي#
يقوم الRAG بتحويل الصناعات من خلال تمكين AI agents من الوصول إلى البيانات الخاصة أو في الوقت الفعلي بأمان.
- Enterprise Knowledge Bases: تستخدم الشركات الRAG لبناء روبوتات دردشة داخلية تجيب على أسئلة الموظفين حول سياسات الموارد البشرية أو الوثائق التقنية. من خلال توصيل LLM بمستودع مستندات مباشر، يتجنب النظام تقديم معلومات سياسة عفا عليها الزمن. لمزيد من المعلومات حول تنفيذات المؤسسات، انظر Google Cloud's overview of RAG in Vertex AI.
- Clinical Decision Support: في AI in healthcare، يمكن أن تسترجع أنظمة الRAG تاريخ المريض وأحدث أوراق البحوث الطبية لمساعدة الأطباء في التشخيص، مما يضمن أن النصيحة تأخذ في الاعتبار أحدث الدراسات السريرية.
- Smart Retail Assistants: تستخدم التطبيقات التي تستخدم AI in retail الRAG للتحقق من قواعد بيانات المخزون المباشرة. إذا سأل العميل روبوت الدردشة، "هل لديك هذه الأحذية الرياضية بمقاس 10؟"، يسترجع النموذج مستويات المخزون في الوقت الفعلي قبل الإجابة، مما يمنع الإحباط بشأن العناصر غير المتوفرة في المخزون.
RAG مقابل الضبط الدقيق (Fine-Tuning)#
من الضروري التمييز بين الRAG وfine-tuning، حيث إنهما يحلان مشكلات مختلفة.
- RAG (التوليد المعزز بالاسترجاع): الأفضل للوصول إلى البيانات الديناميكية التي تتغير بشكل متكرر (مثل أسعار الأسهم، الأخبار) أو البيانات الخاصة غير الموجودة في مجموعة التدريب العامة. وهو يركز على توفير معلومات جديدة وقت التشغيل.
- Fine-Tuning: الأفضل لتكييف سلوك النموذج أو أسلوبه أو مصطلحاته. يتضمن ذلك تحديث model weights على مجموعة بيانات معينة. بينما يساعد الضبط الدقيق النموذج على تعلم نمط لغوي معين (مثل المصطلحات الطبية)، فإنه لا يمنح الوصول إلى الحقائق في الوقت الفعلي. انظر OpenAI's guide on fine-tuning vs. RAG لأطر صنع القرار.
مفاهيم ذات صلة#
- LangChain: إطار عمل شهير مفتوح المصدر مصمم خصيصًا لتسيير إنشاء تطبيقات الRAG من خلال ربط المسترجعات ونماذج الLLM ببعضها البعض.
- Knowledge Graph: طريقة مهيكلة لتمثيل البيانات التي يمكن استخدامها كمصدر استرجاع، مما يوفر علاقات غنية بالسياق أكثر من التشابه البسيط للمتجهات.
- Prompt Engineering: فن صياغة المدخلات لتوجيه النموذج. الRAG هو في الأساس شكل آلي لهندسة الprompt حيث يتم إثراء ال"prompt" بالبيانات المسترجعة برمجيًا.
- Ultralytics Platform: بينما يتعامل الRAG مع جانب توليد النص، فإن منصات مثل هذه ضرورية لإدارة data preprocessing وتدريب نماذج الرؤية التي تغذي البيانات البصرية في خطوط أنابيب RAG متعددة الوسائط.






