تعزيز تطبيقات الذكاء الاصطناعي بـ RAG والرؤية الحاسوبية
تعرف على كيفية مساعدة الجمع بين التوليد المعزز بالاسترجاع (RAG) والرؤية الحاسوبية لأنظمة الذكاء الاصطناعي في تفسير المستندات، والمرئيات، والمحتوى المعقد في العالم الحقيقي.

أصبح استخدام أدوات الذكاء الاصطناعي مثل ChatGPT أو Gemini وسيلة شائعة للبحث عن المعلومات. سواء كنت تكتب رسالة، أو تلخص مستنداً، أو تجيب على سؤال، فإن هذه الأدوات توفر غالباً حلاً أسرع وأسهل.
ولكن إذا كنت قد استخدمت النماذج اللغوية الكبيرة (LLMs) بضع مرات، فمن المرجح أنك لاحظت قيودها. فعندما يتم توجيه استفسارات محددة للغاية أو حساسة للوقت إليها، فقد ترد بإجابات غير صحيحة، وغالباً ما تكون واثقة من نفسها.
يحدث هذا لأن نماذج LLM المستقلة تعتمد فقط على البيانات التي تدربت عليها. فهي لا تملك وصولاً إلى أحدث التحديثات أو المعرفة المتخصصة خارج نطاق تلك البيانات. ونتيجة لذلك، قد تكون إجاباتها قديمة أو غير دقيقة.
للمساعدة في حل هذه المشكلة، طوّر الباحثون طريقة تُسمى التوليد المعزز بالاسترجاع (RAG). يعمل RAG على تحسين النماذج اللغوية من خلال تمكينها من جلب معلومات حديثة وذات صلة من مصادر موثوقة عند الرد على الاستفسارات.
في هذه المقالة، سنستكشف كيف يعمل RAG وكيف يحسن أدوات الذكاء الاصطناعي عن طريق استرجاع معلومات ذات صلة ومحدثة. سننظر أيضاً في كيفية عمله جنباً إلى جنب مع الرؤية الحاسوبية، وهو مجال في الذكاء الاصطناعي يركز على تفسير البيانات المرئية، لمساعدة الأنظمة على فهم ليس النص فحسب، بل الصور والمخططات والوثائق المعقدة بصرياً أيضاً.
فهم توليد الاسترجاع المعزز (RAG)#
عند طرح سؤال على روبوت محادثة يعمل بالذكاء الاصطناعي، فإننا نتوقع عموماً أكثر من مجرد رد يبدو جيداً. من الناحية المثالية، يجب أن تكون الإجابة الجيدة واضحة ودقيقة ومفيدة حقاً. لتقديم ذلك، يحتاج نموذج الذكاء الاصطناعي إلى أكثر من مجرد مهارات لغوية؛ بل يحتاج أيضاً إلى الوصول إلى المعلومات الصحيحة، لا سيما بالنسبة للمواضيع المحددة أو الحساسة للوقت.
RAG هي تقنية تساعد في سد هذه الفجوة. فهي تجمع بين قدرة نموذج اللغة على فهم وتوليد النصوص والقدرة على استرجاع المعلومات ذات الصلة من مصادر خارجية. وبدلاً من الاعتماد فقط على بيانات التدريب الخاصة به، يقوم النموذج بنشاط بسحب محتوى داعم من قواعد معرفية موثوقة أثناء صياغة استجابته.

الشكل 1. حالات استخدام RAG الرئيسية. الصورة بواسطة المؤلف.
يمكنك التفكير في الأمر كطرح سؤال على شخص ما وطلب منه استشارة مرجع موثوق قبل الرد. تظل إجابته بكلماته الخاصة، ولكنها مستنيرة بأكثر المعلومات صلة وحداثة.
يساعد هذا النهج نماذج LLM على تقديم إجابات أكثر اكتمالاً ودقة ومصممة خصيصاً لاستفسار المستخدم، مما يجعلها أكثر موثوقية في تطبيقات العالم الحقيقي حيث تكون الدقة أمراً مهماً حقاً.
نظرة على كيفية عمل RAG#
تعمل RAG على تحسين كيفية استجابة نموذج اللغة الكبير من خلال تقديم خطوتين رئيسيتين: الاسترجاع والتوليد. أولاً، يسترجع النموذج معلومات ذات صلة من قاعدة معرفية خارجية. ثم يستخدم تلك المعلومات لتوليد استجابة جيدة الصياغة وواعية بالسياق.
دعنا نلقي نظرة على مثال بسيط لنرى كيف تعمل هذه العملية. تخيل أنك تستخدم مساعداً ذكياً لإدارة أموالك الشخصية وتريد التحقق مما إذا كنت قد التزمت بهدف الإنفاق الخاص بك لهذا الشهر.
تبدأ العملية عندما تطرح على المساعد سؤالاً مثل: "هل التزمت بميزانيتي هذا الشهر؟". بدلاً من الاعتماد فقط على ما تعلمه أثناء التدريب، يستخدم النظام أداة استرجاع للبحث في أحدث سجلاتك المالية (مثل كشوف الحسابات البنكية أو ملخصات المعاملات). وهو يركز على فهم القصد من وراء سؤالك ويجمع أكثر المعلومات صلة.
بمجرد استرجاع هذه المعلومات، يتولى نموذج اللغة المهمة. فهو يعالج كلاً من سؤالك والبيانات المستمدة من سجلاتك لتوليد إجابة واضحة ومفيدة. وبدلاً من سرد التفاصيل الخام، تلخص الاستجابة إنفاقك وتمنحك رؤية مباشرة وذات مغزى - مثل تأكيد ما إذا كنت قد حققت هدفك والإشارة إلى مجالات الإنفاق الرئيسية.
يساعد هذا النهج نموذج LLM على تقديم استجابات ليست دقيقة فحسب، بل تستند أيضاً إلى معلوماتك الحقيقية والمحدثة، مما يجعل التجربة أكثر فائدة بكثير من نموذج يعمل فقط مع بيانات تدريب ثابتة.

الشكل 2. فهم كيفية عمل RAG.
الحاجة إلى أنظمة RAG متعددة الوسائط#
عادةً، لا تتم مشاركة المعلومات دائماً كنص عادي. فمن الفحوصات الطبية والمخططات إلى شرائح العرض التقديمي والمستندات الممسوحة ضوئياً، غالباً ما تحمل العناصر المرئية تفاصيل مهمة. قد تواجه نماذج LLM التقليدية، التي صُممت بشكل أساسي لقراءة النصوص وفهمها، صعوبة في التعامل مع هذا النوع من المحتوى.
ومع ذلك، يمكن استخدام RAG جنباً إلى جنب مع رؤية الحاسوب لسد تلك الفجوة. فعند الجمع بينهما، يشكلان ما يعرف بنظام RAG متعدد الوسائط - وهو نظام يمكنه التعامل مع كل من النصوص والعناصر المرئية، مما يساعد برامج الدردشة الذكية على تقديم إجابات أكثر دقة واكتمالاً.
في صميم هذا النهج توجد نماذج الرؤية واللغة (VLMs)، المصممة معالجتها والاستدلال عليها لكلا نوعي المدخلات. في هذا الإعداد، يسترجع RAG المعلومات الأكثر صلة من مصادر البيانات الكبيرة، بينما يقوم نموذج VLM، المدعوم بالرؤية الحاسوبية، بتفسير الصور والمخططات والرسوم البيانية.
يعد هذا مفيداً بشكل خاص للمستندات الواقعية، مثل النماذج الممسوحة ضوئياً أو التقارير الطبية أو شرائح العرض التقديمي، حيث قد توجد تفاصيل حيوية في كل من النصوص والعناصر المرئية. على سبيل المثال، عند تحليل مستند يتضمن صوراً إلى جانب جداول وفقرات، يمكن للنظام متعدد الوسائط استخراج العناصر المرئية، وتوليد ملخص لما تعرضه، والجمع بين ذلك والنص المحيط لتقديم استجابة أكثر اكتمالاً وفائدة.

الشكل 3. يستخدم RAG متعدد الوسائط الصور والنصوص لتوفير إجابات أفضل.
تطبيقات RAG للبيانات المرئية#
الآن بعد أن ناقشنا ماهية RAG وكيفية عملها مع رؤية الحاسوب، دعونا نلقي نظرة على بعض الأمثلة الواقعية والمشاريع البحثية التي تعرض كيفية استخدام هذا النهج.
فهم المستندات المرئية باستخدام VisRAG#
فلنفرض أنك تحاول استخراج رؤى من تقرير مالي أو وثيقة قانونية ممسوحة ضوئياً. غالباً ما تتضمن هذه الأنواع من الملفات ليس فقط النصوص، بل أيضاً الجداول والرسوم البيانية والتخطيطات التي تساعد في توضيح المعلومات. قد يتجاهل نموذج لغوي مباشر هذه العناصر المرئية أو يسيء تفسيرها، مما يؤدي إلى إجابات غير مكتملة أو غير دقيقة.
تم إنشاء VisRAG بواسطة الباحثين لمعالجة هذا التحدي. وهو مسار RAG يعتمد على VLM يتعامل مع كل صفحة كصورة بدلاً من معالجة النص فقط. يتيح ذلك للنظام فهم المحتوى وبنيته المرئية على حد سواء. ونتيجة لذلك، يمكنه العثور على الأجزاء الأكثر صلة وتقديم إجابات تكون أكثر وضوحاً ودقة واعتمدت على السياق الكامل للوثيقة.

الشكل 4. يمكن لـ VisRAG قراءة المستندات كصور لالتقاط المحتوى النصي والتخطيط.
الإجابة على الأسئلة المرئية باستخدام RAG#
الإجابة على الأسئلة المرئية (VQA) هي مهمة يجيب فيها نظام ذكاء اصطناعي على أسئلة حول الصور. تركز العديد من أنظمة VQA الحالية على الإجابة على أسئلة حول مستند واحد دون الحاجة إلى البحث عن معلومات إضافية - وهذا ما يعرف بالإعداد المغلق.
VDocRAG هو إطار عمل RAG يتبنى نهجاً أكثر واقعية. فهو يدمج VQA مع القدرة على استرجاع المستندات ذات الصلة أولاً. هذا مفيد في المواقف الواقعية حيث قد ينطبق سؤال المستخدم على واحدة من وثائق عديدة، ويحتاج النظام إلى العثور على الوثيقة الصحيحة قبل الإجابة. للقيام بذلك، يستخدم VDocRAG نماذج VLM لتحليل المستندات كصور، مع الحفاظ على كل من نصوصها وبنيتها المرئية.
هذا يجعل VDocRAG مؤثرًا بشكل خاص في تطبيقات مثل البحث المؤسسي، وأتمتة المستندات، ودعم العملاء. يمكنه مساعدة الفرق في استخراج الإجابات بسرعة من المستندات المعقدة والمرتبة بصرياً، مثل الأدلة أو ملفات السياسات، حيث يعد فهم التخطيط بنفس أهمية قراءة الكلمات.

الشكل 5. الفرق بين VDocRAG والحلول القائمة على LLM.
تحسين وصف الصور باستخدام RAG#
يتضمن التعليق التوضيحي للصور إنشاء وصف مكتوب لما يحدث في الصورة. يتم استخدامه في مجموعة متنوعة من التطبيقات - بدءاً من جعل المحتوى عبر الإنترنت أكثر سهولة في الوصول إليه وحتى تشغيل البحث عن الصور، ودعم تعديل المحتوى وأنظمة التوصية.
ومع ذلك، فإن توليد أوصاف دقيقة ليس دائماً سهلاً لنماذج الذكاء الاصطناعي. ويصبح الأمر صعباً بشكل خاص عندما تعرض الصورة شيئاً مختلفاً عما تم تدريب النموذج عليه. تعتمد العديد من أنظمة الوصف بشكل كبير على بيانات التدريب، لذا عندما تواجه مشاهد غير مألوفة، قد تأتي أوصافها غامضة أو غير دقيقة.
لمعالجة هذه المشكلة، طوّر الباحثون Re-ViLM، وهي طريقة تدخل التوليد المعزز بالاسترجاع (RAG) في التعليق التوضيحي للصور. بدلاً من إنشاء تعليق توضيحي من الصفر، يقوم Re-ViLM باسترجاع أزواج صور ونصوص متشابهة من قاعدة بيانات واستخدامها لتوجيه إخراج التعليق.
يساعد هذا النهج القائم على الاسترجاع النموذج في استناد أوصافه إلى أمثلة ذات صلة، مما يحسن الدقة والطلاقة. تظهر النتائج الأولية أن Re-ViLM يولد أوصافاً أكثر طبيعية ووعياً بالسياق باستخدام أمثلة حقيقية، مما يساعد في تقليل الأوصاف الغامضة أو غير الدقيقة.

الشكل 6. Re-ViLM يحسن أوصاف الصور من خلال استرجاع أمثلة مرئية-نصية.
إيجابيات وسلبيات استخدام RAG لفهم البيانات المرئية#
إليك نظرة سريعة على فوائد تطبيق تقنيات توليد الاسترجاع المعزز لاسترجاع واستخدام المعلومات المرئية:
- إمكانيات التلخيص المحسنة: يمكن أن تتضمن الملخصات رؤى من العناصر المرئية (مثل اتجاهات الرسوم البيانية أو عناصر الرسوم المعلوماتية)، وليس النصوص فقط.
- بحث واسترجاع أكثر قوة: يمكن لخطوات الاسترجاع تحديد الصفحات المرئية ذات الصلة حتى عندما لا تكون الكلمات الرئيسية موجودة في النص، وذلك باستخدام الفهم القائم على الصور.
- دعم المستندات الممسوحة ضوئياً أو المكتوبة بخط اليد أو القائمة على الصور: يمكن لخطوط معالجة RAG المدعومة بنماذج VLM معالجة محتوى كان سيصبح غير قابل للقراءة لنماذج النصوص فقط.
على الرغم من هذه الفوائد، لا تزال هناك بعض القيود التي يجب وضعها في الاعتبار عند استخدام RAG للعمل مع البيانات المرئية. إليك بعض القيود الرئيسية:
- متطلبات حوسبة عالية: يتطلب تحليل الصور والنصوص معاً المزيد من الذاكرة وقوة المعالجة، وهو ما قد يؤدي إلى إبطاء الأداء أو زيادة التكاليف.
- مخاوف خصوصية البيانات والأمان: قد تحتوي المستندات المرئية، لا سيما في قطاعات مثل الرعاية الصحية أو التمويل، على معلومات حساسة تعقد تدفقات عمل الاسترجاع والمعالجة.
- أوقات استنتاج أطول: نظراً لأن المعالجة المرئية تضيف تعقيداً، فقد يستغرق توليد الاستجابات وقتاً أطول مقارنة بأنظمة النصوص فقط.
أبرز النقاط#
يعمل توليد الاسترجاع المعزز على تحسين كيفية إجابة نماذج اللغة الكبيرة على الأسئلة من خلال السماح لها بجلب معلومات ذات صلة ومحدثة من مصادر خارجية. عند اقترانها برؤية الحاسوب، يمكن لهذه الأنظمة معالجة ليس النصوص فحسب، بل أيضاً المحتوى المرئي، مثل الرسوم البيانية والجداول والصور والمستندات الممسوحة ضوئياً، مما يؤدي إلى استجابات أكثر دقة وشمولاً.
يجعل هذا النهج نماذج LLM أكثر ملاءمة للمهام الواقعية التي تتضمن مستندات معقدة. من خلال الجمع بين الاسترجاع والفهم المرئي، يمكن لهذه النماذج تفسير تنسيقات متنوعة بشكل أكثر فعالية وتقديم رؤى أكثر فائدة في السياقات العملية اليومية.
انضم إلى مجتمعنا المتنامي! استكشف مستودع GitHub الخاص بنا للتعمق أكثر في الذكاء الاصطناعي. هل أنت مستعد لبدء مشاريع الرؤية الحاسوبية الخاصة بك؟ تحقق من خيارات الترخيص الخاصة بنا. اكتشف المزيد حول الذكاء الاصطناعي في الرعاية الصحية والرؤية الحاسوبية في التجزئة على صفحات الحلول الخاصة بنا!






