Visual Question Answering (VQA)
استكشف الإجابة عن الأسئلة البصرية (VQA) عند تقاطع CV وNLP. تعرّف على كيفية تشغيل Ultralytics YOLO26 لـ VQA في التطبيقات الفورية والذكاء الاصطناعي متعدد الوسائط.
تُعدّ الإجابة عن الأسئلة المرئية (VQA) مهمة متقدمة في مجال الذكاء الاصطناعي، وتقع عند تقاطع الرؤية الحاسوبية (CV) ومعالجة اللغة الطبيعية (NLP). وعلى خلاف تصنيف الصور التقليدي، الذي يعيّن تسمية واحدة للصورة، صُممت أنظمة VQA للإجابة عن أسئلة مفتوحة باللغة الطبيعية حول المحتوى المرئي في الصورة. فعلى سبيل المثال، عند إعطاء النظام صورة لمطبخ، قد يسأل المستخدم: "هل الموقد قيد التشغيل؟" أو "كم تفاحةً توجد في الوعاء؟" وللإجابة بشكل صحيح، يجب أن يفهم النموذج دلالات النص، ويحدد الكائنات ذات الصلة داخل المشهد، ويستدل على سماتها وعلاقاتها المكانية.
تجعل هذه القدرة من VQA مكوّناً أساسياً في الذكاء الاصطناعي متعدد الوسائط الحديث، إذ تتطلب المعالجة المتزامنة لأنواع متباينة من البيانات. تتضمن البنية عادةً مُرمّزاً بصرياً، مثل الشبكة العصبية الالتفافية (CNN) أو Transformer للرؤية (ViT)، لاستخراج السمات من الصورة، ومُرمّزاً نصياً لمعالجة الاستعلام اللغوي. وتستخدم الأنظمة المتقدمة آلية الانتباه لمواءمة المفاهيم النصية مع مناطق محددة من الصورة، مما يتيح للذكاء الاصطناعي "النظر" إلى الأجزاء ذات الصلة من الصورة قبل إنشاء الإجابة.
التطبيقات الواقعية والأهمية#
أدت القدرة على الاستعلام عن البيانات المرئية ديناميكياً إلى تطبيقات تحويلية في مختلف القطاعات، مما عزز الأتمتة وسهولة الوصول.
- التقنيات المساعدة: تُعد VQA مهمة للتطبيقات التي تدعم الأشخاص ذوي الإعاقة البصرية. ويمكن لأدوات مثل Be My Eyes الاستفادة من VQA لتمكين المستخدمين من التقاط صورة لما يحيط بهم وطرح أسئلة مثل: "هل هذه الزجاجة تحتوي على شامبو أم بلسم؟" أو "هل عبور الشارع آمن؟" ويسهم ذلك في تعزيز الاستقلالية من خلال تحويل المعلومات المرئية إلى إجابات مسموعة.
- التشخيص الطبي: في مجال الذكاء الاصطناعي في الرعاية الصحية، تساعد أنظمة VQA أطباء الأشعة على تحليل الصور الطبية. فقد يطرح الطبيب على النظام سؤالاً عن صورة أشعة سينية، مثل: "هل توجد دلائل على كسر في الربع العلوي الأيسر؟" وقد بحث باحثون في المعاهد الوطنية للصحة (NIH) استخدام VQA لتبسيط اتخاذ القرارات السريرية والحد من الأخطاء التشخيصية.
- المراقبة الذكية: تستخدم أنظمة الأمن الحديثة الذكاء الاصطناعي للأمن لتحليل ساعات من تسجيلات الفيديو. وبدلاً من المراجعة اليدوية، يمكن للمشغلين أن يسألوا: "هل دخلت شاحنة حمراء إلى رصيف التحميل بعد منتصف الليل؟" وتتيح VQA إجراء اكتشاف الحالات الشاذة بسرعة استناداً إلى معايير محددة، بدلاً من تنبيهات الحركة العامة.
دور اكتشاف الكائنات في VQA#
مع أن بعض نماذج VQA تُدرّب من البداية إلى النهاية، يعتمد كثير منها على بنية أساسية قوية لـاكتشاف الكائنات لتحديد عناصر المشهد أولاً. ويوفر تحديد مواقع الكائنات بدقة السياق اللازم لمحرك الاستدلال. ويُعد نموذج Ultralytics YOLO26 أساساً ممتازاً لهذه المسارات بفضل دقته العالية وأدائه الآني.
فعلى سبيل المثال، يمكن للمطورين استخدام YOLO26 لاستخراج فئات الكائنات ومربعات الإحاطة، ثم تمريرها إلى نموذج لغوي كبير (LLM) أو وحدة استدلال متخصصة للإجابة عن استعلامات المستخدمين. وغالباً ما تُبسّط إدارة مجموعات البيانات اللازمة لتدريب هذه البنى الأساسية للكشف باستخدام منصة Ultralytics، التي تيسّر وضع التعليقات التوضيحية والتدريب السحابي.
يوضح مثال Python التالي كيفية استخدام Ultralytics YOLO26 لاستخراج السياق المرئي (الكائنات ومواقعها) من صورة، وهي الخطوة الأساسية في سير عمل VQA:
from ultralytics import YOLO
# Load the YOLO26 model (latest generation)
model = YOLO("yolo26n.pt")
# Run inference to detect objects, providing context for VQA
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display detected classes (e.g., 'bus', 'person') to verify scene understanding
for result in results:
result.show() # Visualize the detectionsتمييز VQA عن المفاهيم ذات الصلة#
من المفيد تمييز VQA عن مهام الرؤية واللغة المشابهة لفهم نطاقها الفريد.
- VQA مقابل وصف الصور: يُنشئ وصف الصور وصفاً عاماً وثابتاً للصورة بأكملها (مثل: "كلب يلعب في الحديقة"). أما VQA فتتسم بالتفاعلية والتحديد؛ إذ تقدم استجابة موجهة لسؤال المستخدم بدلاً من ملخص عام.
- VQA مقابل الإسناد البصري: يركز الإسناد البصري على تحديد موقع كائن معين مذكور في عبارة نصية، من خلال رسم مربع إحاطة حوله. وتتجاوز VQA ذلك بتحليل سمات الكائنات التي عُثر عليها أو أفعالها أو أعدادها.
- VQA مقابل OCR: بينما يقتصر التعرّف البصري على الحروف (OCR) على استخراج النص من الصور، قد تدمج VQA تقنية OCR للإجابة عن أسئلة مثل: "ماذا تقول لافتة الشارع؟" ومع ذلك، تشمل الوظيفة الأساسية لـVQA فهماً أوسع للمشهد يتجاوز مجرد قراءة النص.
يواصل الباحثون تطوير هذا المجال باستخدام معايير قياس واسعة النطاق، مثل مجموعة بيانات VQA، التي تساعد النماذج على التعميم عبر ملايين الأزواج المكوّنة من الصور والأسئلة. ومع تحسن الأجهزة، بما يتيح زمن استدلال أسرع، تصبح VQA أكثر قابلية للتطبيق في تطبيقات الهاتف المحمول والحافة في الوقت الفعلي.









