Vision Language Model (VLM)
استكشف نماذج لغة الرؤية (VLM) مع Ultralytics. تعرّف على كيفية الربط بين الرؤية الحاسوبية ونماذج اللغة الكبيرة (LLMs) للإجابة على الأسئلة المرئية (VQA) والكشف عن المفردات المفتوحة باستخدام Ultralytics YOLO26.
نموذج الرؤية واللغة (VLM) هو نوع من الذكاء الاصطناعي يمكنه معالجة وتفسير المعلومات المرئية (الصور أو الفيديو) والمعلومات النصية في نفس الوقت. على عكس نماذج الرؤية الحاسوبية التقليدية التي تركز فقط على بيانات البكسل، أو نماذج اللغة الكبيرة (LLMs) التي تفهم النص فقط، فإن نماذج VLM تسد الفجوة بين هاتين الوسيلتين. من خلال التدريب على مجموعات بيانات ضخمة تحتوي على أزواج من الصور والنصوص، تتعلم هذه النماذج ربط الميزات المرئية بالمفاهيم اللغوية، مما يسمح لها بوصف الصور، والإجابة على الأسئلة حول المشاهد المرئية، وحتى تنفيذ الأوامر بناءً على ما "تراه".
كيف تعمل نماذج الرؤية واللغة#
في جوهرها، تتكون نماذج VLM عادةً من مكونين رئيسيين: مشفر الرؤية ومشفر النص. يقوم مشفر الرؤية بمعالجة الصور لاستخراج خرائط الميزات والتمثيلات المرئية، بينما يتعامل مشفر النص مع المدخلات اللغوية. يتم بعد ذلك دمج هذه التدفقات المميزة من البيانات باستخدام آليات مثل الانتباه المتبادل لمواءمة المعلومات المرئية والنصوص في مساحة تضمين مشتركة.
اتجهت التطورات الحديثة في عامي 2024 و2025 نحو بنيات أكثر توحيداً يتعامل فيها عمود فقري واحد من نوع Transformer مع كلا الطريقتين. على سبيل المثال، توضح نماذج مثل Google PaliGemma 2 مدى فعالية دمج هذه التدفقات في تعزيز الأداء في مهام الاستدلال المعقدة. تتيح هذه المواءمة للنموذج فهم السياق، مثل التعرف على أن كلمة "تفاحة" تشير إلى فاكهة في صورة متجر بقالة ولكنها تشير إلى شركة تقنية في شعار.
تطبيقات العالم الحقيقي#
تفتح القدرة على فهم العالم من خلال الرؤية واللغة معاً تطبيقات متنوعة عبر مختلف الصناعات:
- الإجابة على الأسئلة المرئية (VQA): تُستخدم نماذج VLM بشكل مكثف في تشخيص الرعاية الصحية لمساعدة أطباء الأشعة. قد يسأل الطبيب النظام: "هل يوجد كسر في صورة الأشعة السينية هذه؟"، ويقوم النموذج بتحليل الصورة الطبية لتقديم تقييم أولي، مما يقلل من أخطاء التشخيص.
- البحث الذكي في التجارة الإلكترونية: في بيئات التجزئة، تتيح نماذج VLM للمستخدمين البحث عن المنتجات باستخدام أوصاف اللغة الطبيعية مجتمعة مع الصور. يمكن للمتسوق تحميل صورة لزي أحد المشاهير والسؤال: "ابحث لي عن فستان بهذا النقش ولكن باللون الأزرق"، ويستخدم النظام البحث الدلالي لاسترداد نتائج مطابقة دقيقة.
- التعليقات التوضيحية التلقائية وإمكانية الوصول: تقوم نماذج VLM تلقائياً بتوليد نص بديل وصفي للصور على الويب، مما يجعل المحتوى الرقمي أكثر سهولة في الوصول إليه للمستخدمين ضعاف البصر الذين يعتمدون على قارئات الشاشة.
التمييز بين نماذج VLM والمفاهيم ذات الصلة#
من المفيد تمييز نماذج VLM عن فئات الذكاء الاصطناعي الأخرى لفهم دورها المحدد:
- مقارنة بين VLM و LLM: يقوم نموذج اللغة الكبير (مثل إصدارات GPT-4 النصية فقط) بمعالجة بيانات النص فقط. وفي حين يمكنه توليد قصص أو رموز برمجية إبداعية، إلا أنه لا يستطيع "رؤية" الصورة. إن نموذج VLM يمنح العينين لنموذج LLM بفعالية.
- مقارنة بين VLM واكتشاف الكائنات: تحدد نماذج اكتشاف الكائنات التقليدية، مثل إصدارات YOLO المبكرة، مكان الكائنات وأي فئة تنتمي إليها (على سبيل المثال، "سيارة: 99%"). يذهب نموذج VLM إلى أبعد من ذلك من خلال فهم العلاقات والسمات، مثل "سيارة رياضية حمراء متوقفة بجوار عمود إطفاء الحريق".
- مقارنة بين VLM والذكاء الاصطناعي متعدد الوسائط: الذكاء الاصطناعي متعدد الوسائط هو مصطلح شامل أوسع. وفي حين أن جميع نماذج VLM متعددة الوسائط (تجمع بين الرؤية واللغة)، فإن ليست كل النماذج متعددة الوسائط هي نماذج VLM؛ فقد يجمع بعضها بين الصوت والنص (مثل تحويل الكلام إلى نص) أو الفيديو وبيانات المستشعرات دون مكون لغوي.
الكشف مفتوح المفردات مع YOLO#
تتيح نماذج VLM الحديثة اكتشاف "المفردات المفتوحة"، حيث يمكنك اكتشاف الكائنات باستخدام مطالبات نصية حرة بدلاً من الفئات المعرفة مسبقاً. هذه ميزة رئيسية لنماذج مثل Ultralytics YOLO-World، والتي تتيح تعريفات الفئات الديناميكية دون الحاجة لإعادة التدريب.
يوضح المثال التالي كيفية استخدام حزمة ultralytics لاكتشاف كائنات محددة موصوفة بالنصوص:
from ultralytics import YOLOWorld
# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])
# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the detection results
results[0].show()التحديات والتوجهات المستقبلية#
على الرغم من قوتها، تواجه نماذج الرؤية واللغة تحديات كبيرة. إحدى المشكلات الرئيسية هي الهلوسة، حيث يصف النموذج بثقة كائنات أو نصوصاً في صورة غير موجودة أصلاً. يعمل الباحثون بنشاط على تقنيات مثل التعلم التعزيزي من تعليقات البشر (RLHF) لتحسين التأسيس والدقة.
التحدي الآخر هو التكلفة الحسابية. يتطلب تدريب هذه النماذج الضخمة موارد GPU كبيرة. ومع ذلك، فإن إطلاق بنيات فعالة مثل Ultralytics YOLO26 يساعد في جلب إمكانيات الرؤية المتقدمة إلى الأجهزة الطرفية. ومع تقدمنا، نتوقع أن تلعب نماذج VLM دوراً حاسماً في الوكلاء الروبوتيين، مما يسمح للروبوتات بالتنقل ومعالجة الكائنات بناءً على تعليمات لفظية معقدة.
بالنسبة للمهتمين بالأسس النظرية، يوفر بحث CLIP الأصلي من OpenAI رؤية ممتازة حول التدريب المسبق للصور واللغات المتقابلة. بالإضافة إلى ذلك، يعد مواكبة أوراق مؤتمر CVPR أمراً بالغ الأهمية لتتبع التطور السريع لهذه البنيات. لتجربة تدريب نماذج الرؤية الخاصة بك، يمكنك الاستفادة من منصة Ultralytics لإدارة مجموعات البيانات ونشر النماذج بشكل مبسط.






