Visual Instruction Tuning
استكشف كيف يمكّن ضبط التعليمات المرئية نماذج لغة الرؤية من اتباع توجيهات البشر. تعرّف على كيفية بناء سير عمل ذكاء اصطناعي متقدم باستخدام Ultralytics YOLO26.
ضبط التعليمات البصرية هو تقنية تعلم ماشية تحويلية تمتد بأساليب معالجة اللغات الطبيعية التقليدية إلى النطاق متعدد الوسائط. ومن خلال تدريب Vision Language Model (VLM) على اتباع توجيهات بشرية صريحة استناداً إلى مدخلات الصور أو الفيديو، يمكن للمطورين إنشاء مساعدين ذكاء اصطناعي يفهمون المحتوى البصري ويفكرون فيه. وعلى عكس نماذج image classification القياسية التي تخرج فئة محددة مسبقاً، يُمكّن ضبط التعليمات البصرية النماذج من تنفيذ مهام معقدة ومفتوحة النهايات، مثل وصف مشهد، أو قراءة نص داخل صورة، أو الإجابة عن أسئلة محددة حول العلاقات المكانية. وهذا يسد الفجوة بين large language models (LLMs) المستندة إلى النص وخطوط أنابيب computer vision التقليدية.
فهم المفهوم والفروق#
لاستيعاب ضبط التعليمات المرئية، من المفيد تمييزه عن المفاهيم ذات الصلة الوثيقة في نظام الذكاء الاصطناعي:
- Instruction Tuning: يشير عادةً إلى محاذاة نماذج LLM النصية وحدها لتتبع نوايا البشر بأمان ودقة. يطبق ضبط التعليمات البصرية هذه المنهجية نفسها ولكنه يدمج الصور في الموجه والناتج المتوقع.
- Visual Prompting: يتضمن عادةً التفاعل مع ذكاء اصطناعي باستخدام إشارات بصريّة، مثل رسم صندوق إحاطة، أو وضع نقطة، أو إخفاء منطقة على صورة، لتوجيه تركيز النموذج. في المقابل، يعتمد ضبط التعليمات البصرية بشكل كبير على أوامر اللغة الطبيعية المقترنة بالبيانات البصرية.
تتضمن عملية التدريب عموماً fine-tuning لنموذج أساسي متعدد الوسائط مدرب مسبقاً باستخدام مجموعات بيانات واسعة النطاق منسقة كثلاثيات صورة-نص-تعليمات. أظهرت أبحاث arXiv research on visual instruction tuning الرائدة، مثل مشروع LLaVA (Large Language-and-Vision Assistant)، أن هذه النماذج قادرة على تحقيق إمكانات ملحوظة بدون تدريب مسبق (zero-shot). واليوم، تستخدم مؤسسات الذكاء الاصطناعي الكبرى هذه التقنية لتشغيل نماذج متقدمة، بما في ذلك OpenAI GPT-4o، وAnthropic Claude 3.5 Sonnet، وGoogle DeepMind Gemini.
تطبيقات العالم الحقيقي#
من خلال مطابقة بنيات multimodal deep learning مع نوايا البشر، يفتح ضبط التعليمات البصرية المجال أمام تطبيقات شديدة التفاعل عبر مختلف الصناعات:
- AI in Healthcare Diagnostics: يمكن للمهنيين الطبيين استخدام النماذج مضبوطة التعليمات لـ Visual Question Answering (VQA). وقد يقوم اختصاصي الأشعة بتحفيز النظام بصورة أشعة سينية وتعليمات، "تمييز وتفسير أي علامات للالتهاب الرئوي في الفص السفلي الأيسر"، مما يسمح للذكاء الاصطناعي بالعمل كمساعد تشخيصي تعاوني.
- AI in Manufacturing Quality Control: بدلاً من تدريب نموذج كشف عيوب صارم من الصفر، يمكن للمشغلين توجيه نظام رؤية مثل Microsoft Florence-2 عبر قول: "حدد أي خدوش مجهرية أو انبعاجات على هذا الغلاف المعدني المصنوع حديثاً."
بناء سير عمل الرؤية#
لبناء أنظمة تستفيد من هذه القدرات، غالباً ما يعتمد المطورون على نماذج قوية لـ object detection استخراج السياق الهيكلي من الصور قبل تمرير تلك البيانات إلى VLM. وباستخدام وثائق PyTorch multi-modal documentation أو TensorFlow vision models، يمكن للمطورين إنشاء خطوط أنابيب هجينة.
على سبيل المثال، يمكنك استخدام نموذج Ultralytics YOLO لإدراك مشهد ما بسرعة وإنشاء مطالبة لغوية مستنيرة لنموذج VLM لاحق:
from ultralytics import YOLO
# Load an Ultralytics YOLO26 model to extract visual context
model = YOLO("yolo26n.pt")
# Perform inference to identify objects for a downstream VLM prompt
results = model("https://ultralytics.com/images/bus.jpg")
# Extract object names to dynamically build an instruction prompt
objects = [model.names[int(cls)] for cls in results[0].boxes.cls]
prompt = f"Please provide a detailed safety analysis of the scene containing these objects: {', '.join(objects)}"
print(prompt)
# Output: Please provide a detailed safety analysis of the scene containing these objects: bus, person, person...قد يمثل إدارة مجموعات البيانات المعقدة ومتعددة الوسائط المطلوبة لهذه التطبيقات من الجيل التالي تحدياً. يعمل Ultralytics Platform على تبسيط هذه العملية من خلال توفير أدوات متكاملة لتعليق مجموعات البيانات، والتدريب السحابي، ونشر النماذج بسلاسة. وسواء كنت تقرأ أوراقاً بحثية متطورة على ACM digital library أو أرشيفات IEEE Xplore computer vision، فإن التحول نحو أنظمة رؤية مضبوطة التعليمات وعالية الكفاءة يمثل ذروة الذكاء الاصطناعي. ومن خلال اقتران إدراك YOLO26 مع نماذج الاستدلال المضبوطة، يمكن للمؤسسات نشر وكلاء ذكاء اصطناعي أقوياء للغاية.






