فهم تجزئة المفاهيم القابلة للتوجيه
استكشف تجزئة المفاهيم القابلة للتوجيه، وكيف تختلف عن الأساليب التقليدية، وكيف تتيح النماذج ذات الصلة مثل YOLOE-26 إمكانات المفردات المفتوحة.

يتقدم الذكاء الاصطناعي للرؤية بسرعة، ويُستخدم على نطاق واسع لتحليل الصور ومقاطع الفيديو في البيئات الواقعية. فعلى سبيل المثال، يجري دمج تطبيقات تتراوح من أنظمة إدارة المرور إلى تحليلات تجارة التجزئة مع نماذج الرؤية الحاسوبية.
في كثير من هذه التطبيقات، تُدرَّب نماذج الرؤية، مثل نماذج اكتشاف الأجسام، على التعرّف إلى مجموعة محددة مسبقًا من الأجسام، بما في ذلك المركبات والأشخاص والمعدات. وأثناء التدريب، تُعرض على هذه النماذج أمثلة معنونة كثيرة، كي تتعلم كيف يظهر كل جسم وكيف تميّزه عن غيره في المشهد.
في مهام التقسيم، تتقدم النماذج خطوة إضافية بإنتاج حدود دقيقة لهذه الأجسام على مستوى البكسل. ويتيح ذلك للأنظمة فهم الموقع الدقيق لكل جسم في الصورة.
يعمل هذا جيدًا ما دام النظام لا يحتاج إلا إلى التعرّف إلى ما دُرّب عليه. لكن نادرًا ما يكون الأمر كذلك في البيئات الواقعية.
تكون المشاهد المرئية ديناميكية عادةً. فتظهر أجسام ومفاهيم مرئية جديدة، وتتغير الظروف، وغالبًا ما يرغب المستخدمون في تقسيم أجسام لم تكن جزءًا من إعداد التدريب الأصلي.
تتضح هذه القيود خصوصًا في التقسيم. ومع استمرار تطور الذكاء الاصطناعي للرؤية، تزداد الحاجة إلى نماذج تقسيم أكثر مرونة يمكنها التكيف مع المفاهيم الجديدة دون إعادة تدريب متكررة. ولهذا يحظى تقسيم المفاهيم القابل للتوجيه (PCS) باهتمام متزايد.
بدلًا من الاعتماد على قائمة ثابتة من فئات الأجسام، يمكن للمستخدمين وصف ما يريدون تقسيمه باستخدام النصوص أو الموجّهات المرئية أو الصور النموذجية. ثم تستطيع هذه النماذج تحديد جميع المناطق التي تطابق المفهوم الموصوف وتقسيمها، حتى إن لم يكن ذلك المفهوم مدرجًا صراحةً أثناء التدريب.
سنستكشف في هذه المقالة كيفية عمل تقسيم المفاهيم القابل للتوجيه، وكيف يختلف عن الأساليب التقليدية، وأين يُستخدم اليوم.
ما تقسيم المفاهيم القابل للتوجيه؟#
في معظم الحالات، تُدرَّب نماذج التقسيم على التعرّف إلى قائمة قصيرة من أنواع الأجسام. ويعمل هذا جيدًا عندما يحتاج نظام الذكاء الاصطناعي للرؤية إلى اكتشاف مجموعة محددة من الأجسام وتقسيمها فقط.
لكن المشاهد المرئية في التطبيقات الواقعية ديناميكية. فتظهر أجسام جديدة، وتتغير متطلبات المهام، وغالبًا ما يحتاج المستخدمون إلى تقسيم مفاهيم لم تكن مدرجة في مجموعة التسميات الأصلية. ويتطلب دعم هذه الحالات عادةً جمع بيانات وتعليقات توضيحية جديدة عالية الجودة وإعادة تدريب النموذج، مما يزيد التكلفة ويبطئ النشر.
يحل تقسيم المفاهيم القابل للتوجيه هذه المشكلة بالسماح للمستخدمين بإخبار النموذج بما يبحث عنه بدلًا من الاختيار من قائمة ثابتة من التسميات. يصف المستخدمون الجسم أو الفكرة التي يبحثون عنها، ويبرز النموذج جميع المناطق المطابقة في الصورة. وهذا يجعل ربط نية المستخدم بالبكسلات الفعلية في الصورة أسهل بكثير.

الشكل 1. نظرة على استخدام موجّهات المفاهيم للتقسيم (المصدر)
توجيه التقسيم باستخدام أنواع مختلفة من الموجّهات#
تتميز النماذج التي تدعم تقسيم المفاهيم القابل للتوجيه بالمرونة لأنها تستطيع استقبال أنواع مختلفة من المدخلات. وبعبارة أخرى، توجد أكثر من طريقة لإخبار النموذج بما يبحث عنه، مثل الأوصاف النصية أو الإشارات المرئية أو الصور النموذجية.
إليك نظرةً أقرب إلى كل أسلوب:
- الموجّهات النصية: يمكن استخدام عبارات قصيرة مثل «حافلة مدرسية» أو «منطقة ورمية» لوصف المفهوم المراد تقسيمه. ويفسر النموذج معنى الكلمات ويحدد المناطق المطابقة.
- الموجّهات المرئية: تستخدم هذه الموجّهات نقاطًا أو مربعات أو رسومات تقريبية داخل الصورة بوصفها إشارات. وتوجه هذه الإشارات موضع البحث وتساعد على تشكيل الحد النهائي.
- الصور النموذجية: تمثل الصور المرجعية أو القصاصات الصغيرة المفهوم محل الاهتمام. ويبحث النموذج عن مناطق مشابهة بصريًا ويقسمها استنادًا إلى مظهرها المرئي.
الفرق بين PCS والتقسيم التقليدي#
قبل التعمق في كيفية عمل تقسيم المفاهيم القابل للتوجيه، لنقارنه أولًا بمختلف أساليب تقسيم الأجسام التقليدية.
يتيح PCS نماذج ذات مفردات مفتوحة ومدفوعة بالموجّهات. ويمكنه التعامل مع أفكار جديدة موصوفة عبر الموجّهات، بخلاف التقسيم التقليدي. وتوجد عدة أنواع مختلفة من أساليب التقسيم التقليدية، لكل منها افتراضاته وقيوده.
إليك لمحة عن بعض الأنواع الأساسية للتقسيم التقليدي:
- التقسيم الدلالي: تُوسَم كل بكسلة في الصورة بوصفها جزءًا من فئة مثل الطريق أو المبنى أو الشخص. وتُجمع جميع البكسلات ذات التسمية نفسها، لذلك لا يفصل النموذج بين حالات الأجسام الفردية.
- تقسيم الحالات: يحدد النموذج الأجسام الفردية ويقسمها، بحيث يُعامل شخصان أو سيارتان بوصفهما عنصرين منفصلين.
- التقسيم الشامل: تجمع هذه التقنية بين التقسيم الدلالي وتقسيم الحالات لتوفير رؤية كاملة للمشهد، تشمل مناطق الخلفية والأجسام الفردية.
تعتمد كل هذه الأساليب على قائمة محددة مسبقًا من فئات الأجسام. وهي تعمل جيدًا ضمن هذا النطاق، لكنها لا تتعامل جيدًا مع المفاهيم الخارجة عنه. وعند الحاجة إلى تقسيم جسم محدد جديد، يلزم عادةً توفير بيانات تدريب إضافية وإجراء ضبط دقيق للنموذج.
يهدف PCS إلى تغيير ذلك. فبدلًا من التقيد بالفئات المحددة مسبقًا، يتيح لك وصف ما تريد تقسيمه في الصورة وقت الاستدلال.
تطور نماذج PCS#
لنستعرض بعد ذلك كيفية تطور نماذج التقسيم وصولًا إلى تقسيم المفاهيم القابل للتوجيه.
كان SAM، أو نموذج تقسيم أي شيء، نموذجًا تأسيسيًا شائعًا مثّل تحولًا في التقسيم. وقد قُدّم في عام 2023. وبدلًا من الاعتماد على فئات أجسام محددة مسبقًا، أتاح SAM للمستخدمين توجيه التقسيم باستخدام موجّهات مرئية بسيطة مثل النقاط أو مربعات الإحاطة.
مع SAM، لم يعد على المستخدمين اختيار تسمية. إذ كان بإمكانهم ببساطة تحديد موضع الجسم، لينشئ النموذج قناعًا له. جعل ذلك التقسيم أكثر مرونة، لكن المستخدمين ظلوا بحاجة إلى إظهار موضع البحث للنموذج.
بُني SAM 2، الذي أُصدر في عام 2024، على هذه الفكرة من خلال التعامل مع مشاهد أكثر تعقيدًا وتوسيع التقسيم القابل للتوجيه إلى الفيديو. وقد حسّن المتانة في ظروف الإضاءة المختلفة وأشكال الأجسام والحركة، مع استمرار الاعتماد أساسًا على الموجّهات المرئية لتوجيه التقسيم.
يمثل نموذج SAM 3 أحدث خطوة في هذا التطور. وقد أُصدر العام الماضي، وهو نموذج موحد يجمع بين الفهم المرئي والتوجيه اللغوي، مما يتيح سلوكًا متسقًا عبر مهام تقسيم الصور ومقاطع الفيديو.
مع SAM 3، لا يقتصر المستخدمون على الإشارة أو رسم الموجّهات. بل يمكنهم وصف ما يريدون تقسيمه باستخدام النص، ويبحث النموذج في الصورة أو إطارات الفيديو عن المناطق المطابقة لذلك الوصف.
يُوجَّه التقسيم بالمفاهيم بدلًا من فئات الأجسام الثابتة، مما يدعم استخدام المفردات المفتوحة عبر المشاهد المختلفة ومع مرور الوقت. وفي الواقع، يعمل SAM 3 ضمن فضاء مفاهيم كبير متعلم، يستند إلى أنطولوجيا مشتقة من مصادر مثل Wikidata وموسعة عبر بيانات تدريب واسعة النطاق.

الشكل 2. مثال على توجيه SAM 3 وتقسيم صورة واحدة (المصدر)
مقارنةً بالإصدارات السابقة التي اعتمدت في الغالب على الموجّهات الهندسية، يمثل SAM 3 خطوة نحو تقسيم أكثر مرونة قائم على المفاهيم. وهذا يجعله أنسب للتطبيقات الواقعية التي قد تتغير فيها الأجسام أو الأفكار محل الاهتمام ولا يمكن تحديدها مسبقًا دائمًا.
استكشاف كيفية عمل التقسيم المرئي القابل للتوجيه#
إذًا، كيف يعمل تقسيم المفاهيم القابل للتوجيه؟ إنه يستند إلى نماذج رؤية ونماذج رؤية ولغة كبيرة مدرّبة مسبقًا، وهي نماذج دُرّبت على مجموعات ضخمة من الصور، وفي كثير من الحالات على نصوص مقترنة بها. ويتيح لها هذا التدريب تعلم الأنماط المرئية العامة والمعنى الدلالي.
تستخدم معظم نماذج PCS معماريات قائمة على Transformer، تعالج الصورة بأكملها دفعة واحدة لفهم كيفية ارتباط المناطق المختلفة بعضها ببعض. ويستخرج Transformer للرؤية السمات المرئية من الصورة، بينما يحوّل مشفّر النص الكلمات إلى تمثيلات رقمية يستطيع النموذج التعامل معها.
أثناء التدريب، يمكن لهذه النماذج التعلم من أنواع مختلفة من الإشراف، بما في ذلك الأقنعة على مستوى البكسل التي تحدد حدود الأجسام بدقة، ومربعات الإحاطة التي تحدد مواقع الأجسام تقريبًا، والتسميات على مستوى الصورة التي تصف ما يظهر فيها. ويساعد التدريب باستخدام أنواع مختلفة من البيانات المعنونة النموذج على التقاط التفاصيل الدقيقة والمفاهيم المرئية الأوسع.
وقت الاستدلال، أي عند استخدام النموذج فعليًا لإجراء التنبؤات، يتبع PCS عملية مدفوعة بالموجّهات. يقدم المستخدم توجيهًا عبر أوصاف نصية أو إشارات مرئية مثل النقاط أو المربعات أو الصور النموذجية. ويشفّر النموذج كلًا من الموجّه والصورة في تمثيل داخلي مشترك أو تضمينات، ثم يحدد المناطق المتوافقة مع المفهوم الموصوف.
يحوّل مفكك الأقنعة هذا التمثيل المشترك بعد ذلك إلى أقنعة تقسيم دقيقة على مستوى البكسل. وبما أن النموذج يربط السمات المرئية بالمعنى الدلالي، فإنه يستطيع تقسيم مفاهيم جديدة حتى إن لم تكن مدرجة صراحةً أثناء التدريب.
كذلك، يمكن في كثير من الأحيان تحسين المخرجات عبر تعديل الموجّه أو إضافة توجيه إضافي، مما يساعد النموذج على التعامل مع المشاهد المعقدة أو الملتبسة. وتدعم هذه العملية التكرارية التحسين العملي أثناء النشر.
تُقيَّم نماذج تقسيم المفاهيم القابل للتوجيه عادةً بناءً على مدى نجاحها في تقسيم المفاهيم غير المرئية سابقًا ومدى متانتها عبر المشاهد المختلفة. وتركز المعايير غالبًا على جودة الأقنعة والتعميم والكفاءة الحاسوبية، بما يعكس متطلبات النشر الواقعية.
حالات الاستخدام الواقعية لـ PCS#
لنلقِ نظرةً بعد ذلك على المجالات التي يُستخدم فيها تقسيم المفاهيم القابل للتوجيه بالفعل وبدأ يُحدث فيها أثرًا حقيقيًا.
تقسيم مرن للصور في التصوير الطبي#
يشمل التصوير الطبي العديد من البنى البيولوجية والأمراض وأنواع الفحوص، وتظهر حالات جديدة كل يوم. وتواجه نماذج التقسيم التقليدية صعوبة في مواكبة هذا التنوع.
يناسب PCS هذا المجال طبيعيًا لأنه يتيح للأطباء وصف ما يريدون العثور عليه بدلًا من الاختيار من قائمة قصيرة جامدة. وباستخدام العبارات النصية أو الموجّهات المرئية، يمكن استخدام PCS لتقسيم الأعضاء أو مناطق الاهتمام مباشرةً، دون إعادة تدريب النموذج لكل مهمة جديدة. ويسهّل ذلك التعامل مع الاحتياجات السريرية المتنوعة، ويقلل الحاجة إلى رسم الأقنعة يدويًا، ويعمل عبر أنواع تصوير عديدة.
ومن الأمثلة الرائعة MedSAM-3، الذي يكيّف معمارية SAM 3 لتقسيم PCS القابل للتوجيه النصي في التصوير الطبي. ويمكن توجيه هذا النموذج بمصطلحات تشريحية ومرضية صريحة، مثل أسماء الأعضاء كالكبد أو الكلية، والمفاهيم المرتبطة بالآفات كالورم أو الآفة. وبناءً على الموجّه، يقسم النموذج مباشرةً المنطقة المقابلة في الصورة الطبية.
يدمج MedSAM-3 أيضًا نماذج اللغات الكبيرة متعددة الوسائط (MLLMs أو LLMs متعددة الوسائط)، التي يمكنها الاستدلال بالاعتماد على النصوص والصور معًا. وتعمل هذه النماذج ضمن إعداد يتضمن وكيلًا في الحلقة، حيث تُنقح النتائج تكراريًا لتحسين الدقة في الحالات الأكثر صعوبة.

الشكل 3. خط أنابيب MedSAM-3 لتقسيم الأورام الموجّه نصيًا في الصور الطبية (المصدر)
يحقق MedSAM-3 أداءً جيدًا عبر بيانات الأشعة السينية وMRI وCT والموجات فوق الصوتية والفيديو، مما يبرز كيف يمكن لـ PCS تمكين مسارات عمل أكثر مرونة وكفاءة في التصوير الطبي ضمن البيئات السريرية الواقعية.
التقسيم التكيفي للجراحة الروبوتية والأتمتة#
تعتمد الجراحة الروبوتية على أنظمة الرؤية لتتبع الأدوات وفهم المشاهد الجراحية المتغيرة بسرعة. تتحرك الأدوات بسرعة، وتتفاوت الإضاءة، وقد تظهر أدوات جديدة في أي وقت، مما يجعل أنظمة التسميات المحددة مسبقًا صعبة الصيانة.
باستخدام PCS، تستطيع الروبوتات تتبع الأدوات وتوجيه الكاميرات ومتابعة الخطوات الجراحية في الوقت الفعلي. ويقلل ذلك من وضع التسميات يدويًا ويجعل تكييف الأنظمة مع الإجراءات المختلفة أسهل. ويمكن للجراحين أو الأنظمة المؤتمتة استخدام موجّهات نصية مثل «ملقط» أو «مشرط» أو «أداة الكاميرا» لتحديد ما ينبغي تقسيمه في الصورة.

الشكل 4. تقسيم الأدوات الجراحية المستخدمة أثناء الجراحة الروبوتية (المصدر)
التقسيم ذو المفردات المفتوحة باستخدام Ultralytics YOLOE-26#
من النماذج الأخرى المتقدمة والمثيرة للاهتمام المرتبطة بتقسيم المفاهيم القابل للتوجيه نموذجنا Ultralytics YOLOE-26. إذ يجلب نموذجنا التقسيم ذا المفردات المفتوحة والمدفوع بالموجّهات إلى عائلة نماذج Ultralytics YOLO.
بُني YOLOE-26 على معمارية Ultralytics YOLO26، ويدعم تقسيم الحالات ذي المفردات المفتوحة. ويتيح YOLOE-26 للمستخدمين توجيه التقسيم بعدة طرق.
يدعم الموجّهات النصية، حيث يمكن لعبارات قصيرة مرتبطة بصريًا أن تحدد الجسم المستهدف، كما يدعم الموجّهات المرئية التي توفر توجيهًا إضافيًا استنادًا إلى إشارات الصورة. بالإضافة إلى ذلك، يتضمن YOLOE-26 وضعًا خاليًا من الموجّهات للاستدلال الصفري، إذ يكتشف النموذج الأجسام ويقسمها من مفردات مدمجة دون الحاجة إلى موجّهات من المستخدم.
يناسب YOLOE-26 تطبيقات مثل تحليلات الفيديو وإدراك الروبوتات والأنظمة الطرفية، حيث قد تتغير فئات الأجسام، بينما يظل انخفاض زمن الاستجابة ومعدل المعالجة الموثوق أمرين أساسيين. كما أنه مفيد جدًا لوضع التسميات على البيانات وتنظيم مجموعات البيانات، إذ يبسط مسارات العمل عبر أتمتة أجزاء من عملية التعليق التوضيحي.
إيجابيات وسلبيات تقسيم المفاهيم القابل للتوجيه#
فيما يلي بعض الفوائد الرئيسية لاستخدام تقسيم المفاهيم القابل للتوجيه:
- التكرار والنمذجة الأولية الأسرع: يمكن اختبار مهام تقسيم جديدة بسرعة عبر تغيير الموجّهات بدلًا من إعادة بناء مجموعات البيانات أو إعادة تدريب النماذج، مما يسرّع التجريب والتطوير.
- القدرة على التكيف عبر المجالات: يمكن غالبًا تطبيق نموذج PCS نفسه على مجالات مختلفة، مثل التصوير الطبي أو الروبوتات أو تحليلات الفيديو، مع تغييرات طفيفة في مسار العمل.
- التحسين التفاعلي: يستطيع المستخدمون تعديل الموجّهات تكراريًا أو إضافة توجيه لتحسين النتائج، مما يسهّل التعامل مع المشاهد الملتبسة أو الحالات الحدية دون إعادة تدريب.
مع أن PCS يتمتع بمزايا واضحة، فإليك بعض القيود التي ينبغي مراعاتها:
- الحساسية للموجّه: يمكن أن تؤثر التغييرات الطفيفة في صياغة الموجّه أو طريقة تقديمه في المخرجات. وقد تؤدي الموجّهات الغامضة جدًا أو المحددة جدًا إلى تقسيم غير مكتمل أو غير صحيح.
- سلوك أقل قابلية للتنبؤ: بما أن النموذج يفسر الموجّهات بدلًا من الاختيار من تسميات ثابتة، فقد تختلف النتائج أكثر بين المشاهد والمدخلات، مما قد يمثل مشكلة في مسارات العمل شديدة التحكم.
- التفسير الملتبس للمفهوم: تكون بعض المفاهيم ذاتية أو محددة بصورة فضفاضة، مما قد يؤدي إلى نتائج تقسيم غير متسقة بين المستخدمين أو عبر الصور.
- موثوقية محدودة للأهداف شديدة التحديد: تكون النماذج القائمة على الموجّهات أقل موثوقية عمومًا في المهام المحددة بدقة والخاصة بحالات بعينها، مثل اكتشاف العيوب، حيث يلزم تحديد دقيق ومتسق للسمات الدقيقة.
الاختيار بين التقسيم القابل للتوجيه والتقسيم التقليدي#
أثناء استكشافك للتقسيم القابل للتوجيه، قد تتساءل عن التطبيقات الأنسب له ومتى يكون نموذج رؤية حاسوبية تقليدي مثل Ultralytics YOLO26 أنسب للمشكلة التي تحاول حلها. يعمل التقسيم القابل للتوجيه جيدًا مع الأجسام العامة، لكنه لا يناسب حالات الاستخدام التي تتطلب نتائج دقيقة ومتسقة للغاية.
يُعد اكتشاف العيوب مثالًا جيدًا. ففي التصنيع، تكون العيوب غالبًا صغيرة ودقيقة، مثل الخدوش أو الانبعاجات أو حالات عدم المحاذاة أو عدم انتظام الأسطح. كما قد تختلف اختلافًا واسعًا تبعًا للمواد والإضاءة وظروف الإنتاج.
يصعب وصف هذه المشكلات بموجّه بسيط، ويصعب على نموذج عام الغرض اكتشافها بشكل موثوق بدرجة أكبر. وبوجه عام، تميل النماذج القائمة على الموجّهات إلى تفويت العيوب أو إنتاج نتائج غير مستقرة، بينما تكون النماذج المدرّبة خصيصًا على بيانات العيوب أكثر موثوقية بكثير لأنظمة الفحص الواقعية.
أهم النقاط المستخلصة#
يجعل تقسيم المفاهيم القابل للتوجيه أنظمة الرؤية أسهل تكيفًا مع العالم الواقعي، حيث تظهر أجسام وأفكار جديدة طوال الوقت. وبدلًا من التقيد بتسميات ثابتة، يمكن للمستخدمين ببساطة وصف ما يريدون تقسيمه وترك بقية العمل للنموذج، مما يوفر الوقت ويقلل العمل اليدوي. وعلى الرغم من استمرار وجود قيود، فإن PCS يغير بالفعل طريقة استخدام التقسيم عمليًا، ومن المرجح أن يصبح جزءًا أساسيًا من أنظمة الرؤية المستقبلية.
استكشف المزيد عن الذكاء الاصطناعي بزيارة مستودع GitHub والانضمام إلى مجتمعنا. واطّلع على صفحات حلولنا للتعرف إلى الذكاء الاصطناعي في الروبوتات والرؤية الحاسوبية في التصنيع. وتعرّف إلى خيارات الترخيص لدينا لبدء استخدام الذكاء الاصطناعي للرؤية اليوم!









