Instance Segmentation
تعلّم كيف تتيح تجزئة الكائنات اكتشاف الأجسام على مستوى البكسل. اكتشف كيفية استخدام Ultralytics YOLO26 لإنشاء الأقنعة بسرعة وفي الوقت الفعلي وغير ذلك.
تُعدّ تجزئة الكيانات تقنية متقدمة في الرؤية الحاسوبية (CV) تحدد كل كائن مميز محل اهتمام داخل الصورة وتحدّد حدوده على مستوى البكسل. وبينما تعمل كشف الكائنات القياسية على تحديد مواضع العناصر باستخدام مربعات الإحاطة المستطيلة، تتعمق تجزئة الكيانات في التحليل من خلال إنشاء قناع دقيق لكل كيان مكتشف. وتتيح هذه القدرة لنماذج الذكاء الاصطناعي (AI) التمييز بين الكائنات الفردية من الفئة نفسها—مثل فصل شخصين متداخلين—مما يوفر فهمًا أغنى وأكثر تفصيلًا للمشهد المرئي مقارنةً بأساليب التصنيف الأبسط.
التمييز بين أنواع التجزئة#
لفهم فائدة تجزئة الكيانات فهمًا كاملًا، من المفيد تمييزها عن مهام معالجة الصور الأخرى ذات الصلة. وتوفر كل طريقة مستوى مختلفًا من الدقة التفصيلية وفقًا لمتطلبات التطبيق.
- التجزئة الدلالية: يصنّف هذا النهج كل بكسل في الصورة ضمن فئة (مثل «طريق» أو «سماء» أو «سيارة»). لكنه لا يميز بين الكائنات المنفصلة من الفئة نفسها. فإذا كانت ثلاث سيارات متوقفة بجانب بعضها، فإن التجزئة الدلالية تتعامل معها باعتبارها منطقة واحدة من فئة «سيارة».
- تجزئة الكيانات: يتعامل هذا الأسلوب مع كل كائن باعتباره كيانًا فريدًا. فهو يكتشف الكيانات الفردية ويُسند تصنيفًا فريدًا إلى بكسلات كل منها. وفي مثال السيارات المتوقفة، ستنشئ تجزئة الكيانات ثلاثة أقنعة مميزة، فتحدد «السيارة A» و«السيارة B» و«السيارة C» كلًّا على حدة.
- التجزئة الشاملة: نهج هجين يجمع بين وسم الخلفية في التجزئة الدلالية وتحديد الكائنات القابلة للعد في تجزئة الكيانات.
آلية التحليل على مستوى البكسل#
تعتمد نماذج تجزئة الكيانات الحديثة عادةً على بنيات التعلم العميق (DL) المتقدمة، ولا سيما الشبكات العصبية الالتفافية (CNNs). تستخلص هذه الشبكات السمات من الصورة للتنبؤ بكل من فئة الكائن وحدوده المكانية. وتاريخيًا، كانت البنى ثنائية المرحلة، مثل Mask R-CNN، هي المعيار؛ إذ تقترح أولًا مناطق الاهتمام ثم تحسّنها وتحولها إلى أقنعة.
لكن التطورات الحديثة أفضت إلى كاشفات أحادية المرحلة مثل YOLO26، التي تنفذ الكشف والتجزئة في الوقت نفسه. ويُحسّن هذا النهج «من البداية إلى النهاية» سرعات الاستدلال في الوقت الفعلي تحسينًا كبيرًا، مما يجعل تطبيق التجزئة عالية الدقة على تدفقات الفيديو المباشرة باستخدام أجهزة استهلاكية أمرًا ممكنًا.
التطبيقات الواقعية#
تُعدّ الحدود الدقيقة التي توفرها تجزئة الكيانات بالغة الأهمية للقطاعات التي يتطلب فيها اتخاذ القرارات فهم الشكل والموضع الدقيقين للكائن.
- الذكاء الاصطناعي في الرعاية الصحية: في التشخيص الطبي، يُعد تحديد الحجم والشكل الدقيقين للأورام أو الآفات أمرًا حيويًا. وتتيح تجزئة الكيانات للنماذج تحديد معالم التشوهات في فحوصات MRI بدقة عالية، مما يساعد أطباء الأشعة في تخطيط العلاج ومراقبة تطور المرض.
- المركبات ذاتية القيادة: تعتمد السيارات ذاتية القيادة على التجزئة للتنقل في البيئات المعقدة. وباستخدام مجموعات بيانات مثل Cityscapes، يمكن للمركبات تحديد الأسطح القابلة للقيادة، والتعرف على علامات المسارات، وفصل المشاة الأفراد في ممرات العبور المزدحمة لضمان السلامة.
- الذكاء الاصطناعي في الزراعة: تستخدم الزراعة الدقيقة التجزئة لمراقبة صحة المحاصيل. ويمكن للروبوتات المجهزة بأنظمة رؤية تحديد الثمار الفردية للحصاد الآلي أو اكتشاف الأعشاب الضارة المحددة لتطبيق مبيدات الأعشاب على نحو موجّه، مما يقلل استخدام المواد الكيميائية ويحسّن الإنتاجية.
تنفيذ التجزئة باستخدام Python#
يمكن للمطورين تنفيذ تجزئة الكيانات بسهولة باستخدام مكتبة ultralytics. يوضح المثال التالي كيفية تحميل نموذج YOLO26 مُدرّب مسبقًا وإنشاء أقنعة تجزئة لصورة.
from ultralytics import YOLO
# Load a pre-trained YOLO26 instance segmentation model
# The 'n' suffix denotes the nano version, optimized for speed
model = YOLO("yolo26n-seg.pt")
# Run inference on an image
# This predicts classes, bounding boxes, and masks
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results
# Displays the image with overlaid segmentation masks
results[0].show()التحديات وتدريب النماذج#
على الرغم من قوة تجزئة الكيانات، فإنها تتطلب موارد حسابية كبيرة مقارنةً بكشف مربعات الإحاطة البسيط. ويتطلب إنشاء أقنعة دقيقة على مستوى البكسل موارد GPU كبيرة ووسمًا دقيقًا للبيانات. وينطوي وسم البيانات لهذه المهام على رسم مضلعات محكمة حول كل كائن، وقد يستغرق ذلك وقتًا طويلًا.
لتبسيط هذه العملية، تستخدم الفرق غالبًا أدوات مثل منصة Ultralytics، التي توفر ميزات لإدارة مجموعات البيانات، والوسم التلقائي، والتدريب القائم على السحابة. ويتيح ذلك للمطورين ضبط النماذج بدقة باستخدام بيانات مخصصة—مثل أجزاء صناعية محددة أو عينات بيولوجية—ونشرها بكفاءة على أجهزة الذكاء الاصطناعي الطرفي باستخدام تنسيقات محسّنة مثل ONNX أو TensorRT.









