Semantic Segmentation
استكشف التجزئة الدلالية لفهم الصور على مستوى البكسل. تعلّم تدريب نماذج التجزئة الدقيقة ونشرها باستخدام Ultralytics YOLO26 اليوم.
التجزئة الدلالية هي مهمة في رؤية الحاسوب تتضمن تقسيم الصورة إلى مناطق مميزة من خلال إسناد تسمية فئة محددة إلى كل بكسل على حدة. وعلى خلاف المهام الأبسط مثل تصنيف الصور، الذي يُسنِد تسمية واحدة إلى الصورة بأكملها، أو اكتشاف الكائنات، الذي يرسم مربعات إحاطة حول الكائنات، توفر التجزئة الدلالية فهمًا للمشهد على مستوى البكسل. ويُعد هذا التحليل الدقيق ضروريًا للتطبيقات التي يكون فيها الشكل الدقيق للكائن وحدوده مهمين بقدر أهمية هويته. فهو يتيح للآلات "رؤية" العالم بطريقة أقرب إلى رؤية البشر، من خلال تمييز البكسلات الدقيقة التي تكوّن طريقًا أو أحد المشاة أو ورمًا داخل فحص طبي.
آلية عمل التجزئة الدلالية#
في جوهرها، تتعامل التجزئة الدلالية مع الصورة باعتبارها شبكة من البكسلات التي تحتاج إلى التصنيف. وتُعد نماذج التعلم العميق، ولا سيما الشبكات العصبية الالتفافية (CNNs)، البنية القياسية لهذه المهمة. وتستخدم بنية نموذجية، مثل U-Net الشائعة الاستخدام، هيكلًا يتكون من مُرمِّز وفاكّ ترميز. يضغط المُرمِّز صورة الإدخال لاستخراج السمات عالية المستوى (مثل الأنسجة والأشكال)، بينما يرفع فاّك الترميز دقة هذه السمات مجددًا إلى دقة الصورة الأصلية لإنشاء قناع تجزئة دقيق.
لتحقيق ذلك، تُدرَّب النماذج على مجموعات بيانات مشروحة كبيرة، حيث يلوّن المشروحون البشريون كل بكسل بعناية وفقًا لفئته. وتسهّل أدوات مثل منصة Ultralytics هذه العملية من خلال توفير ميزات التعليق التلقائي التي تسرّع إنشاء بيانات الحقيقة الأساسية عالية الجودة. وبعد التدريب، يُخرج النموذج قناعًا تتوافق فيه قيمة كل بكسل مع معرّف فئة، وبذلك "يلوّن" الصورة بالمعنى.
التمييز بين المفاهيم ذات الصلة#
من الشائع الخلط بين التجزئة الدلالية وغيرها من المهام على مستوى البكسل. ويُعد فهم الفروق بينها أمرًا أساسيًا لاختيار النهج المناسب للمشروع:
- تجزئة المثيلات: بينما تتعامل التجزئة الدلالية مع جميع الكائنات من الفئة نفسها باعتبارها كيانًا واحدًا (مثل تلوين جميع "السيارات" بالأزرق)، تميّز تجزئة المثيلات بين الكائنات الفردية (مثل أن تكون "السيارة أ" زرقاء و"السيارة ب" حمراء).
- التجزئة البانوبتيكية: تجمع هذه التجزئة بين المفهومين. فهي تُسنِد فئة إلى كل بكسل (دلالية)، مع فصل المثيلات الفردية للكائنات القابلة للعد (مثيلات)، مما يوفر أشمل فهم للمشهد.
التطبيقات الواقعية#
تدفع القدرة على تحليل البيانات المرئية بدقة تامة على مستوى البكسل عجلة الابتكار في العديد من الصناعات ذات الأهمية العالية:
- الذكاء الاصطناعي في قطاع السيارات: تعتمد المركبات ذاتية القيادة اعتمادًا كبيرًا على التجزئة للتنقل بأمان. فمن خلال تحديد المناطق القابلة للقيادة مقابل الأرصفة، وتحديد الخطوط المحيطة بالمشاة والسيارات والعوائق بدقة، تستطيع أنظمة القيادة الذاتية اتخاذ قرارات حاسمة في الوقت الفعلي.
- الذكاء الاصطناعي في الرعاية الصحية: في التصوير الطبي، تقسّم النماذج الأعضاء أو الآفات أو الأورام من صور الأشعة المقطعية والتصوير بالرنين المغناطيسي. ويساعد ذلك أطباء الأشعة على حساب حجم الورم لتخطيط العلاج أو توجيه أدوات الجراحة الروبوتية بدقة بالغة.
- الذكاء الاصطناعي في الزراعة: يستخدم المزارعون الصور الجوية الملتقطة بالطائرات المسيّرة والتجزئة لمراقبة صحة المحاصيل. ومن خلال تصنيف البكسلات على أنها "محصول سليم" أو "أعشاب ضارة" أو "تربة"، تستطيع الأنظمة المؤتمتة استهداف رش مبيدات الأعشاب، مما يقلل استخدام المواد الكيميائية ويحسّن الإنتاجية.
تنفيذ التجزئة باستخدام Ultralytics#
تحتاج نماذج التجزئة الحديثة إلى تحقيق توازن بين الدقة والسرعة، لا سيما عند إجراء الاستدلال في الوقت الفعلي على الأجهزة الطرفية. وتضم عائلة نماذج Ultralytics YOLO26 نماذج تجزئة متخصصة (يُشار إليها باللاحقة -seg) ذات بنية أصلية من البداية إلى النهاية، ما يوفر أداءً متفوقًا مقارنةً بالبنى الأقدم مثل YOLO11.
يوضح المثال التالي كيفية إجراء التجزئة على صورة باستخدام حزمة Python ultralytics. وينتج عن ذلك أقنعة ثنائية تحدد حدود الكائنات.
from ultralytics import YOLO
# Load a pre-trained YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results
# This will display the image with the segmentation masks overlaid
results[0].show()التحديات والاتجاهات المستقبلية#
على الرغم من التقدم الكبير، تظل التجزئة الدلالية كثيفة حسابيًا. إذ يتطلب إنشاء تصنيف لكل بكسل على حدة قدرًا كبيرًا من موارد GPU والذاكرة. ويعمل الباحثون بنشاط على تحسين هذه النماذج لتحقيق الكفاءة، مستكشفين تقنيات مثل تكميم النماذج لتشغيل الشبكات الثقيلة على الهواتف المحمولة والأجهزة المضمنة.
علاوةً على ذلك، تمثل الحاجة إلى مجموعات بيانات موسومة ضخمة عنق زجاجة. ولمعالجة ذلك، تتجه الصناعة نحو إنشاء البيانات الاصطناعية والتعلم الخاضع للإشراف الذاتي، مما يتيح للنماذج التعلم من الصور الخام دون الحاجة إلى ملايين التسميات اليدوية للبكسلات. ومع نضج هذه التقنيات، يمكننا أن نتوقع أن تصبح التجزئة أكثر انتشارًا في الكاميرات الذكية والروبوتات وتطبيقات الواقع المعزز.









