Semantic Segmentation
استكشف التجزئة الدلالية (semantic segmentation) لفهم الصور على مستوى البكسل. تعلم كيفية تدريب ونشر نماذج تجزئة دقيقة باستخدام Ultralytics YOLO26 اليوم.
التجزئة الدلالية هي مهمة رؤية حاسوبية تتضمن تقسيم الصورة إلى مناطق متميزة من خلال تعيين تسمية فئة محددة لكل بكسل فردي. على عكس المهام الأبسط مثل تصنيف الصور، الذي يعين تسمية واحدة لصورة بأكملها، أو كشف الكائنات، الذي يرسم مربعات الإحاطة حول الكائنات، توفر التجزئة الدلالية فهماً للمشهد على مستوى البكسل. هذا التحليل الدقيق يعد أمراً بالغ الأهمية للتطبيقات التي يكون فيها الشكل الدقيق والحدود للكائن بنفس أهمية هويته. إنه يتيح للآلات "رؤية" العالم بشكل أقرب لما يراه البشر، مما يميز البكسلات الدقيقة التي تشكل الطريق، أو أحد المشاة، أو ورمًا داخل فحص طبي.
كيف تعمل التجزئة الدلالية#
في جوهرها، تتعامل التجزئة الدلالية مع الصورة كشبكة من البكسلات التي تحتاج إلى تصنيف. نماذج التعلم العميق، وخاصة الشبكات العصبية التلافيفية (CNNs)، هي البنية القياسية لهذه المهمة. تستخدم البنية النموذجية، مثل U-Net واسعة الاستخدام، هيكل مشفر-مفكك تشفير. يقوم المشفر بضغط صورة الإدخال لاستخراج الميزات عالية المستوى (مثل الأنسجة والأشكال)، بينما يقوم مفكك التشفير برفع عينة هذه الميزات مرة أخرى إلى دقة الصورة الأصلية لتوليد قناع تجزئة دقيق.
لتحقيق ذلك، يتم تدريب النماذج على مجموعات بيانات مصنفة كبيرة حيث قام الباحثون البشريون بتلوين كل بكسل بعناية وفقاً لفئته. تسهل الأدوات مثل منصة Ultralytics هذه العملية من خلال توفير ميزات التسمية التلقائية التي تسرع من إنشاء بيانات الحقيقة الأرضية عالية الجودة. بمجرد التدريب، يقوم النموذج بإخراج قناع تتطابق فيه كل قيمة بكسل مع معرف فئة، مما "يرسم" الصورة بالمعنى بفعالية.
التمييز بين المفاهيم ذات الصلة#
من الشائع الخلط بين التجزئة الدلالية ومهام أخرى على مستوى البكسل. يعد فهم الاختلافات أمراً أساسياً لاختيار النهج الصحيح للمشروع:
- تجزئة المثيل: بينما تتعامل التجزئة الدلالية مع جميع الكائنات من نفس الفئة ككيان واحد (على سبيل المثال، جميع "السيارات" ملونة باللون الأزرق)، فإن تجزئة المثيل تميز بين الكائنات الفردية (على سبيل المثال، "السيارة أ" زرقاء، و"السيارة ب" حمراء).
- التجزئة الشاملة: يجمع هذا بين المفهومين معاً. فهو يعين فئة لكل بكسل (دلالي) بينما يفصل أيضاً الحالات الفردية للكائنات القابلة للعد (المثيل)، مما يوفر الفهم الأكثر شمولاً للمشهد.
تطبيقات العالم الحقيقي#
القدرة على تحليل البيانات المرئية بدقة فائقة للبكسل تدفع الابتكار عبر العديد من الصناعات ذات المخاطر العالية:
- الذكاء الاصطناعي في قطاع السيارات: تعتمد المركبات المستقلة بشكل كبير على التجزئة للتنقل بأمان. من خلال تحديد المناطق القابلة للقيادة مقابل الأرصفة، ورسم الخطوط العريضة بدقة للمشاة والسيارات والعوائق، يمكن أنظمة القيادة الذاتية اتخاذ قرارات حاسمة في الوقت الفعلي.
- الذكاء الاصطناعي في الرعاية الصحية: في التصوير الطبي، تجزئ النماذج الأعضاء، أو الآفات، أو الأورام من فحوصات التصوير المقطعي (CT) والتصوير بالرنين المغناطيسي (MRI). هذا يساعد أخصائيي الأشعة في حساب حجم الورم لتخطيط العلاج أو توجيه أدوات الجراحة الروبوتية بدقة متناهية.
- الذكاء الاصطناعي في الزراعة: يستخدم المزارعون صور الطائرات بدون طيار الجوية والتجزئة لمراقبة صحة المحاصيل. من خلال تصنيف البكسلات على أنها "محصول صحي"، أو "أعشاب ضارة"، أو "تربة"، يمكن للأنظمة الآلية استهداف رش مبيدات الأعشاب، مما يقلل من استخدام المواد الكيميائية ويحسن المحصول.
تنفيذ التجزئة باستخدام Ultralytics#
تحتاج نماذج التجزئة الحديثة إلى موازنة الدقة مع السرعة، خاصة للاستدلال في الوقت الفعلي على الأجهزة الطرفية. تتضمن عائلة نماذج Ultralytics YOLO26 نماذج تجزئة متخصصة (مشار إليها باللاحقة -seg) وهي متكاملة تماماً بطبيعتها، مما يوفر أداءً فائقا مقارنة بالبنى الأقدم مثل YOLO11.
يوضح المثال التالي كيفية إجراء التجزئة على صورة باستخدام حزمة Python المسمى ultralytics. ينتج عن هذا أقنعة ثنائية تحدد حدود الكائنات.
from ultralytics import YOLO
# Load a pre-trained YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results
# This will display the image with the segmentation masks overlaid
results[0].show()التحديات والتوجهات المستقبلية#
على الرغم من التقدم الكبير، تظل التجزئة الدلالية كثيفة الاستخدام للحوسبة. يتطلب توليد تصنيف لكل بكسل على حدة موارد GPU وذاكرة كبيرة. يعمل الباحثون بنشاط على تحسين هذه النماذج لتحقيق الكفاءة، واستكشاف تقنيات مثل تكميم النموذج لتشغيل الشبكات الثقيلة على الهواتف المحمولة والأجهزة المدمجة.
علاوة على ذلك، فإن الحاجة إلى مجموعات بيانات ضخمة مصنفة تمثل عنق زجاجة. لمعالجة هذه المشكلة، تتجه الصناعة نحو توليد البيانات الاصطناعية والتعلم المُراقب ذاتياً، مما يسمح للنماذج بالتعلم من الصور الخام دون الحاجة إلى ملايين من تسميات البكسل اليدوية. مع نضوج هذه التقنيات، يمكننا أن نتوقع أن تصبح التجزئة أكثر انتشاراً في الكاميرات الذكية، والروبوتات، وتطبيقات الواقع المعزز.






