Semantic Mapping
تعرّف على كيفية جمع التخطيط الدلالي بين التجزئة الدلالية والعمق وتحديد الموقع ودمج المستشعرات لتحقيق ملاحة روبوتية أكثر ذكاءً باستخدام Ultralytics YOLO26.
الخرائط الدلالية هي عملية بناء تمثيل مكاني لبيئة ما وإرفاق تسميات فئوية ذات معنى—مثل الطريق أو الجدار أو المدخل أو الشخص أو الرف أو الغطاء النباتي—بالمواقع الموجودة فيها. وفي الذكاء الاصطناعي والروبوتات، تجيب الخريطة الدلالية عن سؤالَي «أين يوجد الشيء؟» و«ما هو؟». وبدلاً من تمثيل المشهد على أنه مساحة مشغولة وأخرى حرة فقط، توفر الخريطة معلومات سياقية تدعم الملاحة والتخطيط والتفاعل وفهم المشهد.
كيفية عمل الخرائط الدلالية#
يجمع نظام الخرائط الدلالية عادةً بين الإدراك والهندسة وتحديد الموقع والدمج الزمني. أولاً، يصنّف نموذج التجزئة الدلالية كل بكسل في الصورة. فعلى سبيل المثال، تشكّل جميع وحدات البكسل المصنّفة على أنها «طريق» منطقة طريق، بينما تحدد وحدات البكسل المصنّفة على أنها «سيارة» مناطق المركبات. ويوضح مقدمة NVIDIA حول تجزئة الصور في الروبوتات كيف تدعم هذه التسميات الخاصة بكل بكسل إدراك الروبوت.
تظل تسميات وحدات البكسل وحدها مرتبطة بصورة الكاميرا الثنائية الأبعاد. ويحتاج النظام إلى الهندسة، التي تُستمد غالباً من LiDAR أو الكاميرات المجسمة أو تقدير العمق، لربط وحدات البكسل بمواضع مادية. ويوضح سير عمل صور RGB-D في Open3D كيف يمكن لصور الألوان والعمق المسجّلة أن تنتج سحابة نقاط ثلاثية الأبعاد.
يعتمد الإسقاط الدقيق أيضاً على المعلمات الداخلية والخارجية للكاميرا. وتشرح وثائق معايرة الكاميرا في OpenCV المعلمات المستخدمة لربط وحدات بكسل الصورة بالنقاط ثلاثية الأبعاد، بينما يوفّر تعريف رسالة CameraInfo في ROS توحيداً لمعلومات المعايرة هذه في الأنظمة الروبوتية.
وأخيراً، يدمج دمج المستشعرات الملاحظات بمرور الوقت. وتضع أوضاع الروبوتات وتحويلات الإحداثيات كل ملاحظة موسومة في إطار خريطة مشترك. وتوفر تحويلات الإحداثيات tf2 في ROS آلية شائعة للحفاظ على هذه العلاقات.
المفاهيم ذات الصلة والفروق الرئيسية#
تتداخل الخرائط الدلالية مع عدة مفاهيم في الرؤية الحاسوبية والروبوتات، لكنها تعالج مشكلات مختلفة:
- تحديد الموقع ورسم الخرائط المتزامنان بصرياً (Visual SLAM) يقدّران موضع الكاميرا أو الروبوت أثناء إنشاء خريطة هندسية. وتضيف الخرائط الدلالية معنى الفئات إلى تلك الهندسة. ولذلك قد يستخدم النظام SLAM لتقدير الوضعية والإدراك الدلالي لإجراء وضع التسميات.
- خرائط الإشغال تصف ما إذا كانت الخلايا حرة أو مشغولة أو غير معروفة. ويشرح دليل رسم الخرائط وتحديد الموقع في Nav2 كيف تدعم شبكات الإشغال تخطيط المسارات. ويمكن للخريطة الدلالية أن تميّز، بالإضافة إلى ذلك، بين جدار وشخص أو بين طريق قابل للقيادة ورصيف.
- تجزئة الكيانات تفصل بين الكائنات الفردية، مثل سيارتين مختلفتين. أما التجزئة الدلالية فتجمع السيارتين ضمن فئة بكسل واحدة. وقد تستخدم الخرائط الدلالية أيّاً من التمثيلين، بحسب ضرورة الحفاظ على هوية الكائن من عدمها.
- البحث الدلالي ينظّم المعلومات وفق التشابه المفاهيمي، بينما تربط الخرائط الدلالية في الروبوتات المعاني بالمواقع المادية.
التطبيقات الواقعية#
الملاحة الذاتية: يستطيع روبوت توصيل تصنيف الأرضيات على أنها قابلة للعبور، والجدران والبردورات على أنها عوائق، والأشخاص على أنهم مخاطر متحركة. ويمكن تحويل هذه التسميات إلى تكاليف ملاحية بحيث يفضّل المخطّط الأسطح الآمنة بدلاً من التعامل مع كل منطقة مرئية بالطريقة نفسها. ويوضح البرنامج التعليمي للملاحة بالتجزئة الدلالية في Nav2 كيف يمكن لأقنعة الفئات وسحب النقاط المسجّلة تحديث خريطة تكلفة الروبوت.
القيادة في المناطق الحضرية: يمكن لمركبة ذاتية القيادة إسقاط تنبؤات الطرق والأرصفة والمباني والغطاء النباتي والمشاة والمركبات في خريطة عالمية مستمرة. ويساعد ذلك النظام على فهم حدود المسارات، والتعرّف على المناطق غير القابلة للقيادة، والاستدلال على الأماكن التي قد يظهر فيها مستخدمو الطرق المعرّضون للخطر. وتوفر مجموعة بيانات Cityscapes للمشاهد الحضرية الرسمية صوراً شوارع ذات تسميات كثيفة لتطوير هذا النوع من فهم المشاهد.
الإدراك الدلالي باستخدام Ultralytics YOLO#
ينتج سير عمل التجزئة الدلالية في Ultralytics التالي خريطة فئات كثيفة باستخدام YOLO26. ويمكن لاحقاً إسقاط هذا الناتج في شبكة ثنائية الأبعاد أو نظام إحداثيات عالمي ثلاثي الأبعاد بواسطة خط أنابيب لرسم الخرائط.
from ultralytics import YOLO
# Load a pretrained semantic segmentation model
model = YOLO("yolo26n-sem.pt")
# Predict a per-pixel class map
results = model("https://ultralytics.com/images/bus.jpg")
# Select the first result and inspect its map dimensions
result = results[0]
class_map = result.semantic_mask.data
print(class_map.shape)
result.save(filename="semantic_scene.jpg")يحتوي semantic_mask على معرّف فئة واحد لكل بكسل في الصورة. وهو يوفر طبقة الإدراك الدلالي، بينما يظل العمق والمعايرة وتحديد الموقع والدمج الزمني ضرورية لإنشاء خريطة مكانية مستمرة. ويمكن وسم مجموعات البيانات المخصصة على مستوى البكسل وإدارتها باستخدام أدوات التعليق التوضيحي في منصة Ultralytics.
اعتبارات التصميم العملية#
تتطلب الخرائط الدلالية الموثوقة تعريفات فئات متسقة، ومعايرة دقيقة للمستشعرات، وطوابع زمنية متزامنة، وبيانات تدريب ممثلة للواقع. وقد يؤدي انجراف الوضعية إلى وضع التسميات الصحيحة في مواقع غير صحيحة، بينما قد تتسبب أخطاء التجزئة في تصنيف العوائق على أنها مساحة قابلة للعبور. كما تتطلب الكائنات المتحركة قواعد لانتهاء الصلاحية أو للتتبع حتى لا تظل مركبة متوقفة أو أحد المشاة مضمّناً في الخريطة بشكل دائم.
ينبغي للفرق التحقق من دقة الإدراك والاتساق المكاني معاً، واختبار الحدود الصعبة والبُنى الصغيرة، والاحتفاظ بدرجة الثقة في التنبؤ كلما أمكن، وتحديد كيفية تحديث الملاحظات المتعارضة. وفي الملاحة الحساسة للسلامة، ينبغي أن تكمل المعلومات الدلالية—لا أن تستبدل تلقائياً—استشعار العوائق الهندسية وفحوصات التصادم.









