3D Object Detection
استكشف اكتشاف الأجسام ثلاثي الأبعاد لإتقان الإدراك المكاني في الذكاء الاصطناعي. تعرّف إلى كيفية تمكين Ultralytics YOLO26 لتقدير العمق والاتجاه وصناديق الإحاطة ثلاثية الأبعاد في العالم الحقيقي.
اكتشاف الأجسام ثلاثية الأبعاد هو مهمة متقدمة في الرؤية الحاسوبية تُمكّن الآلات من تحديد الأجسام وتحديد مواقعها وقياس أحجامها ضمن حيز ثلاثي الأبعاد. وعلى خلاف اكتشاف الأجسام ثنائي الأبعاد التقليدي، الذي يرسم مربع إحاطة مسطحًا حول عنصر في صورة، يقدّر اكتشاف الأجسام ثلاثية الأبعاد متوازي مستطيلات (صندوقًا ثلاثي الأبعاد) يحيط بالجسم. ويوفر ذلك معلومات أساسية عن العمق والاتجاه (السمت) والأبعاد المكانية الدقيقة، مما يتيح للأنظمة فهم ليس فقط ما هو الجسم، بل أيضًا أين يوجد بالضبط بالنسبة إلى المستشعر في العالم الحقيقي. وتُعد هذه القدرة أساسية للتقنيات التي تحتاج إلى التفاعل جسديًا مع بيئتها.
كيفية عمل اكتشاف الأجسام ثلاثية الأبعاد#
لإدراك العمق والحجم، تعتمد نماذج الاكتشاف ثلاثي الأبعاد عادةً على مدخلات بيانات أغنى مما توفره الكاميرات القياسية. وعلى الرغم من أن بعض الأساليب المتقدمة تستطيع استنتاج البنى ثلاثية الأبعاد من الصور أحادية العين (ذات العدسة الواحدة)، فإن معظم الأنظمة المتينة تستخدم بيانات من مستشعرات LiDAR أو الرادار أو الكاميرات المجسمة. وتُنشئ هذه المستشعرات سحبًا نقطية—وهي مجموعات ضخمة من نقاط البيانات التي تمثل السطح الخارجي للأجسام.
تتضمن العملية عدة خطوات رئيسية:
- الحصول على البيانات: تلتقط المستشعرات هندسة المشهد. فعلى سبيل المثال، يستخدم LiDAR نبضات ليزر لقياس المسافات، مما ينشئ خريطة ثلاثية الأبعاد دقيقة.
- استخراج السمات: تعالج نماذج التعلم العميق، التي تستند غالبًا إلى الشبكات العصبية الالتفافية (CNNs) أو Transformers، السحابة النقطية أو بيانات الصور المدمجة لتحديد الأنماط.
- التنبؤ بمربع الإحاطة: يُخرج النموذج مربع إحاطة ثلاثي الأبعاد يُحدَّد بإحداثيات مركزه (x, y, z)، وأبعاده (الطول والعرض والارتفاع)، وزاوية دورانه (الانحراف).
- التصنيف: على غرار تصنيف الصور، يعيّن النظام تسمية (مثل "مشاة" أو "مركبة") للجسم المكتشف.
الفرق بين الاكتشاف ثنائي الأبعاد والاكتشاف ثلاثي الأبعاد#
من المهم التمييز بين هذين المفهومين المرتبطين.
- اكتشاف الأجسام ثنائي الأبعاد: يعمل على صور مسطحة (بكسلات). ويخبرك بأن جسمًا ما يوجد في "أعلى اليسار" أو "أسفل اليمين" من الإطار، لكنه لا يستطيع تقييم المسافة أو الحجم الحقيقي بفعالية من دون علامات مرجعية. وهو مثالي لمهام مثل تحديد عيوب التصنيع أو تحليل بثوث الفيديو حيث يكون العمق أقل أهمية.
- اكتشاف الأجسام ثلاثية الأبعاد: يعمل في حيز حجمي (فوكسلات أو نقاط). ويوفر المسافة من الكاميرا (العمق) والحجم الفعلي للجسم واتجاهه. ويُعد ذلك ضروريًا لمنع التصادمات في البيئات الديناميكية.
التطبيقات الواقعية#
يفتح الانتقال من الإدراك ثنائي الأبعاد إلى الإدراك ثلاثي الأبعاد الباب أمام حالات استخدام قوية في الصناعات التي تكون فيها السلامة والوعي المكاني أمرين بالغيَي الأهمية.
- القيادة الذاتية: تعتمد السيارات ذاتية القيادة اعتمادًا كبيرًا على الاكتشاف ثلاثي الأبعاد للتنقل بأمان. ومن خلال معالجة البيانات الواردة من LiDAR والكاميرات، تستطيع المركبة اكتشاف السيارات الأخرى والمشاة والعوائق، وحساب مسافاتها وسرعاتها بدقة. ويتيح ذلك لنظام الإدراك التنبؤ بالمسارات واتخاذ قرارات الكبح أو التوجيه في سيناريوهات الاستدلال في الوقت الفعلي. وتستخدم شركات مثل Waymo مجموعات المستشعرات المتقدمة هذه لرسم خرائط للبيئات الحضرية فورًا.
- الروبوتات وانتقاء العناصر من الحاويات: في مجالَي الخدمات اللوجستية والتخزين، تحتاج الروبوتات إلى التقاط أجسام ذات أشكال وأحجام مختلفة من الحاويات. ويتيح الاكتشاف ثلاثي الأبعاد لذراع الروبوت فهم اتجاه الطرد، وتحديد أفضل نقطة إمساك، وتخطيط مسار خالٍ من التصادمات لتحريك العنصر. ويعزز ذلك الكفاءة في الذكاء الاصطناعي في الخدمات اللوجستية من خلال أتمتة المهام اليدوية المعقدة.
تنفيذ اكتشاف الأجسام باستخدام Ultralytics#
على الرغم من أن الاكتشاف ثلاثي الأبعاد الكامل يتطلب غالبًا بنيات متخصصة للسحب النقطية، فإن كاشفات الأجسام ثنائية الأبعاد الحديثة مثل YOLO26 تُستخدم بشكل متزايد كعنصر في مسارات العمل شبه ثلاثية الأبعاد أو لتقدير العمق من خلال تغيير مقياس مربع الإحاطة. وبالنسبة إلى المطورين الذين يرغبون في تدريب نماذج على مجموعات بياناتهم الخاصة، توفر منصة Ultralytics بيئة مبسطة للتعليق والتدريب.
فيما يلي مثال بسيط على كيفية تشغيل الاكتشاف القياسي باستخدام واجهة Python البرمجية لـ Ultralytics، وهي غالبًا الخطوة الأولى في مسار إدراك أكبر:
import cv2
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Perform inference on a local image
results = model("path/to/image.jpg")
# Visualize the results
for result in results:
# Plot predictions on the image (returns a numpy array)
im_array = result.plot()
# Display using OpenCV
cv2.imshow("Detections", im_array)
cv2.waitKey(0) # Press any key to close
cv2.destroyAllWindows()التحديات والاتجاهات المستقبلية#
على الرغم من فائدته، يواجه اكتشاف الأجسام ثلاثية الأبعاد تحديات تتعلق بالتكلفة الحاسوبية وتكلفة المستشعرات. وتتطلب معالجة ملايين النقاط في سحابة نقطية قدرة كبيرة من GPU، مما يجعل النشر على الأجهزة الطرفية صعبًا. ومع ذلك، تسهم الابتكارات في تكميم النماذج والبنى العصبية الفعالة في تقليل هذا العبء.
علاوة على ذلك، تعمل تقنيات مثل دمج المستشعرات على تحسين الدقة من خلال الجمع بين معلومات الألوان الغنية من الكاميرات وبيانات العمق الدقيقة من LiDAR. ومع نضوج هذه التقنيات، يمكننا توقع دمج الإدراك ثلاثي الأبعاد في مزيد من الأجهزة المتاحة، بدءًا من نظارات الواقع المعزز ووصولًا إلى الأجهزة المنزلية الذكية.









