3D Object Detection
استكشف اكتشاف الكائنات ثلاثية الأبعاد لإتقان الإدراك المكاني في الذكاء الاصطناعي. تعرف على كيفية دعم Ultralytics YOLO26 للعمق الواقعي، والاتجاه، وتقدير المربعات المحيطة ثلاثية الأبعاد.
يعد اكتشاف الأشياء ثلاثية الأبعاد مهمة رؤية حاسوبية متطورة تمكن الآلات من تحديد وتحديد موقع وتحديد حجم الأشياء داخل مساحة ثلاثية الأبعاد. على عكس اكتشاف الأشياء ثنائية الأبعاد التقليدي، الذي يرسِم صندوق إحاطة مسطحاً حول عنصر ما في صورة، يقدّر اكتشاف الأشياء ثلاثية الأبعاد جسماً متوازي الأطراف (صندوقاً ثلاثي الأبعاد) يغلف الكائن. يوفر هذا معلومات عمق حاسمة، واتجاه (العنوان)، وأبعاد مكانية دقيقة، مما يسمح للأنظمة بفهم ليس فقط ما هو الكائن، ولكن أين هو تماماً بالنسبة للمستشعر في العالم الحقيقي. هذه القدرة أساسية التقنيات التي تحتاج إلى التفاعل جسدياً مع بيئتها.
كيف يعمل اكتشاف الكائنات ثلاثية الأبعاد#
لإدراك العمق والحجم، تعتمد نماذج الاكتشاف ثلاثي الأبعاد عادةً على مدخلات بيانات أثرى مما توفره الكاميرات القياسية. في حين أن بعض الطرق المتقدمة يمكنها استنتاج هياكل ثلاثية الأبعاد من صور أحادية العدسة، فإن معظم الأنظمة القوية تستخدم بيانات من مستشعرات LiDAR، أو الرادار، أو الكاميرات المجسمة. تولد هذه المستشعرات سحب النقاط - وهي مجموعات ضخمة من نقاط البيانات التي تمثل السطح الخارجي للأشياء.
تتضمن العملية عدة خطوات رئيسية:
- اكتساب البيانات: تلتقط المستشعرات هندسة المشهد. فمثلاً، تستخدم LiDAR نبضات الليزر لقياس المسافات، مما يؤدي إلى إنشاء خريطة دقيقة ثلاثية الأبعاد.
- استخراج الميزات: تعالج نماذج التعلم العميق، المستندة غالباً إلى شبكات العصون التلافيفية (CNNs) أو Transformers، سحابة النقاط أو بيانات الصور المدمجة لتحديد الأنماط.
- توقع صندوق الإحاطة: يُخرج النموذج صندوق إحاطة ثلاثي الأبعاد يتم تحديده بواسطة إحداثيات مركزه (x, y, z)، وأبعاده (الطول، العرض، الارتفاع)، وزاوية الدوران (الانعراج - yaw).
- التصنيف: على غرار تصنيف الصور، يقوم النظام بتعيين تسمية (على سبيل المثال، "مشاة"، "مركبة") للكائن المكتشف.
الفرق بين الاكتشاف ثنائي الأبعاد وثلاثي الأبعاد#
من المهم التمييز بين هذين المفهومين المترابطين.
- اكتشاف الأشياء ثنائية الأبعاد: يعمل على الصور المسطحة (البكسلات). يخبرك أن الكائن موجود في "أعلى اليسار" أو "أسفل اليمين" لإطار ولكنه لا يستطيع تقييم المسافة أو الحجم الحقيقي بدقة بدون علامات مرجعية. إنه مثالي لمهام مثل تحديد عيوب التصنيع أو تحليل تدفقات الفيديو حيث يكون العمق أقل أهمية.
- اكتشاف الكائنات ثلاثية الأبعاد: يعمل في فضاء حجمي (فوكسل أو نقاط). يوفر المسافة من الكاميرا (العمق)، والحجم الفيزيائي للكائن، واتجاهه. وهذا ضروري لمنع الاصطدامات في البيئات الديناميكية.
تطبيقات العالم الحقيقي#
يفتح الانتقال من الإدراك ثنائي الأبعاد إلى ثلاثي الأبعاد حالات استخدام قوية في الصناعات التي تكون فيها السلامة والوعي المكاني أمرين بالغَي الأهمية.
- القيادة الذاتية: تعتمد السيارات ذاتية القيادة بشكل كبير على الاكتشاف ثلاثي الأبعاد للتنقل بأمان. من خلال معالجة البيانات من LiDAR والكاميرات، يمكن للسيارة اكتشاف السيارات الأخرى والمشاة والعوائق، وحساب مسافتها وسرعتها بدقة. هذا يسمح لنظام الإدراك بتنبؤ المسارات واتخاذ قرارات الفرامل أو التوجيه في سيناريوهات الاستدلال في الوقت الفعلي. تستخدم شركات مثل Waymo هذه الحزم الاستشعارية الثقيلة لتعيين البيئات الحضرية فوراً.
- الروبوتات والالتقاط من الصناديق: في الخدمات اللوجستية والتخزين، تحتاج الروبوتات إلى التقاط أشياء بأشكال وأحجام متفاوتة من الصناديق. يمكن الاكتشاف ثلاثي الأبعاد الذراع الروبوتية من فهم اتجاه الطرد، وتحديد أفضل نقطة قبضة، وتخطيط مسار خالي من التصادم لتحريك العنصر. هذا يعزز الكفاءة في الذكاء الاصطناعي في الخدمات اللوجستية عن طريق أتمتة المهام اليدوية المعقدة.
تنفيذ اكتشاف الكائنات باستخدام Ultralytics#
في حين يتطلب الاكتشاف الكامل ثلاثي الأبعاد غالباً بنيات سحب نقاط مخصصة، فإن كواشف ثنائية الأبعاد الحديثة مثل YOLO26 تُستخدم بشكل متزايد كعنصر في تدفقات العمل شبه ثلاثية الأبعاد أو لتقدير العمق من خلال تحجيم صناديق الإحاطة. بالنسبة للمطورين الذين يتطلعون إلى تدريب نماذج على مجموعات بياناتهم الخاصة، توفر منصة Ultralytics بيئة مبسطة للتعليق والتدريب.
فيما يلي مثال بسيط حول كيفية تشغيل الاكتشاف القياسي باستخدام واجهة برمجة تطبيقات Ultralytics Python، والتي غالباً ما تكون الخطوة الأولى في خط معالجة إدراك أكبر:
import cv2
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Perform inference on a local image
results = model("path/to/image.jpg")
# Visualize the results
for result in results:
# Plot predictions on the image (returns a numpy array)
im_array = result.plot()
# Display using OpenCV
cv2.imshow("Detections", im_array)
cv2.waitKey(0) # Press any key to close
cv2.destroyAllWindows()التحديات والاتجاهات المستقبلية#
على الرغم من فائدته، يواجه اكتشاف الأشياء ثلاثية الأبعاد تحديات تتعلق بالتكلفة الحسابية ونفقة المستشعرات. تتطلب معالجة ملايين النقاط في سحابة نقاط طاقة GPU كبيرة، مما يجعل نشرها على أجهزة الحافة أمراً صعباً. ومع ذلك، فإن الابتكار في تكميم النماذج وبنيات الشبكات العصبية الفعالة يقلل من هذا العبء.
علاوة على ذلك، تعمل تقنيات مثل دمج المستشعرات على تحسين الدقة من خلال الجمع بين معلومات الألوان الغنية للكاميرات وبيانات العمق الدقيقة لـ LiDAR. مع نضج هذه التقنيات، يمكننا توقع رؤية الإدراك ثلاثي الأبعاد مدمجاً في أجهزة أكثر سهولة في الوصول، من نظارات الواقع المعزز إلى الأجهزة المنزلية الذكية.






