Depth Estimation
تعلّم كيف يضيف تقدير العمق منظورًا ثلاثي الأبعاد إلى الرؤية الحاسوبية. استكشف تقنيات مثل العمق أحادي العين والرؤية المجسّمة باستخدام نماذج Ultralytics YOLO26.
يُعدّ تقدير العمق عملية بالغة الأهمية في الرؤية الحاسوبية، إذ يحدد مسافة الأجسام عن الكاميرا، مضيفًا بُعدًا ثالثًا فعليًا إلى الصور ثنائية الأبعاد. ومن خلال حساب بُعد كل بكسل في الصورة، تنشئ هذه التقنية خريطة عمق، وهي تمثيل تتوافق فيه شدة البكسل مع المسافة. وتحاكي هذه القدرة الرؤية المجهرية لدى الإنسان، ما يتيح للآلات إدراك العلاقات المكانية والهندسة. وتُعد هذه التقنية ركيزة أساسية لتمكين الأنظمة الذاتية من التنقل بأمان، وفهم بيئتها، والتفاعل مع الأجسام المادية.
الآليات والتقنيات الأساسية#
توجد عدة طرق لتحقيق تقدير العمق، بدءًا من الحلول القائمة على الأجهزة وصولًا إلى الأساليب البرمجية البحتة التي تستخدم الذكاء الاصطناعي.
- أنظمة الرؤية المجسمة: على غرار عيني الإنسان، تستخدم الرؤية المجسمة كاميرتين موضوعتين جنبًا إلى جنب. تحلل الخوارزميات الفروق الطفيفة، أو التباين، بين الصورتين اليمنى واليسرى لحساب المسافة بالتثليث. ويعتمد ذلك بدرجة كبيرة على مطابقة السمات الدقيقة لتحديد النقاط نفسها في الإطارين.
- تقدير العمق أحادي العين: تقدّر هذه الطريقة المتقدمة العمق من صورة واحدة. وبما أن الصورة الفوتوغرافية ثنائية الأبعاد المفردة تفتقر إلى بيانات عمق متأصلة، تُدرَّب نماذج التعلم العميق على مجموعات بيانات ضخمة للتعرف على الإشارات البصرية مثل المنظور وحجم الجسم والحجب. وتتفوّق البنى الحديثة، مثل الشبكات العصبية الالتفافية (CNNs)، في هذه المهمة، ما يجعل اشتقاق بنية ثلاثية الأبعاد من الكاميرات العادية ممكنًا.
- ليدار وزمن الرحلة (ToF): تبث المستشعرات النشطة، مثل ليدار (LiDAR) وكاميرات زمن الرحلة، نبضات ضوئية وتقيس الزمن الذي تستغرقه للعودة. وتُنشئ هذه الأساليب سحب نقاط عالية الدقة، وتُستخدم غالبًا لجمع بيانات الحقيقة الأرضية لتدريب نماذج التعلم الآلي.
التطبيقات الواقعية#
تُحدث القدرة على تقدير المسافة تحولًا جذريًا في العديد من الصناعات، إذ تُمكّن التطبيقات التي تتطلب وعيًا مكانيًا.
- القيادة الذاتية: تعتمد السيارات ذاتية القيادة على تقدير العمق لاكتشاف العوائق، وقياس المسافة إلى المركبات الأخرى، والتنقل بأمان في شبكات الطرق المعقدة. وتُعد هذه التقنية أساسية لـاكتشاف الأجسام ثلاثية الأبعاد لتحديد المشاة وراكبي الدراجات.
- الروبوتات والأتمتة: تستخدم الروبوتات إدراك العمق في مهام مثل تخطيط المسار ومناولة الأجسام. فعلى سبيل المثال، يحتاج روبوت المستودع إلى معرفة المسافة الدقيقة إلى الرف لالتقاط طرد من دون الاصطدام به.
- الواقع المعزز (AR): لوضع الأجسام الافتراضية بصورة مقنعة داخل مشهد من العالم الحقيقي، يجب أن تفهم أجهزة الواقع المعزز الهندسة ثلاثية الأبعاد للبيئة. ويضمن تقدير العمق إمكانية اختباء الشخصيات الافتراضية خلف الأثاث الحقيقي، وهو مفهوم يُعرف باسم معالجة الحجب.
مثال على التعليمات البرمجية: تقدير العمق أحادي العين#
على الرغم من وجود نماذج متخصصة للعمق، يمكنك غالبًا استنتاج العلاقات المكانية باستخدام صناديق إحاطة اكتشاف الأجسام كبديل تقريبي للمسافة في السيناريوهات البسيطة (فالصناديق الأكبر غالبًا ما تعني أجسامًا أقرب). إليك كيفية تحميل نموذج باستخدام الحزمة ultralytics لاكتشاف الأجسام، وهي الخطوة الأولى في العديد من مسارات المعالجة التي تراعي العمق.
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("path/to/image.jpg")
# Process results
for result in results:
# Get bounding boxes (xyxy format)
boxes = result.boxes.xyxy
# Iterate through detections
for box in boxes:
print(f"Detected object at: {box}")العلاقة بمفاهيم الرؤية الحاسوبية الأخرى#
من المهم التمييز بين تقدير العمق والمصطلحات ذات الصلة. ففي حين يحدد اكتشاف الأجسام ما هو الجسم وأين يوجد في الفضاء ثنائي الأبعاد (باستخدام صندوق إحاطة)، يحدد تقدير العمق مدى بُعده (المحور Z). وبالمثل، يصنّف التقسيم الدلالي البكسلات إلى فئات (مثل الطريق والسماء والسيارة)، بينما يعيّن تقدير العمق قيمة مسافة إلى تلك البكسلات نفسها.
التطورات في الذكاء الاصطناعي المكاني#
يسهم التقدم الحديث في الذكاء الاصطناعي التوليدي في سد الفجوة بين الرؤية ثنائية الأبعاد وثلاثية الأبعاد. وتستخدم تقنيات مثل حقول الإشعاع العصبية (NeRF) صورًا ثنائية الأبعاد متعددة لإعادة بناء مشاهد ثلاثية الأبعاد معقدة، مع اعتماد كبير على مبادئ العمق الأساسية. علاوة على ذلك، مع تحسن تقنيات تحسين النماذج، أصبح تشغيل تقدير عمق عالي الدقة على أجهزة الذكاء الاصطناعي الطرفية ممكنًا. ويتيح ذلك الحوسبة المكانية في الوقت الفعلي على أجهزة صغيرة مثل الطائرات المسيّرة أو النظارات الذكية، بفضل منصات مثل منصة Ultralytics لتدريب النماذج ونشرها بكفاءة.









