Ultralytics YOLO27:
الأدلة

ما تقدير العمق أحادي العين؟ نظرة عامة

تعرّف على كيفية عمل تقدير العمق أحادي العين، وكيف يقارن بطرق تقدير العمق المعتمدة على المستشعرات، وكيف يتيح إدراكًا ثلاثي الأبعاد قابلًا للتوسع في أنظمة الرؤية.

ABAbirami Vina16 min read
خريطة عمق متوقعة أُنشئت باستخدام تقدير العمق أحادي العين

صُممت السيارات ذاتية القيادة لفهم ما يحدث من حولها حتى تتمكن من القيادة بأمان. وهذا يعني تجاوز مجرد التعرّف على أشياء مثل المشاة أو المركبات الأخرى.

بل تحتاج أيضًا إلى معرفة مدى بُعد تلك الأشياء عنها كي تستجيب بطريقة صحيحة. ومع ذلك، فإن منح الآلات هذا الإحساس بالمسافة ليس أمرًا مباشرًا. فعلى خلاف البشر، لا تدرك الآلات العمق من الصور بصورة طبيعية، بل يجب تعليمها ذلك صراحةً.

أحد أسباب ذلك هو أن معظم الكاميرات تلتقط العالم على هيئة صور مسطحة ثنائية الأبعاد. وتحويل هذه الصور إلى شيء يعكس العمق والبنية ثلاثية الأبعاد في العالم الحقيقي أمر معقد، لا سيما عندما تحتاج الأنظمة إلى العمل بشكل موثوق في الظروف اليومية.

من المثير للاهتمام أن الرؤية الحاسوبية، وهي فرع من الذكاء الاصطناعي يركز على تفسير البيانات المرئية وفهمها، تتيح للآلات فهم العالم من الصور بصورة أفضل. فعلى سبيل المثال، يُعد تقدير العمق أحادي العين تقنيةً في الرؤية الحاسوبية تقدّر مسافة الأشياء باستخدام صورة واحدة من كاميرا واحدة فقط.

ومن خلال تعلّم مؤشرات بصرية مثل حجم الجسم والمنظور والملمس والتظليل، تستطيع هذه النماذج التنبؤ بالعمق دون الاعتماد على مستشعرات إضافية مثل قياس الضوء والمدى (LiDAR) أو الكاميرات المجسّمة. في هذه المقالة، سنستكشف ماهية تقدير العمق أحادي العين، وكيفية عمله، وبعض تطبيقاته في العالم الحقيقي. لنبدأ!

مقدمة سريعة إلى تقدير العمق أحادي العين#

يُمكّن تقدير العمق أحادي العين الآلة من فهم مدى بُعد الأشياء عنها باستخدام صورة واحدة فقط. وبما أنه يعتمد على كاميرا واحدة، فإن لهذا النهج مزايا عديدة، منها انخفاض التكلفة وتبسّط متطلبات الأجهزة.

فعلى سبيل المثال، يمكن استخدامه في الروبوتات المنزلية منخفضة التكلفة التي تعمل بكاميرا واحدة. وحتى من صورة واحدة، يستطيع النظام الروبوتي تحديد الجدران الأقرب والأبواب الأبعد، واستنتاج العمق العام للمكان.

غالبًا لا تحتوي الصورة الواحدة على معلومات بالمقياس الصحيح، لذلك يركز تقدير العمق أحادي العين عمومًا على العمق النسبي. وبعبارة أخرى، يمكنه تحديد الأشياء الأقرب والأبعد، حتى إذا لم تكن المسافات الدقيقة معروفة.

عندما يُدرَّب النموذج على بيانات تتضمن مسافات مرجعية حقيقية أو عمقًا مطلقًا، مثل قياسات العمق من مستشعرات كـ LiDAR، يمكنه تعلّم التنبؤ بالمسافات بوحدات العالم الحقيقي، مثل الأمتار. ومن دون هذا النوع من البيانات المرجعية، يظل بإمكان النموذج استنتاج العمق النسبي، لكنه لا يستطيع تقدير المسافات المطلقة بشكل موثوق.

يكون ناتج تقدير العمق أحادي العين عادةً خريطةَ عمق، وهي صورة تمثل فيها كل بكسلة مدى قرب الجزء المقابل لها من المشهد أو بُعده. وتمنح خريطة العمق أنظمة الرؤية فهمًا أساسيًا للبنية ثلاثية الأبعاد للبيئة.

مثال على خريطة عمق متوقعة أُنشئت باستخدام تقدير العمق أحادي العين

الشكل 1. مثال على خريطة عمق متوقعة أُنشئت باستخدام تقدير العمق أحادي العين (المصدر)

من المستشعرات إلى الصور: تقدير العمق#

يمكن التعامل مع تقدير العمق بطرق متعددة، تبعًا للمستشعرات المتاحة وقيود الأجهزة ومتطلبات الدقة. وغالبًا ما تعتمد الطرق التقليدية على وجهات نظر متعددة أو مستشعرات متخصصة لقياس المسافة مباشرةً.

تتمثل إحدى الطرق الشائعة في الرؤية المجسّمة، التي تقدّر العمق من خلال مقارنة صورتين متزامنتين ملتقطتين من وجهتي نظر مختلفتين قليلًا. وبقياس الفرق بين النقاط المتناظرة في الصورتين، يستطيع النظام استنتاج بُعد الأشياء عن الكاميرا.

ومن الطرق الأخرى أنظمة الأحمر والأخضر والأزرق والعمق (RGB-D)، التي تستخدم مستشعرات عمق نشطة لقياس المسافة مباشرةً عند كل بكسلة. ويمكن لهذه الأنظمة توفير معلومات دقيقة عن العمق في البيئات الخاضعة للتحكم، لكنها تتطلب أجهزة إضافية.

في المقابل، تستخدم الطرق القائمة على LiDAR نبضات الليزر لإنشاء تمثيلات ثلاثية الأبعاد دقيقة للمشهد. وعلى الرغم من دقتها العالية، غالبًا ما تكون مستشعرات LiDAR باهظة التكلفة وتضيف تعقيدًا كبيرًا إلى الأجهزة.

وعلى النقيض من ذلك، يستنتج تقدير العمق أحادي العين العمقَ باستخدام صورة RGB واحدة فقط. ولأنه لا يعتمد على كاميرات متعددة أو مستشعرات متخصصة، فمن الأسهل نشره على نطاق واسع، كما أنه خيار مناسب عندما تكون التكلفة وموارد الأجهزة محدودة.

تعلّم العمق من صورة واحدة#

عند تقدير العمق من صورة واحدة، تتعلم نماذج العمق أحادي العين التعرّف على المؤشرات البصرية التي يستخدمها البشر instinctively للحكم على المسافة. وتشمل هذه المؤشرات خطوط المنظور وحجم الجسم وكثافة الملمس وتراكب الأجسام والتظليل، وكلها تقدم دلائل على مدى بُعد الأشياء عن الكاميرا.

تعمل هذه المؤشرات معًا لتكوين إحساس بالعمق. فالأشياء التي تبدو أصغر أو المحجوبة جزئيًا تكون غالبًا أبعد، في حين تشير التفاصيل الأوضح والمظاهر البصرية الأكبر عادةً إلى أن الشيء أقرب.

ولتعلّم هذه الأنماط، تُدرَّب نماذج العمق أحادي العين على مجموعات بيانات صور واسعة النطاق، وغالبًا ما تُقرن بمعلومات عمق جُمعت من مصادر أخرى مثل LiDAR أو الأنظمة المجسّمة. وأثناء التدريب، تتعلم النماذج العلاقة بين المؤشرات البصرية والعمق، ما يتيح لها استنتاج المسافة من صورة واحدة وقت الاستدلال.

وبفضل بيانات التدريب المتنوعة، تستطيع نماذج الرؤية الحديثة تعميم هذا الفهم المكتسب على نطاق واسع من البيئات، بما في ذلك المشاهد الداخلية والخارجية، كما يمكنها التعامل مع وجهات نظر غير مألوفة.

نظرة على تقنيات متنوعة لتقدير العمق أحادي العين#

سنستكشف بعد ذلك الأساليب الرئيسية المستخدمة لتقدير العمق من صورة واحدة، وكيف تطورت هذه الطرق بمرور الوقت.

الأساليب التقليدية والقائمة على الهندسة#

اعتمدت طرق تقدير العمق المبكرة على قواعد بصرية مباشرة مرتبطة بـ هندسة الكاميرا. واستُخدمت مؤشرات مثل المنظور وحجم الجسم وما إذا كان جسم يحجب جسمًا آخر لتقدير المسافة.

فعلى سبيل المثال، عندما يظهر جسمان متشابهان بأحجام مختلفة، يُفترض أن الجسم الأصغر أبعد. وقد عملت هذه الأساليب بشكل مقبول في البيئات الخاضعة للتحكم، حيث ظلت عوامل مثل الإضاءة وموضع الكاميرا وتخطيط المشهد ثابتة.

لكن هذه الافتراضات غالبًا ما تنهار في مشاهد العالم الحقيقي. فقد تؤدي الاختلافات في الإضاءة وتغيرات زاوية الرؤية وزيادة تعقيد المشهد إلى تقديرات عمق غير موثوقة، ما يحد من فعالية الطرق التقليدية في البيئات غير الخاضعة للتحكم.

أساليب تعلّم الآلة المبكرة#

أضفت أساليب تعلّم الآلة المبكرة مرونة أكبر إلى تقدير العمق من خلال تعلّم الأنماط مباشرةً من البيانات. وبدلًا من الاعتماد على قواعد هندسية ثابتة فقط، حاولت هذه النماذج تعلّم العلاقة بين المعلومات المرئية والمسافة، مع التعامل مع التنبؤ بالعمق بوصفه مسألة انحدار تستند إلى مؤشرات مثل الحواف والأنسجة وتغيرات الألوان.

كان اختيار هذه السمات جزءًا أساسيًا من العملية. إذ كان على المهندسين تحديد الإشارات البصرية التي ينبغي استخراجها وكيفية تمثيلها، وكان أداء النموذج يعتمد بدرجة كبيرة على تلك الخيارات.

وعلى الرغم من أن هذا النهج كان أفضل من الأساليب السابقة، فإنه ظل محدودًا. فإذا افتقرت السمات المختارة إلى سياق مهم، كانت تنبؤات العمق أقل دقة. ومع ازدياد تعقيد المشاهد وتنوعها، واجهت هذه النماذج صعوبة متكررة في إنتاج نتائج موثوقة.

خوارزميات التعلّم العميق#

تستخدم معظم أنظمة تقدير العمق أحادي العين الحديثة التعلّم العميق، وهو يشير إلى الشبكات العصبية ذات الطبقات الكثيرة القادرة على تعلّم الأنماط المعقدة من البيانات. تتعلم هذه النماذج التنبؤ بالعمق مباشرةً من الصور وإنتاج خرائط العمق.

تُبنى كثير من الأساليب باستخدام الشبكات العصبية الالتفافية (CNNs)، وهي نوع من الشبكات العصبية المصممة لمعالجة الصور عبر اكتشاف أنماط مثل الحواف والأشكال. وغالبًا ما تستخدم هذه النماذج بنية مُرمِّز–فكّ مُرمِّز: إذ يستخرج المُرمِّز السمات البصرية من الصورة، ويحوّل فكّ المُرمِّز تلك السمات إلى خريطة عمق. وتساعد معالجة الصورة على مقاييس متعددة النموذجَ على التقاط التخطيط العام للمشهد، مع الحفاظ في الوقت نفسه على حدود واضحة للأجسام.

تركز النماذج الأحدث على فهم العلاقات بين الأجزاء المختلفة للصورة. وتستخدم النماذج القائمة على Transformer ونماذج Transformer للرؤية (ViT) آليات الانتباه، التي تتيح للنموذج تحديد مناطق الصورة الأكثر صلة وربط المناطق البعيدة بعضها ببعض. ويساعد ذلك النموذجَ على بناء فهم أكثر اتساقًا للعمق عبر المشهد بأكمله.

تجمع بعض الأنظمة بين الفكرتين. إذ تستخدم النماذج الهجينة CNN–Transformer شبكات CNN لالتقاط التفاصيل المحلية الدقيقة، وTransformers لنمذجة السياق العام للمشهد. وعلى الرغم من أن ذلك يحسن الدقة غالبًا، فإنه يتطلب عادةً موارد حسابية أكبر، مثل ذاكرة إضافية وقدرة معالجة أعلى.

لماذا يُعد فهم العمق مهمًا لأنظمة الذكاء الاصطناعي للرؤية#

أثناء تعلّمك عن تقدير العمق أحادي العين، قد تتساءل عن سبب كون فهم العمق جزءًا مهمًا إلى هذا الحد من أنظمة الذكاء الاصطناعي القائمة على الرؤية.

عندما يستطيع النظام تقدير مدى بُعد الأشياء والأسطح، فإنه يكتسب فهمًا أفضل لتخطيط المشهد والعلاقات بين عناصره المختلفة. ويُعد هذا الوعي المكاني ضروريًا لاتخاذ قرارات موثوقة، لا سيما في تطبيقات العالم الحقيقي مثل القيادة الذاتية.

تضيف معلومات العمق أيضًا سياقًا قيّمًا إلى مهام الرؤية الحاسوبية الأخرى. فعلى سبيل المثال، يمكن لاكتشاف الأجسام، المدعوم بنماذج مثل Ultralytics YOLO26، أن يخبر النظام بما هو موجود في المشهد، لكن العمق يساعد في الإجابة عن مواضع هذه الأجسام بالنسبة إلى الكاميرا وإلى بعضها بعضًا.

وتتيح هذه القدرات مجتمعةً نطاقًا واسعًا من تطبيقات الذكاء الاصطناعي للرؤية، مثل إنشاء خرائط ثلاثية الأبعاد، والتنقل في البيئات المعقدة، وفهم المشهد ككل.

تعتمد الروبوتات والمركبات ذاتية القيادة على هذه المعلومات للتحرك بأمان وتجنب العوائق والاستجابة للتغيرات في الوقت الفعلي. فعلى سبيل المثال، يعتمد نهج Tesla للقيادة المعتمد على الرؤية فقط على صور الكاميرا المقترنة بتقدير العمق، بدلًا من LiDAR، لفهم مدى بُعد الأشياء وكيفية تموضعها على الطريق.

كيف تعمل نماذج تقدير العمق أحادي العين#

على الرغم من اختلاف بنيات النماذج، تتبع معظم نماذج تقدير العمق أحادي العين عمليةً متشابهة لتحويل صورة واحدة إلى خريطة عمق. إليك نظرة سريعة على الخطوات الرئيسية المتضمنة:

  • الإدخال والمعالجة المسبقة: تبدأ سيرورة العمل بصورة إدخال. وقبل تمريرها إلى النموذج، تُعاد عادةً تحجيم الصورة الأصلية وتطبيعها وتحويلها إلى موتر، وهو تنسيق تستخدمه الشبكات العصبية لمعالجة بيانات الصور بكفاءة.
  • استخراج السمات: تحلل شبكة مُرمِّز الصورة لاستخراج السمات البصرية ذات المعنى. وتلتقط هذه السمات معلومات مثل الأنسجة وحدود الأجسام والتخطيط العام للمشهد. وتعمل معظم النماذج على مقاييس متعددة كي تتمكن من فهم التفاصيل الدقيقة والبنية العامة معًا.
  • استدلال العمق: باستخدام السمات المستخرجة، يجمع النموذج بين التفاصيل المحلية والسياق العام للاستدلال بشأن العلاقات المكانية في المشهد. وفي هذه المرحلة، يتعلم أي مناطق الصورة أقرب إلى الكاميرا وأيها أبعد.
  • إنشاء خريطة العمق: يحوّل فكّ المُرمِّز بعد ذلك هذه المعلومات إلى خريطة عمق كثيفة. وتُسند قيمة عمق إلى كل بكسلة في الصورة، غالبًا من خلال دمج التنبؤات من مقاييس مختلفة لتحسين الدقة والاتساق.

كيف تُدرَّب نماذج تقدير العمق أحادي العين#

تفترض العملية التي ناقشناها للتو أن لدينا نموذجًا مُدرَّبًا أو مُدرَّبًا مسبقًا بالفعل. لكن كيف يعمل تدريب نموذج تقدير العمق أحادي العين فعليًا؟

يبدأ التدريب بإعداد بيانات الصور بحيث تتمكن الشبكة من معالجتها بكفاءة. تُعاد تحجيم صور الإدخال وتطبيعها إلى مقياس متسق، ثم تمرر عبر النموذج لإنشاء خريطة عمق متوقعة تقدّر المسافة عند كل بكسلة.

ثم تُقارن خريطة العمق المتوقعة ببيانات العمق المرجعية باستخدام دالة خسارة تقيس مدى ابتعاد تنبؤ النموذج عن العمق الحقيقي المرجعي. وتمثل قيمة الخسارة هذه الخطأ الحالي للنموذج، وتوفر إشارة للتحسين.

يستخدم المُحسِّن هذه الإشارة لتحديث النموذج عبر ضبط أوزانه الداخلية. ولتنفيذ ذلك، يحسب المُحسِّن التدرج الذي يصف كيفية تغير الخسارة بالنسبة إلى كل مَعلمة من معلمات النموذج، ويطبق هذه التحديثات مرارًا على عدة عصور تدريبية، أي تمريرات كاملة عبر مجموعة بيانات التدريب.

تسترشد عملية التدريب التكرارية بالتعلّم الخاضع للإشراف بمعلمات فائقة مثل معدل التعلّم، الذي يتحكم في حجم كل خطوة تحديث، وحجم الدفعة، الذي يحدد عدد الصور التي تُعالج في آن واحد. وبما أن التدريب يتضمن عددًا كبيرًا من العمليات الرياضية، فإنه يُسرَّع عادةً باستخدام وحدة معالجة الرسومات (GPU)، وهي مناسبة جدًا للحوسبة المتوازية.

بعد اكتمال التدريب، يُقيَّم النموذج باستخدام مقاييس تقييم قياسية على مجموعة تحقق تتكون من صور لم تُستخدم أثناء التدريب. ويساعد هذا التقييم في قياس مدى تعميم النموذج على البيانات الجديدة.

يمكن بعد ذلك إعادة استخدام النموذج المُدرَّب أو ضبطه دقيقًا لسيناريوهات جديدة. وبوجه عام، تتيح عملية التدريب هذه لنماذج تقدير العمق أحادي العين إنتاج تقديرات عمق متسقة، وهي ضرورية للمهام اللاحقة مثل إعادة البناء ثلاثي الأبعاد والنشر في العالم الحقيقي.

استكشاف النماذج المتطورة واتجاهات البحث#

تحسن تقدير العمق أحادي العين بسرعة مع ازدياد قدرة النماذج على فهم المشاهد بأكملها بدلًا من التفاصيل البصرية الصغيرة فقط. وكانت الأساليب السابقة تنتج غالبًا خرائط عمق غير متجانسة، لا سيما في البيئات المعقدة.

تركز النماذج الأحدث، كما يظهر في الأبحاث الحديثة المنشورة على arXiv، بدرجة أكبر على السياق العام، ما يؤدي إلى تنبؤات عمق تبدو أكثر استقرارًا وواقعية. وقد ساعدت نماذج معروفة مثل MiDaS وDPT في دفع هذا التحول، من خلال تعلّم العمق من مجموعات بيانات متنوعة وعالية الدقة، والتعميم جيدًا عبر العديد من المشاهد.

وتبني نماذج أحدث، منها ZoeDepth وDepth Anything V2، على هذا العمل من خلال تحسين اتساق المقياس مع الحفاظ على أداء قوي عبر نطاق واسع من الإعدادات. وغالبًا ما يُقاس هذا النوع من التقدم باستخدام مجموعات بيانات معيارية شائعة مثل KITTI وNYU، التي تغطي المشاهد الخارجية والداخلية معًا.

ومن الاتجاهات الواضحة الأخرى تحقيق التوازن بين الدقة والعملية. فالنماذج الأصغر محسّنة للسرعة ويمكنها العمل في الوقت الفعلي على الأجهزة الطرفية أو المحمولة، بينما تعطي النماذج الأكبر الأولوية للدقة الأعلى ودقة العمق على المدى البعيد.

تطبيقات تقدير العمق أحادي العين#

سنستعرض بعد ذلك بعض الأمثلة الواقعية التي توضح كيفية استخدام تقدير العمق أحادي العين للاستدلال على البنية ثلاثية الأبعاد للمشهد من صورة واحدة.

في جميع هذه الحالات، من المهم تذكّر أن معلومات العمق هي تقدير مستنتج من المؤشرات البصرية، وليست قياسًا دقيقًا. وهذا يجعل تقدير العمق أحادي العين مفيدًا لفهم التخطيط النسبي والعلاقات المكانية، لكنه ليس بديلًا عن المستشعرات المصممة لقياس المسافة بدقة، مثل LiDAR أو الأنظمة المجسّمة.

رسم خرائط التضاريس والتنقل باستخدام الطائرات المسيّرة#

غالبًا ما تعمل الطائرات المسيّرة في بيئات تكون فيها إشارات GPS غير موثوقة، مثل الغابات ومواقع الإنشاء ومناطق الكوارث أو المناطق الحضرية الكثيفة. ولكي تطير بأمان في هذه الظروف، تحتاج إلى فهم التضاريس المحيطة ومعرفة مدى بُعد العوائق. وفي الماضي، كان ذلك يتطلب عادةً إضافة مستشعرات مثل LiDAR أو الكاميرات المجسّمة، ما يزيد الوزن واستهلاك الطاقة والتكلفة الإجمالية.

يمثل تقدير العمق أحادي العين بديلًا أبسط. فباستخدام كاميرا RGB واحدة فقط، تستطيع الطائرات المسيّرة تقدير العمق من الصور وبناء فهم ثلاثي الأبعاد أساسي لبيئتها. ويتيح لها ذلك اكتشاف عوائق مثل المباني والأشجار أو التغيرات المفاجئة في التضاريس، وتعديل مسار طيرانها في الوقت الفعلي.

تدعم تقديرات العمق هذه مهام التنقل الأساسية، ومنها تجنب العوائق والتحكم في الارتفاع والهبوط الآمن. ونتيجةً لذلك، تستطيع الطائرات المسيّرة خفيفة الوزن تنفيذ مهام رسم الخرائط والفحص والتنقل دون الاعتماد على مستشعرات عمق متخصصة.

استخدام تقدير العمق أحادي العين لتحليل صور الطائرات المسيّرة

الشكل 2. يمكن استخدام تقدير العمق أحادي العين لتحليل صور الطائرات المسيّرة (المصدر)

استكمال النقاط العمياء للمركبات ذاتية القيادة المخصصة للسباقات#

تعتمد المركبات ذاتية القيادة عادةً بدرجة كبيرة على مستشعرات LiDAR، التي تستخدم نبضات الليزر لقياس المسافة وبناء رؤية ثلاثية الأبعاد للطريق. وعلى الرغم من دقته العالية، قد يواجه LiDAR صعوبة عند قمم الطرق الحادة أو المنحدرات الشديدة أو الحجب أو الميل المفاجئ للمركبة، وقد يعيد أحيانًا بيانات عمق متفرقة أو مفقودة.

يمكن لتقدير العمق أحادي العين المساعدة في سد هذه الفجوات من خلال توفير معلومات عمق كثيفة من صورة RGB واحدة، حتى عندما تكون بيانات LiDAR غير مكتملة. تخيل سيناريو تقترب فيه سيارة ذاتية القيادة بسرعة من قمة تل. فقد تتجاوز حزم LiDAR الطريق الواقع بعد القمة، ما يترك حالة من عدم اليقين بشأن ما ينتظر السيارة.

لكن تقدير العمق القائم على الكاميرا يستطيع مع ذلك استنتاج شكل الطريق من مؤشرات بصرية مثل المنظور والملمس، ما يساعد المركبة على الحفاظ على إدراك موثوق إلى أن تستقر بيانات LiDAR. ويتيح LiDAR وتقدير العمق أحادي العين معًا إدراكًا أكثر استقرارًا وتحكمًا أكثر أمانًا في ظروف القيادة الصعبة.

تصوير مرئي لاستخدام تقدير العمق أحادي العين في السباقات الذاتية القيادة

الشكل 3. تصوير مرئي لاستخدام تقدير العمق أحادي العين في السباقات الذاتية القيادة (المصدر)

تنقل الروبوتات وتجنب العوائق#

غالبًا ما تُشغَّل الروبوتات في أماكن لا تتوفر فيها خرائط تفصيلية، وتتغير فيها الظروف باستمرار. ولكي تتحرك بأمان، تحتاج إلى إدراك موثوق لمقدار المساحة المحيطة بها ومواقع العوائق.

يمكن لتقدير العمق أحادي العين توفير هذا الوعي المكاني باستخدام كاميرا RGB واحدة، دون الاعتماد على أجهزة ثقيلة أو باهظة التكلفة. ومن خلال تعلّم مؤشرات بصرية مثل المقياس والمنظور، تستطيع نماذج تقدير العمق إنشاء خرائط عمق كثيفة للمحيط. ويمنح ذلك الروبوتات رؤية واضحة للمسافة إلى الأسطح والأجسام.

وعلى وجه الخصوص، عندما تُدمج معلومات العمق مع مهام الرؤية الحاسوبية مثل اكتشاف الأجسام والتجزئة الدلالية، يمكن للروبوتات اكتساب رؤية أشمل لبيئتها. إذ تستطيع تحديد الأجسام وفهم مسافاتها وتقرير الأماكن الآمنة للتحرك. ويدعم ذلك تجنب العوائق واكتشاف المساحات الخالية وتخطيط المسار في الوقت الفعلي.

اكتشاف الأجسام باستخدام تقدير العمق أحادي العين واكتشاف الأجسام

الشكل 4. اكتشاف الأجسام باستخدام تقدير العمق أحادي العين واكتشاف الأجسام (المصدر)

إيجابيات وسلبيات تقدير العمق أحادي العين#

فيما يلي بعض المزايا الرئيسية لاستخدام تقدير العمق أحادي العين:

  • خفيف وفعّال من حيث استهلاك الطاقة: يؤدي استخدام كاميرا واحدة إلى تقليل وزن النظام واستهلاك الطاقة، وهو أمر مهم بصفة خاصة للروبوتات المتنقلة والطائرات المسيّرة والأنظمة المضمّنة.
  • ملائم لدمج المستشعرات: يمكن للعمق أحادي العين أن يكمل مستشعرات أخرى، مثل LiDAR أو الرادار، من خلال سد الفجوات أو توفير التكرار.
  • يعمل في بيئات متعددة: يمكن استخدام النهج نفسه القائم على الكاميرا داخل المباني وخارجها وعبر منصات مختلفة، دون الحاجة إلى تغييرات في الأجهزة.

مع أن تقدير العمق أحادي العين يقدم فوائد واضحة، فإليك بعض القيود التي ينبغي أخذها في الاعتبار:

  • دقة أقل من المستشعرات النشطة: رغم تحسنه السريع، لا يستطيع تقدير العمق أحادي العين عمومًا مجاراة الدقة المطلقة لـ LiDAR أو مستشعرات الضوء المنظم في الظروف الخاضعة للتحكم.
  • الحساسية لظروف الإضاءة: قد يتدهور الأداء في البيئات منخفضة الإضاءة أو عند وجود ظلال قوية أو وهج أو مشاهد ذات نسيج ضعيف.
  • تحديات التعميم: قد لا ينتقل النموذج المدرَّب في بيئة واحدة بشكل موثوق دائمًا إلى مجالات غير مرئية من دون تكييف أو ضبط دقيق.

متى ينبغي عدم الاعتماد على تقدير العمق أحادي العين#

مع أن تقدير العمق أحادي العين مجال بحثي مثير للاهتمام، فمن المهم فهم المواضع التي يمكن استخدامه فيها عمليًا والمواضع التي لا يمكن استخدامه فيها. فالمسافات التي ينتجها هي تقديرات تستند إلى ما يراه النموذج في الصورة، وليست قياسات دقيقة مأخوذة من العالم الحقيقي.

ولهذا السبب، قد تتغير جودة النتائج تبعًا لعوامل مثل الإضاءة وتعقيد المشهد ومدى تشابه المشهد مع البيانات التي تدرب عليها النموذج. ويكون تقدير العمق أحادي العين جيدًا عادةً في تحديد ما هو أقرب وما هو أبعد، لكنه لا يُعد موثوقًا عندما تكون المسافات الدقيقة مطلوبة.

في الحالات التي تكون فيها الدقة بالغة الأهمية، مثل الأنظمة الحساسة للسلامة أو الفحص الصناعي أو الروبوتات التي تحتاج إلى التفاعل بدقة شديدة مع الأجسام، يجب قياس العمق مباشرةً. فالمستشعرات مثل LiDAR والرادار والكاميرات المجسّمة وأنظمة الضوء المنظم مصممة لهذا الغرض، وتوفر معلومات أكثر موثوقية بكثير عن المسافة.

وقد يواجه تقدير العمق أحادي العين صعوبة أيضًا في الظروف البصرية الصعبة. فالإضاءة السيئة والظلال القوية والأسطح العاكسة أو الشفافة والضباب والدخان أو المشاهد ذات النسيج البصري القليل جدًا، كلها عوامل قد تجعل تقديرات العمق أقل موثوقية. ويُعد تقدير العمق على مسافات طويلة حالة أخرى تعمل فيها المستشعرات المخصصة عادةً بشكل أفضل.

عندما يتعلق الأمر بالحلول الواقعية، يعمل تقدير العمق أحادي الكاميرا على أفضل نحو كأداة مساندة وليس حلاً مستقلاً. ويمكنه إضافة سياق مكاني مفيد، والمساعدة في سد الفجوات عندما تكون المستشعرات الأخرى محدودة، وتحسين الفهم العام للمشهد. ومع ذلك، لا ينبغي أن يكون المصدر الوحيد لمعلومات العمق عندما تكون الدقة أو السلامة أو متطلبات الموثوقية الصارمة مهمة.

أهم النقاط المستخلصة#

تقدير العمق أحادي الكاميرا هو تقنية في مجال الرؤية الحاسوبية تُمكّن الآلات من تقدير بُعد الأجسام باستخدام صورة واحدة من كاميرا واحدة فقط. ومن خلال تعلّم المؤشرات البصرية مثل المنظور وحجم الجسم والملمس والتظليل، تستطيع نماذج الذكاء الاصطناعي هذه استنتاج البنية ثلاثية الأبعاد للمشهد دون الاعتماد على مستشعرات مثل LiDAR أو الكاميرات المجسمة. وهذا يجعل تقدير العمق أحادي الكاميرا نهجًا فعالاً من حيث التكلفة وقابلاً للتوسع لتطبيقات مثل القيادة الذاتية والروبوتات وفهم المشاهد ثلاثية الأبعاد.

لاستكشاف المزيد حول الذكاء الاصطناعي للرؤية، تفضل بزيارة مستودعنا على GitHub والانضمام إلى مجتمعنا. اطلع على صفحات حلولنا للتعرّف على الذكاء الاصطناعي في مجال الروبوتات والرؤية الحاسوبية في قطاع التصنيع. اكتشف خيارات الترخيص لدينا للبدء باستخدام الرؤية الحاسوبية اليوم!

Explore solutions

الرؤية الحاسوبية للصور الجوية

الرؤية الحاسوبية للصور الجوية

حوّل الصور الجوية وصور الطائرات بدون طيار إلى رؤى فورية للزراعة، والاستزراع المائي، والرصد البيئي، والحفاظ على البيئة، والتحليل الجغرافي المكاني باستخدام Ultralytics YOLO.
معرفة المزيد
الرؤية الحاسوبية في قطاع الفضاء الجوي

الرؤية الحاسوبية في قطاع الفضاء الجوي

اجلب الرؤية الحاسوبية المعتمدة على الذكاء الاصطناعي إلى المراقبة الجوية باستخدام نماذج Ultralytics YOLO. قم بتشغيل الطائرات بدون طيار، وتدفقات عمل الفضاء الجوي، والحفاظ على البيئة، والصناعات الجيوسياسية باستخدام حلول الرؤية الحاسوبية.
معرفة المزيد

احمِ كل موقع باستخدام نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي للرؤية على تشغيل مراقبة المحيطات، واكتشاف التهديدات، التعرف على لوحات السيارات، وسلامة مكان العمل.
معرفة المزيد
الرؤية الحاسوبية في الروبوتات

الرؤية الحاسوبية في الروبوتات

عزّز أداء الآلات الأكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية والإدراك وتتبع الأجسام والتحكم في الوقت الفعلي.
معرفة المزيد
الرؤية الحاسوبية في الخدمات اللوجستية

الرؤية الحاسوبية في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. يتيح الذكاء الاصطناعي للرؤية فحص الطرود وفرزها وتتبع المركبات ومراقبة سلامة المستودعات في الوقت الفعلي.
معرفة المزيد
الرؤية الحاسوبية في تجارة التجزئة

الرؤية الحاسوبية في تجارة التجزئة

أعد تصور تجارة التجزئة باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية تتبع المخزون ومراقبة الرفوف وإدارة الطوابير وتحليلات العملاء الأكثر ذكاءً.
معرفة المزيد
الرؤية الحاسوبية في الرعاية الصحية

الرؤية الحاسوبية في الرعاية الصحية

أنشئ حلولًا للرعاية الصحية باستخدام نماذج Ultralytics YOLO. تعمل الرؤية بالذكاء الاصطناعي في مجال الرعاية الصحية على تسريع التصوير الطبي، وتحسين التشخيص، ومراقبة المرضى.
معرفة المزيد
الرؤية الحاسوبية في التصنيع

الرؤية الحاسوبية في التصنيع

حسّن التصنيع باستخدام نماذج Ultralytics YOLO. تدفع الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لـPPE، وأتمتة خطوط التجميع.
معرفة المزيد
الرؤية الحاسوبية في قطاع السيارات

الرؤية الحاسوبية في قطاع السيارات

طبّق الرؤية الحاسوبية في قطاع السيارات باستخدام نماذج Ultralytics YOLO. يعزز الذكاء الاصطناعي للرؤية سلامة الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
معرفة المزيد
الرؤية الحاسوبية في الزراعة

الرؤية الحاسوبية في الزراعة

أضف الذكاء الاصطناعي للرؤية إلى الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة لتحقيق إنتاجية أعلى وأكثر ذكاءً.
معرفة المزيد
الرؤية الحاسوبية للصور الجوية

الرؤية الحاسوبية للصور الجوية

حوّل الصور الجوية وصور الطائرات بدون طيار إلى رؤى فورية للزراعة، والاستزراع المائي، والرصد البيئي، والحفاظ على البيئة، والتحليل الجغرافي المكاني باستخدام Ultralytics YOLO.
معرفة المزيد
الرؤية الحاسوبية في قطاع الفضاء الجوي

الرؤية الحاسوبية في قطاع الفضاء الجوي

اجلب الرؤية الحاسوبية المعتمدة على الذكاء الاصطناعي إلى المراقبة الجوية باستخدام نماذج Ultralytics YOLO. قم بتشغيل الطائرات بدون طيار، وتدفقات عمل الفضاء الجوي، والحفاظ على البيئة، والصناعات الجيوسياسية باستخدام حلول الرؤية الحاسوبية.
معرفة المزيد

احمِ كل موقع باستخدام نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي للرؤية على تشغيل مراقبة المحيطات، واكتشاف التهديدات، التعرف على لوحات السيارات، وسلامة مكان العمل.
معرفة المزيد
الرؤية الحاسوبية في الروبوتات

الرؤية الحاسوبية في الروبوتات

عزّز أداء الآلات الأكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية والإدراك وتتبع الأجسام والتحكم في الوقت الفعلي.
معرفة المزيد
الرؤية الحاسوبية في الخدمات اللوجستية

الرؤية الحاسوبية في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. يتيح الذكاء الاصطناعي للرؤية فحص الطرود وفرزها وتتبع المركبات ومراقبة سلامة المستودعات في الوقت الفعلي.
معرفة المزيد
الرؤية الحاسوبية في تجارة التجزئة

الرؤية الحاسوبية في تجارة التجزئة

أعد تصور تجارة التجزئة باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية تتبع المخزون ومراقبة الرفوف وإدارة الطوابير وتحليلات العملاء الأكثر ذكاءً.
معرفة المزيد
الرؤية الحاسوبية في الرعاية الصحية

الرؤية الحاسوبية في الرعاية الصحية

أنشئ حلولًا للرعاية الصحية باستخدام نماذج Ultralytics YOLO. تعمل الرؤية بالذكاء الاصطناعي في مجال الرعاية الصحية على تسريع التصوير الطبي، وتحسين التشخيص، ومراقبة المرضى.
معرفة المزيد
الرؤية الحاسوبية في التصنيع

الرؤية الحاسوبية في التصنيع

حسّن التصنيع باستخدام نماذج Ultralytics YOLO. تدفع الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لـPPE، وأتمتة خطوط التجميع.
معرفة المزيد
الرؤية الحاسوبية في قطاع السيارات

الرؤية الحاسوبية في قطاع السيارات

طبّق الرؤية الحاسوبية في قطاع السيارات باستخدام نماذج Ultralytics YOLO. يعزز الذكاء الاصطناعي للرؤية سلامة الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
معرفة المزيد
الرؤية الحاسوبية في الزراعة

الرؤية الحاسوبية في الزراعة

أضف الذكاء الاصطناعي للرؤية إلى الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة لتحقيق إنتاجية أعلى وأكثر ذكاءً.
معرفة المزيد
الرؤية الحاسوبية للصور الجوية

الرؤية الحاسوبية للصور الجوية

حوّل الصور الجوية وصور الطائرات بدون طيار إلى رؤى فورية للزراعة، والاستزراع المائي، والرصد البيئي، والحفاظ على البيئة، والتحليل الجغرافي المكاني باستخدام Ultralytics YOLO.
معرفة المزيد
الرؤية الحاسوبية في قطاع الفضاء الجوي

الرؤية الحاسوبية في قطاع الفضاء الجوي

اجلب الرؤية الحاسوبية المعتمدة على الذكاء الاصطناعي إلى المراقبة الجوية باستخدام نماذج Ultralytics YOLO. قم بتشغيل الطائرات بدون طيار، وتدفقات عمل الفضاء الجوي، والحفاظ على البيئة، والصناعات الجيوسياسية باستخدام حلول الرؤية الحاسوبية.
معرفة المزيد

احمِ كل موقع باستخدام نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي للرؤية على تشغيل مراقبة المحيطات، واكتشاف التهديدات، التعرف على لوحات السيارات، وسلامة مكان العمل.
معرفة المزيد
الرؤية الحاسوبية في الروبوتات

الرؤية الحاسوبية في الروبوتات

عزّز أداء الآلات الأكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية والإدراك وتتبع الأجسام والتحكم في الوقت الفعلي.
معرفة المزيد
الرؤية الحاسوبية في الخدمات اللوجستية

الرؤية الحاسوبية في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. يتيح الذكاء الاصطناعي للرؤية فحص الطرود وفرزها وتتبع المركبات ومراقبة سلامة المستودعات في الوقت الفعلي.
معرفة المزيد
الرؤية الحاسوبية في تجارة التجزئة

الرؤية الحاسوبية في تجارة التجزئة

أعد تصور تجارة التجزئة باستخدام نماذج Ultralytics YOLO. يدعم الذكاء الاصطناعي للرؤية تتبع المخزون ومراقبة الرفوف وإدارة الطوابير وتحليلات العملاء الأكثر ذكاءً.
معرفة المزيد
الرؤية الحاسوبية في الرعاية الصحية

الرؤية الحاسوبية في الرعاية الصحية

أنشئ حلولًا للرعاية الصحية باستخدام نماذج Ultralytics YOLO. تعمل الرؤية بالذكاء الاصطناعي في مجال الرعاية الصحية على تسريع التصوير الطبي، وتحسين التشخيص، ومراقبة المرضى.
معرفة المزيد
الرؤية الحاسوبية في التصنيع

الرؤية الحاسوبية في التصنيع

حسّن التصنيع باستخدام نماذج Ultralytics YOLO. تدفع الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لـPPE، وأتمتة خطوط التجميع.
معرفة المزيد
الرؤية الحاسوبية في قطاع السيارات

الرؤية الحاسوبية في قطاع السيارات

طبّق الرؤية الحاسوبية في قطاع السيارات باستخدام نماذج Ultralytics YOLO. يعزز الذكاء الاصطناعي للرؤية سلامة الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
معرفة المزيد
الرؤية الحاسوبية في الزراعة

الرؤية الحاسوبية في الزراعة

أضف الذكاء الاصطناعي للرؤية إلى الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة لتحقيق إنتاجية أعلى وأكثر ذكاءً.
معرفة المزيد

لنبنِ مستقبل الذكاء الاصطناعي معًا!

ابدأ رحلتك مع مستقبل التعلم الآلي