يدعم Ultralytics YOLO26 الآن تقدير العمق الأحادي
تعرف على كيفية قيام مهمة تقدير العمق الجديدة في Ultralytics YOLO26 بالتنبؤ بالعمق المتري لكل بكسل من صورة RGB واحدة، دون الحاجة إلى كاميرا مزدوجة أو نظام LiDAR.

حتى الآن، كان إضافة العمق إلى خط أنابيب YOLO تعني تجميعه بنفسك. النمط المعتاد كان تشغيل YOLO للاكتشاف وإقرانه نموذج عمق منفصل من مشروع آخر، مثل MiDaS أو Depth Anything. وهذا يعني تبعية ثانية، وإطار عمل ثاني، ومجموعتين من تنسيقات الإدخال والإخراج للتوفيق بينهما.
يُعد تقدير العمق الأحادي الآن مهمة أصلية في Ultralytics YOLO26. تنتج صورة RGB واحدة قيمة مسافة لكل بكسل، باستخدام نفس الحزمة، وسير العمل، ومسار التصدير الخاص والاكتشاف والتجزئة والوضع.
Link to this sectionما هو تقدير العمق؟#
يتنبأ تقدير العمق بخريطة عمق لكل بكسل من صورة RGB واحدة، دون الحاجة إلى كاميرا ثانية أو مستشعر إضافي. يحمل كل بكسل إخراج قيمة عمق بالأمتار، تمثل المسافة المقدرة من الكاميرا إلى نقطة السطح تلك.
الإخراج عبارة عن خريطة ذات أرقام عشرية كثيفة بالشكل (H, W)، متوافقة مع الإدخال، حيث يحمل كل بكسل مسافة مطلق بالأمتار؛ وهي مسافة من الكاميرا، وليست ترتيباً نسبياً لما هو أقرب وأبعد.
العمق هو مهمة مستقلة بنقطة التحقق الخاصة بها، وإخراجها هو خريطة العمق وحدها؛ فهي لا تعيد مربعات الإحاطة أو أقنعة التجزئة. يتطلب الجمع بين الاكتشاف والعمق بالتالي تشغيل نموذجين وتمريرتين أماميتين. ما يختلف عن الممارسة السابقة هو أن كلاهما يقع الآن ضمن حزمة واحدة، متشاركًا تثبيتًا واحدًا، وواجهة تدريب وتنبؤ واحدة، ومسار تصدير واحد، وإصدارًا واحدًا للمتابعة، بدلاً من الحاجة إلى الحفاظ على إطار عمل ثاني بجانب الأول.
هذا الإخراج لكل بكسل هو ما يجعل العمق مفيدًا لاكتشاف العوائق والمساحات الحرة، والتحقق من الخلوص، وتخطيط المشهد، وفهم ما يقع أمام ماذا.
الشكل 1. تقدير عمق Ultralytics YOLO26 لمراقبة السلامة والامتثال.
يشحن Ultralytics YOLO26 خمسة نماذج عمق مدربة مسبقًا، من yolo26n-depth وحتى yolo26x-depth, مدربة على مزيج واسع من مجموعات البيانات المتعددة يغطي تقريباً 2.19 مليون صورة داخلية وخارجية. على مجموعة NYU Depth V2، تتراوح من دقة 0.882 δ1 في النموذج النانوي إلى 0.933 في النموذج الفائق الحجم، بحيث يمكنك اختيار المقايضات بين السرعة والدقة التي تناسب هدف النشر الخاص بك.
Link to this sectionعمق غير محدود بطبيعته التصميمية#
تحدد معظم نماذج العمق تنبؤاتها بنطاق ثابت، مثل 0-10 أمتار، وهو ما يعمل بشكل جيد للمشاهد الداخلية ولكنه يفشل في الهواء الطلق. بدلاً من ذلك، يتنبأ Ultralytics بالعمق على مقياس لوغاريتمي مفتوح النهاية، بدون قطع صارم.
يظهر الاختلاف في الاختبار. يصل النموذج المحدد بحد أقصى إلى هضبة تقريبًا فورًا عند التدريب على بيانات داخلية وخارجية مختلطة، وينهيار على مجموعات بيانات ذات نطاق أطول مثل KITTI، حيث يمكن أن تكون الكائنات على بعد 80 مترًا. نهج YOLO26 ليس له سقف كهذا، لذا فهو يستمر في التحسين مع المزيد من البيانات ويصمد من بضعة سنتيمترات إلى بضعة مئات من الأمتار. على KITTI، يصل δ1 إلى 0.942 عند نطاق 80 م. هذا يعني أن عائلة نموذج واحدة تتعامل مع مشهد الطاولة ومشهد الطريق السريع بشكل جيد بنفس القدر.
Link to this sectionمقارنة عمق Ultralytics YOLO26 مقابل Depth Anything V2#
إذا كنت تشغل Depth Anything جنبًا إلى جنب مع YOLO اليوم، فإن الفرق يكمن في السرعة وفاتورة الحوسبة التي تأتي معها. يعمل عمق YOLO26 بشكل أسرع بما يصل إلى 20.3× مقارنة بـ Depth Anything V2 Base وأسرع بـ 7.7× مقارنة بـ Depth Anything V2 Small، من نموذج أصغر بكثير، أقل من 10M معلمات في النموذج النانوي، مقابل حوالي 24M لنقطة التحقق الأصغر لـ DA V2.
الشكل 2. مقارنة سرعة عمق Ultralytics YOLO26 مقابل Depth Anything V2.
هذه الفجوة هي جوهر التصميم. نماذج Depth Anything V2 أكبر بكثير؛ تم تصميم YOLO26-Depth لأداء عمق قوي بحجم وسرعة تكلف حوسبة أقل لكل إطار وتنتشر على أجهزة لا تستطيع تلك النماذج الوصول إليها. يتم نشر أرقام دقة النموذج الفردي على NYU Depth V2 وKITTI في الوثائق، بحيث يمكنك التحقق منها مقابل المتطلبات التي لديك بالفعل.
Link to this sectionأماكن تشغيله#
هذا الاختلاف في الحجم هو ما يحدد أين يمكن للعمق أن يذهب فعليًا. معظم الفرق التي تقيم العمق لا تعاني من نقص في الأفكار؛ بل تعاني من نقص في الحوسبة. الطائرات بدون طيار منخفضة الطاقة، والروبوتات ذات الأربع أرجل، والأجهزة القابلة للارتداء، وكاميرات القيادة، وأجهزة المؤتمرات، وأجهزة الكمبيوتر الصناعية تصل جميعها إلى سقف الطاقة والتكلفة قبل أن تصل إلى سقف الدقة.
يتم شحن العمق كخمسة نماذج مدربة مسبقًا، بحيث يمكنك اختيار الحجم الذي يناسب الهدف بدلاً من الحجم الذي يفوز بالاختبار المعياري. نظرًا لأن العمق هو مهمة أصلية لـ YOLO26، فإنه يستخدم نفس مسار التصدير مثل الاكتشاف والتجزئة والوضع بالتنسيقات التالية: ONNX، TensorRT، CoreML، NCNN، LiteRT.
Link to this sectionالبدء باستخدام عمق Ultralytics YOLO26#
توفر حزمة بايثون من Ultralytics واجهة واحدة موحدة للتدريب والتحقق وتشغيل الاستدلال عبر كل مهمة من مهام YOLO26، بما في ذلك العمق. يتطلب تشغيل نموذج عمق مدرب مسبقًا أمرًا واحدًا:
from ultralytics import YOLO
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-depth.pt") # load an official model
model = YOLO("path/to/best.pt") # load a custom model
# Predict with the model
results = model("https://ultralytics.com/images/bus.jpg") # predict on an image
# Access the results
for result in results:
depth_map = result.depth.data.cpu().numpy() # torch.Tensor → NumPy float32, shape (H, W), metersأو من واجهة سطر الأوامر (CLI):
yolo depth predict model=yolo26n-depth.pt source='https://ultralytics.com/images/bus.jpg' # predict with official model
yolo depth predict model=path/to/best.pt source='https://ultralytics.com/images/bus.jpg' # predict with custom modelAbsolute distance depends on your camera and your scene. If the shape of the depth map is right but the scale is off, model.calibrate() fits just two variables in the model's depth head, a scale and an offset, on around 100 labeled frames, in seconds, with no training and no change to the rest of the network.
Link to this sectionالضبط الدقيق على بياناتك الخاصّة#
لتكييف نموذج عمق مدرب مسبقًا مع الكاميرا أو المجال الخاص بك، ابدأ من الأوزان المدربة مسبقًا، واستخدم AdamW، وخفض معدل التعلم جيدًا دون الافتراضي للتدريب من الصفر بحيث يقوم الضبط الدقيق بتنقيح النموذج بدلاً من الكتابة فوقه:
from ultralytics import YOLO
from ultralytics import YOLO
model = YOLO("yolo26s-depth.pt") # start from pretrained weights
model.train(
data="path/to/your_dataset.yaml",
epochs=20,
imgsz=640,
optimizer="AdamW",
lr0=1e-4, # ~100x below the from-scratch default
warmup_bias_lr=1e-4, # keep warmup gentle too
)نظرًا لأن رأس السجل الافتراضي غير محدود، فإن هذا يعمل فورًا بغض النظر عما إذا كانت مجموعة البيانات الخاصة بك ذات نطاق قريب أو نطاق طويل، دون الحاجة إلى ضبط max_depth. إذا كان المقياس المطلق فقط غير دقيق للكاميرا المحددة الخاصة بك، فإن model.calibrate() يضبط تصحيحًا خفيف الوزن مغلق الشكل على جزء مصنف صغير، في ثوانٍ، دون المساس بأوزان الشبكة.
تقترن مجموعات البيانات بكل صورة RGB ملف عمق .npy في هيكل مجلد مطابق، ويقوم Ultralytics بشحن تكوينات مدمجة لـ NYU Depth V2، وKITTI، وHypersim، وSUN RGB-D، وARKitScenes، بحيث يمكن لمعظم الفرق البدء في التحقق مقابل معيار قياسي فورًا.
لمزيد من المعلومات، تحقق من دليل البدء السريع الخاص بنا.
Link to this sectionحالات الاستخدام الأساسية لتقدير العمق#
نظرًا لأن هذه الميزة الجديدة يمكن أن تعمل من كاميرا عادية واحدة، فإن تقدير العمق الأحادي يفتح فرصًا لا تعد ولا تحصى للمنتجات والصناعات التي لا تستطيع بطريقة أخرى تبرير التكلفة أو استهلاك الطاقة أو عبء المعايرة لإعداد استريو أو LiDAR. لذا دعونا نلقي نظرة على بعض الصناعات وحالات الاستخدام الرئيسية التي يمكنها الاستفادة من هذه الميزة:
- الروبوتات والملاحة المستقلة. يمكن للروبوتات المتنقلة والطائرات بدون طيار تقدير مسافة العوائق والمساحة الحرة من كاميرا مدمجة واحدة، مما يدعم تخطيط المسار في الوقت الفعلي دون الحاجة إلى أجهزة عمق مخصصة.
- الوعي الصناعي واللوجستي. التحقق من الخلوص، واكتشاف المساحة الحرة، وسياق الرف أو الممر من كاميرا ثابتة واحدة، في أي مكان لا يكون فيه إضافة مستشعر ثانٍ عمليًا.
- مراقبة السلامة والامتثال. مناطق السلامة للرافعات الشوكية والمستودعات، واكتشاف حوادث السكك الحديدية، واكتشاف الأشخاص الساقطين والأشياء المتروكة على كاميرات الدوائر التلفزيونية المغلقة الموجودة: سياق المسافة المضاف إلى خلاصات الكاميرات المثبتة بالفعل، بجانب أجهزة الاستشعار المعتمدة للسلامة الموجودة بدلاً من استبدالها.
- البنية التحتية وفحص الأصول. تحليل خلوص الخطوط العوية، فحص الأصول والتآكل القائم على الطائرات بدون طيار، وأعمال المسح الجوي، حيث يجب أن تتعامل عائلة النمط نفسها مع التفاصيل عن قرب والمشاهد ذات المدى الطويل.
- مساعدة السائق والإدراك الآلي. يعني إخراج العمق طويل المدى وغير المحدود أن نفس عائلة النمط التي تتعامل مع مشهد داخلي قريب تتعمم أيضًا على مشاهد القيادة لمسافة 80 مترًا فأكثر.
- الواقع المعزز والمحتوى المكاني. وضع الكائنات الافتراضية بشكل مقنع في مشهد حقيقي، أو تطبيق تأثيرات واعية للعمق، يبدأ بمعرفة المسافة التي يبعدها كل بكسل فعليًا عن الكاميرا.
Link to this sectionجلب تقدير العمق إلى كل نشر لـ YOLO26#
مع كون تقدير العمق الآن مهمة أصلية لـ YOLO26، يمكن للفرق الاستفادة من المسافة لكل بكسل من أي كاميرا RGB عبر الصناعات، باستخدام نفس سير عمل التدريب والتحقق والتنبؤ والتصدير الذي يعرفونه بالفعل من الاكتشاف والتجزئة والوضع، وتجنب تبعية طرف ثالث واحدة إضافية للصيانة.
لذا، بينما تحدد نطاق نشرك باستخدام عمق Ultralytics YOLO26، دعنا نلقي نظرة على بعض النقاط الأساسية التي يجب وضعها في الاعتبار:
- تم تصميم Ultralytics YOLO Depth لكاميرات RGB. تعمل أي كاميرا قياسية، بما في ذلك كاميرات الويب والهواتف والكاميرات الصناعية أو الطائرات بدون طيار. ومع ذلك، فإن الوسائط الأخرى مثل سحب نقاط LiDAR أو الرادار أو السونار أو نطاقات التصوير الحراري ومتعدد الأطياف أو بيانات الشبكة وIFC تقع خارج تنسيق إدخال النموذج.
- المسافة المترية لقرارات الإدراك. الإخراج هو مسافة حقيقية بالأمتار، مما يجعله مناسبًا تمامًا للملاحة والخلوص والمراقبة. ومع ذلك، لأي تطبيق تتطلب فيه تفاوتات معتمدة، يظل معدات القياس المترية المخصصة هو الأداة الصحيحة.
- الاستدلال لكل صورة. يعمل العمق على كل إطار بشكل مستقل، متسقًا مع كل مهمة أخرى من مهام YOLO26، وبالتالي يندمج في خط أنابيب موجود لكل إطار دون تغييرات. يظل الاستدلال عبر التسلسل في طبقة التطبيق الخاصة بك.
- Ultralytics YOLO26-Depth هو الأقوى على الأسطح المزخرفة والمعتمة. الزجاج والمرايا والمياه الراكدة والمعادن المصقولة والسماء المفتوحة تكون مبهمة بطبيعتها لأي طريقة تعتمد على كاميرا واحدة، لذا يجدر التحقق منها على مشاهد تمثل بيئتك.
هل أنت مهتم بالذكاء الاصطناعي للرؤية؟ استكشف خيارات الترخيص الخاصة بنا لجلب رؤية الكمبيوتر إلى مشاريعك. تفضل بزيارة مستودع GitHub الخاص بنا لاكتشاف النطاق الكامل لمهام وتكاملات Ultralytics، وتحقق من منصة Ultralytics لبدء بناء سير عمل الذكاء الاصطناعي للرؤية الشامل الخاص بك.






