Stereo Vision
اكتشف كيف تستخرج الرؤية المجسمة العمق ثلاثي الأبعاد للذكاء الاصطناعي. تعرّف على آلية عملها وتطبيقاتها وكيفية دمجها مع أحدث إصدار من Ultralytics YOLO26.
الرؤية المجسمة، المعروفة أيضًا بالرؤية الستيريوسكوبية، هي تقنية في الرؤية الحاسوبية تُستخدم لاستخراج معلومات العمق ثلاثية الأبعاد من الصور الرقمية. ومن خلال مقارنة صورتين ثنائيتَي الأبعاد للمشهد نفسه أو أكثر، التُقطتا من زوايا مختلفة قليلًا—محاكاةً لـالرؤية الثنائية للعينين لدى الإنسان—يمكن لأنظمة الذكاء الاصطناعي حساب المسافة إلى الكائنات بدقة. وتُعد هذه القدرة أساسية لـالذكاء المكاني، إذ تتيح للآلات التنقل في بيئاتها والتفاعل بأمان مع الكائنات المادية.
آلية عمل الرؤية المجسمة#
تعتمد العملية على إيجاد الاختلافات بين مشهدي الكاميرتين اليسرى واليمنى. ويتمثل التحدي الأساسي هنا في مشكلة المطابقة، التي تتضمن تحديد وحدات البكسل أو السمات نفسها بدقة في كلتا الصورتين. وبعد العثور على النقاط المتطابقة، يحسب النظام الإزاحة الأفقية، وينشئ خريطة تفاوت.
في خريطة التفاوت، تشير الإزاحات الأكبر إلى كائنات أقرب، بينما تعني الإزاحات الأصغر أن الكائن أبعد. ثم تُحوّل هذه الخريطة بالتثليث إلى سحابة نقاط ثلاثية الأبعاد كثيفة. وعلى الرغم من أن الخوارزميات الرياضية التقليدية كانت أساس هذه الحسابات تاريخيًا، فإن الأساليب الحديثة تعتمد بصورة متزايدة على الشبكات العصبية الالتفافية (CNNs) والتعلم العميق لتحسين دقة مطابقة السمات في ظروف الإضاءة المعقدة أو المناطق الخالية من النسيج، كما توضح أبحاث IEEE الحديثة في الرؤية الحاسوبية.
الرؤية المجسمة مقارنةً بتقدير العمق أحادي العين#
من المهم التمييز بين الرؤية المجسمة وتقنيات تقدير العمق التي تستخدم كاميرا واحدة فقط. إذ يستخدم تقدير العمق أحادي العين نماذج التعلم العميق للتنبؤ بالبنى ثلاثية الأبعاد انطلاقًا من صورة ثنائية الأبعاد واحدة، اعتمادًا على إشارات بصرية مثل المنظور والتظليل. وعلى النقيض، تقيس الأنظمة المجسمة العمق مباشرةً باستخدام العلاقة الهندسية بين عدستي الكاميرتين. وعلى الرغم من أن الأساليب أحادية العين أقل استهلاكًا للحوسبة، فإن الرؤية المجسمة توفر عادةً قياسات عمق آنية وأكثر دقة، وهي ضرورية لأنظمة السلامة الحرجة.
تطبيقات AI في العالم الواقعي#
تكتسب الأنظمة المجسمة أهمية كبيرة في مختلف الصناعات التي تتطلب كشف الكائنات ثلاثي الأبعاد في العالم الواقعي والوعي المكاني.
- الملاحة للقيادة الذاتية: تستخدم تقنيات القيادة الذاتية التي تطورها شركات مثل Waymo كاميرات مجسمة لتقدير المسافة إلى المشاة والمركبات الأخرى والعوائق بدقة وفي الوقت الفعلي، وتمرر بيانات العمق الدقيقة هذه إلى أنظمة النمذجة التنبؤية لتخطيط مسارات آمنة.
- أتمتة الروبوتات الصناعية: تستخدم روبوتات التصنيع الرؤية المجسمة في مهام التقاط القطع المعقدة من الحاويات. ومن خلال حساب العمق والاتجاه الدقيقين للقطع المتناثرة على سير ناقل، تتمكن الأنظمة الروبوتية من محاذاة مقابضها على النحو الأمثل، ما يحسّن الكفاءة في مسارات التصنيع الذكي.
- التصوير الطبي المتقدم: تستخدم الروبوتات الجراحية وأنظمة التشخيص كاميرات مجسمة لتوفير عرض ثلاثي الأبعاد دقيق جدًا لتشريح المريض أثناء الإجراءات طفيفة التوغل، وهو اتجاه يبرز كثيرًا في مسودات arXiv الحديثة حول الذكاء الاصطناعي الطبي.
دمج الذكاء الاصطناعي مع البيانات المجسمة#
غالبًا ما يستخدم المطورون الرؤية المجسمة جنبًا إلى جنب مع كشف الكائنات لتحديد ما هو الكائن وكم يبعد. ويشيع استخدام إطار عمل OpenCV لإنشاء خرائط التفاوت، وغالبًا ما يُدمج ضمن مسارات معالجة أوسع باستخدام PyTorch أو TensorFlow، بينما تتولى نماذج الذكاء الاصطناعي الإدراك. فيما يلي مثال تصوري على اكتشاف الكائنات باستخدام Ultralytics YOLO26 واسترجاع صناديق الإحاطة الخاصة بها، التي يمكن استخدامها بعد ذلك لاستخراج متوسط قيم المسافة من خريطة تفاوت OpenCV المرتبطة.
import cv2
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for high-speed edge inference
model = YOLO("yolo26n.pt")
# Read the left camera frame (typically used as the primary frame for detection)
left_frame = cv2.imread("left_camera_frame.jpg")
# Run inference to detect objects in the scene
results = model(left_frame)
# Extract bounding boxes to later combine with a stereo disparity map
for result in results:
for box in result.boxes.xyxy:
x1, y1, x2, y2 = map(int, box[:4])
print(f"Detected object bounding box: [{x1}, {y1}, {x2}, {y2}]")
# Depth values can now be extracted from the disparity map within this specific regionالتطورات والاتجاهات المستقبلية#
أصبح تدريب نماذج الإدراك المتقدمة ونشرها أكثر سلاسة بكثير. وباستخدام أدوات مثل منصة Ultralytics، تستطيع الفرق إضافة تعليقات توضيحية إلى أزواج الصور المجسمة بأمان، وتدريب نماذج متينة، وتصديرها إلى تنسيقات محسّنة مثل TensorRT للاستدلال بزمن استجابة منخفض على أجهزة الذكاء الاصطناعي الطرفية.
تُظهر التطورات الحديثة من مؤسسات مثل مختبر ستانفورد للرؤية والتعلّم اتجاهًا متناميًا نحو دمج الرؤية المجسمة مع المحولات البصرية (ViT) والنماذج الأساسية من Google DeepMind لحل مشكلة المطابقة بسرعة أكبر. ومع تطور نماذج الذكاء الاصطناعي متعددة الوسائط لدى رواد مثل Anthropic وOpenAI، سيواصل دمج البيانات المكانية ثلاثية الأبعاد المتينة دفع حدود ما تستطيع وكلاء الذكاء الاصطناعي المتجسدة إدراكه وفهمه.










