Gaussian Splatting
استكشف Gaussian Splatting لإعادة بناء مشاهد ثلاثية الأبعاد واقعية. تعلم كيف يُمكّن العرض في الوقت الفعلي ويتكامل مع Ultralytics YOLO26 للرؤية.
الرسم التوضيحي الغאוسي (Gaussian Splatting) هو تقنية تنقيط حديثة تُستخدم في رسومات الحاسوب والرؤية الحاسوبية لإعادة بناء مشاهد ثلاثية الأبعاد واقعية للغاية من مجموعة من الصور ثنائية الأبعاد. على عكس النمذجة ثلاثية الأبعاد التقليدية التي تعتمد على شبكات المضلعات، أو التطورات الحديثة في مجال الذكاء الاصطناعي مثل Neural Radiance Fields (NeRF) التي تستخدم الشبكات العصبية لتقريب المشهد، يمثل الرسم التوضيحي الغאוسي المشهد كمجموعة من ملايين التوزيعات الغاوسية ثلاثية الأبعاد (القطع الناقص). تتيح هذه الطريقة العرض في الوقت الفعلي بمعدلات إطارات عالية (غالبًا ما تتجاوز 100 إطار في الثانية) مع الحفاظ على دقة بصريّة استثنائية، مما يحل عائقًا رئيسيًا في الأداء وُجد في طرق تركيب العروض السابقة.
كيف يعمل Gaussian Splatting#
تتمحور الفكرة الأساسية حول تمثيل الفضاء ثلاثي الأبعاد بشكل صريح وليس ضمني. في سير العمل النموذجي، تبدأ العملية بـ point cloud متفرقة يتم إنشاؤها من مجموعة من الصور باستخدام تقنية تُسمى Structure from Motion (SfM). بعد ذلك، تتم تهيئة كل نقطة في هذه السحابة كشكل غاوسي ثلاثي الأبعاد.
خلال training process، يقوم النظام بتحسين عدة بارامترات لكل توزيع غاوسي:
- الموضع: الإحداثيات ثلاثية الأبعاد (X, Y, Z) في المشهد.
- التباين: يحدد هذا شكل ودوران المجسم الإهليلجي (على سبيل المثال، مدى تمدد أو ميل "اللطخة" splat).
- العتامة: مدى شفافية أو صلبة الـ Gaussian (قيمة ألفا).
- اللون: يتم تمثيله باستخدام Spherical Harmonics، مما يسمح للون بالتغير اعتمادًا على زاوية الرؤية، لالتقاط انعكاسات واقعية وتأثيرات الإضاءة.
يشير مصطلح "splatting" إلى عملية rasterization حيث يتم إسقاط هذه التوزيعات الغاوسية ثلاثية الأبعاد — أو "تسطيحها" — على مستوى الكاميرا ثنائي الأبعاد لتشكيل صورة. هذا الإسقاط قابل للتفاضل تمامًا، مما يعني أنه يمكن استخدام خوارزميات gradient descent القياسية تقليل الفرق بين الصورة المعروضة والصورة الأصلية المرجعية.
مقارنة بين Gaussian Splatting و NeRF#
على الرغم من أن كلا التقنيتين تهدفان إلى إنتاج عروض جديدة للمشهد، إلا أنهما تختلفان جوهريًا في البنية والأداء. يقوم NeRF (Neural Radiance Fields) بترميز المشهد داخل أوزان neural network. يتطلب تقديم NeRF الاستعلام عن هذه الشبكة ملايين المرات لكل إطار منفرد (الإبحار الشعاعي)، وهو أمر مكلف حسابياً وبطيء.
في المقابل، يستخدم الرسم التوضيحي الغאוسي تمثيلًا صريحًا (قائمة التوزيعات الغاوسية). يتيح له ذلك الاستفادة بكفاءة من التنقيط القائم على المربعات بطريقة تشبه كيفية تقديم ألعاب الفيديو للرسومات. ونتيجة لذلك، يعتبر الرسم التوضيحي الغאוسي أسرع بكثير في التدريب والعرض من نماذج NeRF، مما يجعله أكثر قابلية للتطبيق في تطبيقات المستهلكين وreal-time inference.
تطبيقات العالم الحقيقي#
لقد فتحت سرعة وجودة Gaussian Splatting أبواباً جديدة في مختلف الصناعات:
- السياحة الافتراضية والعقارات: يمكن للمبدعين التقاط متحف أو موقع تاريخي أو منزل للبيع باستخدام طائرة بدون طيار أو هاتف ذكي. يسمح الرسم التوضيحي الغאוسي للمستخدمين عن بُعد استكشاف هذه المساحات في Virtual Reality (VR) مع 6 درجات حرية (6DoF)، ورؤية التفاصيل الدقيقة مثل الانعكاسات على الأرضيات الخشبية التي قد تفوتها القياسات التصويرية التقليدية.
- محاكاة السيارات: تحتاج الشركات التي تطوير autonomous vehicles إلى كميات هائلة من البيانات لاختبار خوارزميات الإدراك الخاصة بها. يمكن للرسم التوضيحي الغאוسي إعادة بناء كتل المدن الواقعية من بيانات المستشعرات، مما يخلق بيئة محاكاة واقعية للغاية. داخل هذه البيئات، يمكن اختبار نماذج الرؤية مثل Ultralytics YOLO26 لضمان تحديدها الصحيح للمخاطر في السيناريوهات ثلاثية الأبعاد المعقدة.
المعالجة المسبقة لـ Splatting باستخدام الرؤية الحاسوبية#
لكي يعمل الرسم التوضيحي الغאוسي بفعالية، عادة ما تحتاج صور التدريب إلى أن تكون ثابتة. الأجسام المتحركة (مثل المشاة أو السيارات) في الصور المصدرية يمكن أن تسبب تشوهات تُسمى "العوامات (floaters)". تستخدم خطوط الأنابيب المتقدمة instance segmentation لإخفاء هذه العناصر الديناميكية تلقائيًا قبل تدريب نموذج التسطيح.
يتيح Ultralytics Platform للفرق إدارة مجموعات البيانات وتدريب النماذج التي يمكنها المساعدة في مرحلة المعالجة المسبقة هذه. إليك كيف يمكن للمرء استخدام نموذج التقسيم لإنشاء أقنعة لمجموعة بيانات مخصصة لإعادة البناء ثلاثي الأبعاد:
from ultralytics import YOLO
# Load the YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image from the scan dataset
# Class 0 is 'person' in COCO - we mask them out to keep the scene static
results = model.predict("scan_frame_001.jpg", classes=[0])
# Save the generated mask to exclude the person from the 3D reconstruction
for result in results:
result.save_masks("scan_frame_001_mask.png")الأهمية في الذكاء الاصطناعي والتوجهات المستقبلية#
يمثل الرسم التوضيحي الغאוسي تحولاً في computer vision نحو الطرق الهجينة التي تجمع بين قابلية التعلم في Deep Learning وكفاءة رسومات الحاسوب التقليدية. تتطور هذه التقنية بسرعة، حيث يستكشف الباحثون طرقًا لضغط أحجام الملفات (والتي يمكن أن تكون كبيرة) ودمجها مع generative AI لإنشاء أصول ثلاثية الأبعاد من المطالبات النصية. مع استمرار تحسن مسرعات الأجهزة مثل GPUs، من المرجح أن يصبح الرسم التوضيحي الغאוسي المعيار القياسي لالتقاط وعرض العالم الحقيقي في شكل رقمي.






