Gaussian Splatting
استكشف التبعثر الغاوسي لإعادة بناء المشاهد ثلاثية الأبعاد بطريقة واقعية تصويريًا. تعرّف على كيفية تمكين العرض في الوقت الفعلي ودمجه مع Ultralytics YOLO26 للرؤية.
التنقيط الغاوسي هو تقنية حديثة للترقيم النقطي تُستخدم في رسومات الحاسوب والرؤية الحاسوبية لإعادة بناء مشاهد ثلاثية الأبعاد واقعية فوتوغرافيًا انطلاقًا من مجموعة من الصور ثنائية الأبعاد. وعلى خلاف النمذجة التقليدية ثلاثية الأبعاد التي تعتمد على الشبكات متعددة الأضلاع، أو التطورات الحديثة في الذكاء الاصطناعي مثل حقول الإشعاع العصبية (NeRF) التي تستخدم الشبكات العصبية لتقريب المشهد، يمثّل التنقيط الغاوسي المشهدَ على هيئة مجموعة من ملايين التوزيعات الغاوسية ثلاثية الأبعاد (أشكال إهليلجية). وتتيح هذه الطريقة التصيير في الوقت الفعلي بمعدلات إطارات مرتفعة (تتجاوز غالبًا 100 FPS)، مع الحفاظ على دقة بصرية استثنائية، ما يحل عنق زجاجة رئيسيًا في الأداء كان موجودًا في أساليب توليد المناظر السابقة.
كيفية عمل التنقيط الغاوسي#
تتمحور الفكرة الأساسية حول تمثيل الفضاء ثلاثي الأبعاد تمثيلًا صريحًا بدلًا من تمثيله ضمنيًا. في سير عمل نموذجي، تبدأ العملية بسحابة نقاط متناثة تُنشأ من مجموعة من الصور باستخدام تقنية تُسمى البنية من الحركة (SfM). ثم تُهيَّأ كل نقطة في هذه السحابة على هيئة غاوسي ثلاثي الأبعاد.
أثناء عملية التدريب، يحسّن النظام عدة معلمات لكل غاوسي:
- الموضع: الإحداثيات ثلاثية الأبعاد (X، Y، Z) في المشهد.
- التغاير: يحدد هذا شكل الإهليلج ودورانه (مثل مدى استطالة أو ميلان «التنقيط»).
- العتامة: مدى شفافية الغاوسي أو صلابته كما يظهر (قيمة ألفا).
- اللون: يُمثَّل باستخدام التوافقيات الكروية، ما يسمح بتغير اللون تبعًا لزاوية المشاهدة، والتقاط الانعكاسات وتأثيرات الإضاءة الواقعية.
يشير مصطلح «التنقيط» إلى عملية الترقيم النقطي التي تُسقَط فيها غاوسيات ثلاثية الأبعاد هذه — أو «تُنقَّط» — على مستوى الكاميرا ثنائي الأبعاد لتكوين صورة. ويكون هذا الإسقاط قابلاً للاشتقاق بالكامل، ما يعني إمكانية استخدام خوارزميات الانحدار المتدرج القياسية لتقليل الفرق بين الصورة المُصيَّرة والصورة الأصلية ذات الحقيقة الأساسية.
التنقيط الغاوسي مقابل NeRF#
على الرغم من أن كلتا التقنيتين تهدفان إلى توليد مناظر جديدة لمشهد ما، فإنهما تختلفان اختلافًا جوهريًا في البنية والأداء. ترمّز تقنية NeRF (حقول الإشعاع العصبية) المشهد داخل أوزان شبكة عصبية. ويتطلب تصيير NeRF الاستعلام عن هذه الشبكة ملايين المرات لكل إطار على حدة (تتبّع الأشعة)، وهو ما يستهلك قدرًا كبيرًا من الموارد الحاسوبية ويكون بطيئًا.
وعلى النقيض من ذلك، يستخدم التنقيط الغاوسي تمثيلًا صريحًا (قائمة الغاوسيات). ويتيح له ذلك الاستفادة من الترقيم النقطي الفعّال القائم على البلاطات، على نحو مشابه للطريقة التي تصيّر بها ألعاب الفيديو الرسومات. ونتيجة لذلك، يكون التنقيط الغاوسي أسرع بكثير في التدريب والتصيير من NeRF، ما يجعله أكثر ملاءمة لتطبيقات المستهلكين والاستدلال في الوقت الفعلي.
التطبيقات الواقعية#
لقد فتحت سرعة التنقيط الغاوسي وجودته آفاقًا جديدة في قطاعات متنوعة:
- السياحة الافتراضية والعقارات: يمكن للمبدعين التقاط متحف أو موقع تاريخي أو منزل معروض للبيع باستخدام طائرة مسيّرة أو هاتف ذكي. ويتيح التنقيط الغاوسي للمستخدمين عن بُعد استكشاف هذه المساحات في الواقع الافتراضي (VR) مع 6 درجات من الحرية (6DoF)، ورؤية تفاصيل دقيقة مثل الانعكاسات على الأرضيات الخشبية الصلبة التي قد تفوّتَها تقنيات التصوير المساحي التقليدية.
- محاكاة السيارات: تحتاج الشركات التي تطور المركبات ذاتية القيادة إلى كميات هائلة من البيانات لاختبار خوارزميات الإدراك لديها. ويمكن للتنقيط الغاوسي إعادة بناء مبانٍ سكنية في أحياء حقيقية بالاعتماد على بيانات المستشعرات، وإنشاء بيئة محاكاة واقعية فوتوغرافيًا. وضمن هذه البيئات، يمكن اختبار نماذج الرؤية مثل Ultralytics YOLO26 للتأكد من أنها تحدد المخاطر بشكل صحيح في سيناريوهات ثلاثية الأبعاد معقدة.
المعالجة المسبقة للتنقيط باستخدام الرؤية الحاسوبية#
لكي يعمل التنقيط الغاوسي بفعالية، يجب أن تكون صور التدريب عادةً ثابتة. فقد تتسبب الأجسام المتحركة (مثل المشاة أو السيارات) في الصور المصدر في ظهور تشوهات تُسمى «العناصر العائمة». وتستخدم مسارات المعالجة المتقدمة [تجزئة المثيلات](https://ultralytics-translation-0.invalid لإخفاء هذه العناصر الديناميكية تلقائيًا قبل تدريب نموذج التنقيط.
تتيح منصة Ultralytics للفرق إدارة مجموعات البيانات وتدريب النماذج التي يمكنها المساعدة في مرحلة المعالجة المسبقة هذه. وفيما يلي طريقة لاستخدام نموذج تجزئة لإنشاء أقنعة لمجموعة بيانات مخصصة لإعادة البناء ثلاثي الأبعاد:
from ultralytics import YOLO
# Load the YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image from the scan dataset
# Class 0 is 'person' in COCO - we mask them out to keep the scene static
results = model.predict("scan_frame_001.jpg", classes=[0])
# Save the generated mask to exclude the person from the 3D reconstruction
for result in results:
result.save_masks("scan_frame_001_mask.png")الأهمية في الذكاء الاصطناعي والاتجاهات المستقبلية#
يمثل التنقيط الغاوسي تحولًا في الرؤية الحاسوبية نحو أساليب هجينة تجمع بين قابلية التعلم في التعلم العميق وكفاءة رسومات الحاسوب الكلاسيكية. وتتطور هذه التقنية بسرعة، إذ يستكشف الباحثون طرقًا لضغط أحجام الملفات (التي قد تكون كبيرة) ودمجها مع الذكاء الاصطناعي التوليدي لإنشاء أصول ثلاثية الأبعاد انطلاقًا من مطالبات نصية. ومع استمرار تحسن مسرّعات الأجهزة مثل GPUs، من المرجح أن يصبح التنقيط الغاوسي المعيار لالتقاط العالم الحقيقي وتصييّره بصيغة رقمية.









