Diffusion Policies
استكشف كيف تشكل سياسات الانتشار (Diffusion Policies) الروبوتات الحديثة. تعرّف على كيفية نمذجة الإجراءات عبر إزالة الضجيج (denoising) والتكامل مع Ultralytics YOLO26 من أجل الإدراك الذكي.
تمثل سياسات الانتشار (Diffusion Policies) تحولاً نموذجياً في الروبوتات والتعلم الآلي حيث يُصَمَّم نهج السياسة الحركية البصرية لـ وكيل الذكاء الاصطناعي كعملية انتشار إزالة التشويش المشروط. تقليدياً، يعتمد استنساخ السلوك - وهو شكل من أشكال التعلم بالمحاكاة - على الانحدار المباشر للتنبؤ بإجراء حتمي واحد من المدخلات الحسية. ورغم كفاءته في المهام البسيطة، غالباً ما يفشل الانحدار المباشر عندما توجد إجراءات صالحة متعددة، مما يؤدي إلى حركات متوسطة غير مستقرة أو غير آمنة. تحل سياسات الانتشار هذه المشكلة من خلال صياغة توليد الإجراءات كمهام تنقية للتسلسل. بدءاً من الضوضاء العشوائية البنقاوة، تقوم الخوارزمية بإزالة الضوضاء من الإشارة بشكل تكراري - مشروطة بالملاحظات الحسية مثل الصور أو بيانات الحالة المكانية - لإنتاج تسلسلات إجراءات عالية الدقة والمتانة ومتعددة الوسائط.
كيف تعمل سياسات الانتشار#
تعتمد الميكانيكا الأساسية على الرياضيات الموجودة في التصميم التوليدي، مع تكييف التقنيات التي تم تطويرها في الأصل لتخليق الصور عالية الدقة في ورقة سياسة الانتشار الحركي البصري الأصلية. خلال مرحلة التدريب، والمعروفة بالعملية الأمامية، تتم إضافة كميات صغيرة من التشويش بشكل تدريجي إلى مسارات إجراءات الخبراء المثلى. بعد ذلك، يتم تدريب الشبكة العصبية للتنبؤ بهذا التشويش وعكسه بناءً على سياق مراقبة معين.
أثناء الاستدلال، عندما يتفاعل الروبوت مع بيئته، فإنه يراقب محيطه، ويهيئ تسلسل إجراء عشوائي، ويزيل التشويش منه باستخدام ديناميات لانجفين العشوائية. ينتج عن هذا التحسين التكراري أوامر حركية سلسة وعالية الدقة قادرة على التعامل مع المساحات الحركية المعقدة وعالية الأبعاد.
تطبيقات العالم الحقيقي#
من خلال تمثيل التوزيعات المعقدة بدقة دون انهيار النمط، تعمل سياسات الانتشار بنشاط على إعادة تشكيل الذكاء الاصطناعي الفيزيائي الحديث.
- التلاعب الروبوتاني: في البيئات الصناعية، تستخدم الأذرع الروبوتية هذه السياسات للمهام الماهرة الغنية بالتلامس مثل التقاط الأجسام غير रेगولارية الشكل، أو تجميع الإلكترونيات المعقدة، أو تنفيذ حركات الصب السلسة.
- الملاحة الذاتية: تجمع أنظمة القيادة الذاتية والطائرات بدون طيار بين تقدير العمق وسياسات الانتشار لتخطيط مسارات آمنة ومستمرة عبر البيئات الديناميكية، والتكيف بسلاسة مع العقبات المفاجئة التي قد تربك نماذج التعلم التعزيزي القياسية.
تمييز المصطلحات الرئيسية#
لتوضيح الوظيفة المحددة لسياسات الانتشار، من المفيد تمييزها عن البنى التوليدية وثيقة الصلة:
- سياسات الانتشار مقابل نماذج الانتشار: تشير نماذج الانتشار على نطاق واسع إلى البنية التوليدية الأساسية المستخدمة لإنشاء بيانات ثابتة مثل تخليق النص إلى صور. بينما تطبق سياسات الانتشار هذه الآلية المحددة للتنبؤ بأوامر حركية مستمرة ومتسلسلة زمنياً للروبوتات النشطة.
- سياسات الانتشار مقابل فرض الانتشار: فرض الانتشار هو إطار عام لتوليد التسلسلات يقوم بتدريب المحولات السببية باستخدام مستويات تشويش متغيرة لكل رمز. وعلى الرغم من ارتباطهما، فإن فرض الانتشار يركز بشكل كبير على التنبؤ الانحداري الذاتي، في حين تعبر سياسات الانتشار حصرياً عن استراتيجية التعلم بالمحاكاة للتحكم الحركي البصري.
التطورات الأخيرة في تعلم السياسات#
تستمر الأبحاث الصادرة عن المؤسسات الكبرى، بما في ذلك مبادرات أبحاث OpenAI وروبوتات Google DeepMind، في دفع حدود ما يمكن لهذه الخوارزميات تحقيقه. والجدير بالذكر أن سياسة الانتشار ثلاثية الأبعاد (DP3)، المنشورة على arXiv في عام 2024، قدمت إنجازاً ثورياً من خلال تكييف السياسات على تمثيل السحاب النقدي ثلاثي الأبعاد المدمج بدلاً من صور ثنائية الأبعاد البسيطة. وقد أدى ذلك إلى تحسين الوعي المكاني للروبوتات بشكل كبير مع تطلب عروض خبراء أقل بكثير. ولقد بدأت الابتكارات اللاحقة مثل D3P: سياسة انتشار إزالة التشويش الديناميكية في معالجة بطء سرعة الاستدلال للانتشار القياسي عن طريق تخطي خطوات إزالة التشويش للإجراءات الروتينية ديناميكياً، مما يفتح الباب أمام الاستجابة في الوقت الفعلي.
التنفيذ العملي مع الرؤية الحاسوبية#
قبل أن تتمكن سياسة الانتشار (diffusion policy) من توليد إجراء ما، فإنها تتطلب فهماً واضحاً ومهيكلاً لبيئتها. غالباً ما يدمج المهندسون نماذج object detection القوية مع خوارزميات السياسات لتشكيل computer vision pipeline متكامل. على سبيل المثال، يمكن لنموذج إدراكي سريع مثل Ultralytics YOLO26 عزل الكائنات المستهدفة في الوقت الفعلي، لتغذية الإحداثيات المكانية إلى سياسة انتشار تعتمد على PyTorch library.
import torch
from ultralytics import YOLO
# Load the Ultralytics YOLO26 Nano model for high-speed robotic perception
model = YOLO("yolo26n.pt")
# Predict bounding boxes on the robot's active camera feed
results = model.predict("robot_camera_feed.jpg")
# Condition the policy by extracting the bounding box center coordinate
if len(results[0].boxes) > 0:
box = results[0].boxes[0].xyxy.squeeze()
center_x = (box[0] + box[2]) / 2.0
center_y = (box[1] + box[3]) / 2.0
# Create a spatial observation tensor to condition the PyTorch Diffusion Policy.
# This directly guides the denoising process to generate accurate motor actions.
observation_state = torch.tensor([center_x, center_y])
print(f"Conditioning action trajectory on object center: {observation_state}")لتبسيط هذا التدفق العملي، يمكن للمطورين استخدام منصة Ultralytics للاستفادة من أدوات التسمية التلقائية السريعة لمجموعات البيانات المخصصة. يعمل هذا الدعم الشامل على تسريع نشر النموذج من تغذيات الكاميرا الخام إلى ذكاء روبوت قابل للتنفيذ.






