Behavioral Cloning
تعرّف إلى كيفية تمكين الاستنساخ السلوكي لتعلّم المحاكاة بالذكاء الاصطناعي. اكتشف تطبيقاته الأساسية وتحدياته وكيفية دمجه مع Ultralytics YOLO26.
الاستنساخ السلوكي هو تقنية أساسية في التعلّم بالتقليد، حيث يتعلّم وكيل الذكاء الاصطناعي تنفيذ مهمة من خلال محاكاة مجموعة بيانات من عروض الخبراء محاكاةً صارمة. وبدلًا من الاعتماد على نظام مكافآت معقّد، يتعامل النموذج مع اتخاذ القرارات المتسلسلة بوصفه مسألةً قياسية من مسائل التعلّم الخاضع للإشراف. ومن خلال استيعاب آلاف الأزواج من الحالات والإجراءات—مثل التغذية المرئية التي يقدّمها مشغّل بشري وحركات ذراع التحكم المقابلة لها—يتعلّم الوكيل سياسةً تربط الملاحظات الجديدة مباشرةً بالإجراءات المتوقعة.
كيف يختلف الاستنساخ السلوكي عن التعلّم المعزّز#
في حين يتطلب التعلّم المعزّز من الوكيل التفاعل مع بيئة والتعلّم من خلال التجربة والخطأ مع تعظيم إشارة مكافأة، يعتمد الاستنساخ السلوكي بالكامل على مجموعات بيانات ثابتة ومسجّلة مسبقًا. ولأنه يعمل من دون تفاعل مع البيئة أو دوال مكافأة صريحة، فإنه يتجنب تعقيدات صياغة عملية قرار ماركوف. غير أن هذه البساطة تعني أن الوكيل لا يستطيع اكتشاف حلول مبتكرة تتجاوز أداء الخبير. وغالبًا ما تستخدم أساليب التعلّم المعزّز غير المتصل الحديثة الاستنساخ السلوكي نقطةَ انطلاق قوية لتحقيق استقرار تدريب النموذج الأولي قبل إجراء المزيد من التحسين باستخدام المكافآت.
التطبيقات الواقعية#
يُطبَّق الاستنساخ السلوكي على نطاق واسع في المجالات التي يصعب فيها للغاية تصميم دالة مكافأة رياضية، بينما يكون جمع بيانات العروض البشرية سهلًا نسبيًا.
- القيادة الذاتية: تستخدم أنظمة القيادة الذاتية الحديثة، مثل NVIDIA DRIVE، الاستنساخ السلوكي الشامل استخدامًا مكثفًا. ومن خلال التدريب على آلاف الساعات من بيانات القيادة البشرية، تتعلّم النماذج إخراج زوايا التوجيه وأوامر التسارع مباشرةً من تدفقات الرؤية الحاسوبية الواردة.
- المناولة الروبوتية: تستخدم الأذرع الروبوتية التي يتحكم فيها المشغّل عن بُعد الاستنساخ السلوكي لتعلّم المهام الفيزيائية المعقدة، مثل فرز الطرود، وتجميع الأجزاء المصنَّعة، أو طيّ الملابس. ومن خلال تسجيل زوايا المفاصل الدقيقة والحالات المرئية للعروض البشرية، تستطيع النماذج تكرار المهارات الحركية الدقيقة بدرجة عالية من الدقة.
مشكلة الخطأ المتراكم#
يتمثل القيد الأهم لهذه التقنية في انزياح التغاير، المعروف شائعًا باسم الأخطاء المتراكمة. أثناء التدريب، يتعلّم الوكيل فقط من المسارات المثالية للخبير. وفي التنفيذ الواقعي ذي الحلقة المغلقة، يدفع خطأ أولي صغير الوكيل إلى حالة غير مألوفة غير موجودة في بيانات التدريب. ومع افتقاره إلى المعرفة اللازمة للتعافي، تتدهور الإجراءات اللاحقة بسرعة، مما يؤدي إلى فشل المهمة بالكامل. ويتطلب الحد من هذه المشكلة مجموعات بيانات ضخمة ومتنوعة وزيادة موجّهة للبيانات.
التطورات الحديثة: سياسات الانتشار وتقسيم الإجراءات إلى مجموعات#
للتغلب على القيود التقليدية، تدمج معماريات التعلّم العميق الحديثة تقنيات توليدية. وتستفيد سياسات الانتشار من الإطار الرياضي لنماذج الانتشار لتمثيل توزيعات الإجراءات المعقدة جدًا ومتعددة الأنماط، مما يتيح للوكلاء التعامل مع السيناريوهات الملتبسة بسلاسة، وهو مفهوم تناولته أبحاث الروبوتات الحديثة بعمق. وبالتزامن مع ذلك، يتيح تقسيم الإجراءات إلى مجموعات للوكيل التنبؤ بتسلسل من الإجراءات المستقبلية بدلًا من خطوة واحدة، مما يقلل تواتر الأخطاء التفاعلية ويضمن تنفيذًا أكثر سلاسة.
التنفيذ العملي باستخدام الرؤية الحاسوبية#
عمليًا، يعتمد الاستنساخ السلوكي على أساس قوي للإدراك لاستخراج حالات البيئة قبل تمريرها إلى شبكة السياسة. وباستخدام منصة Ultralytics لإدارة مجموعات البيانات، غالبًا ما يقرن المطوّرون نماذج اكتشاف الأجسام عالية السرعة بمكتبات الشبكات العصبية مثل PyTorch أو بحزم تحكم متخصصة مثل TorchRL.
يوضح مقتطف Python التالي كيف يمكن لـ Ultralytics YOLO26 أن يعمل طبقةً للإدراك، فيستخرج الإحداثيات المكانية لتمريرها إلى سياسة استنساخ سلوكي أساسية مبنية على PyTorch وتتنبأ بإجراء توجيه.
import torch
import torch.nn as nn
from ultralytics import YOLO
# Load an Ultralytics YOLO26 model as the perception layer
perception_model = YOLO("yolo26n.pt")
results = perception_model("robot_camera_feed.jpg")
# Extract the bounding box center to define the current environmental state
if len(results[0].boxes) > 0:
box = results[0].boxes[0].xywh.squeeze()
state = torch.tensor([box[0], box[1]]) # x, y center coordinates
# A simplified PyTorch Behavioral Cloning policy mapping states to actions
bc_policy = nn.Linear(in_features=2, out_features=1)
# Predict the expert-cloned action (e.g., a steering angle)
predicted_action = bc_policy(state)
print(f"Predicted cloned action: {predicted_action.item()}")ومع دفع أبحاث مؤسسات مثل OpenAI وAnthropic نحو نماذج أساسية للذكاء الفيزيائي، سيظل الاستنساخ السلوكي حجرَ زاوية في تعليم الآلات تفسير البيئات الواقعية المعقدة والتنقل فيها.






