Continuous Batching
تعلّم كيف تحسّن المعالجة الدفعية المستمرة معدل إنتاجية GPU وتقلل زمن الاستجابة. اكتشف كيفية استخدام Ultralytics YOLO26 لتعظيم الكفاءة في مهام تعلّم الآلة الإنتاجية.
التجميع المستمر على دفعات هو تقنية متقدمة للجدولة وتحسين الاستدلال تُستخدم في التعلم الآلي (ML) لتعظيم الاستفادة من الأجهزة ومعدل المعالجة. في التجميع التقليدي الثابت على دفعات، ينتظر محرك الاستدلال تراكم عدد محدد مسبقًا من الطلبات قبل معالجتها في الوقت نفسه. وغالبًا ما يؤدي ذلك إلى انخفاض الكفاءة، لأن النظام يجب أن ينتظر انتهاء الطلب الأطول تشغيلًا في الدفعة قبل تحرير الموارد. ويحل التجميع المستمر على دفعات، المعروف أيضًا باسم التجميع الديناميكي أو التجميع على مستوى التكرار، هذه المشكلة من خلال إدخال طلبات جديدة إلى دفعة الحوسبة بمجرد اكتمال طلب نشط، ما يقلل وقت الخمول بشكل كبير على GPUs ويحسن الكفاءة الإجمالية.
التمييز بين المفاهيم ذات الصلة#
لفهم كيفية معالجة البيانات أثناء نشر النماذج بصورة أفضل، من المفيد التمييز بين التجميع المستمر على دفعات والمصطلحات الأخرى ذات الصلة في المسرد:
- حجم الدفعة: يشير هذا إلى العدد الثابت من العينات التي تُعالج في الوقت نفسه أثناء التدريب أو الاستدلال. وتعتمد سير عمل معالجة الدُفعات التقليدية على أحجام ثابتة، بينما يتيح التجميع المستمر على دفعات تغير حجم الدفعة الفعلي ديناميكيًا استنادًا إلى حركة الطلبات الواردة.
- الاستدلال في الوقت الفعلي: يركز هذا المفهوم على تقليل زمن وصول الاستدلال إلى أدنى حد للحصول على تنبؤات فورية، من خلال معالجة المدخلات الفردية عند وصولها. ويسد التجميع المستمر على دفعات الفجوة بين التجميع الثابت عالي معدل المعالجة والاستدلال في الوقت الفعلي منخفض زمن الوصول، إذ يحافظ على معدل معالجة مرتفع من دون إجبار الطلبات السريعة على انتظار الطلبات الأبطأ.
التطبيقات الواقعية#
يُعد التجميع المستمر على دفعات بالغ الأهمية لأنظمة الإنتاج التي تتعامل مع أحجام كبيرة من الطلبات غير المتوقعة. فيما يلي مثالان ملموسان على تطبيقه:
-
توليد النصوص بمعدل معالجة مرتفع: عند تقديم النماذج اللغوية الكبيرة (LLMs)، يستغرق توليد الاستجابات لمستخدمين مختلفين مددًا متفاوتة تبعًا لطول المخرجات. ويمكن لأطر العمل التي تستفيد من التجميع المستمر على دفعات—مثل vLLM على Ray Serve—بث الرموز المُولَّدة حديثًا باستمرار واستبدال المحادثات المكتملة فورًا بمطالبات جديدة. وتعمل هذه الطريقة، التي اشتهرت في الأصل بفضل أبحاث الجدولة على مستوى التكرار، على تحسين معدل معالجة توليد النصوص بشكل كبير.
-
تحليلات الفيديو غير المتزامنة: في مهام فهم الفيديو، مثل تتبع المركبات عبر شبكة كاميرات المرور في مدينة، تصل الإطارات على فترات زمنية مختلفة. ويتيح التجميع المستمر على دفعات لنماذج تتبع الكائنات معالجة إطارات الفيديو الواردة ديناميكيًا في اللحظة التي تصبح فيها الموارد متاحة، ما يحسن مسارات تسريع الأجهزة للوحات معلومات المدن الذكية.
المعالجة المستمرة في مهام الرؤية#
عند إدارة ممارسات نشر النماذج ذات حركة الطلبات المرتفعة، يمكن لبث عمليات الاستدلال على نحو تكراري محاكاة فوائد التجميع الديناميكي من خلال ضمان تحرير الذاكرة تدريجيًا بدلًا من حجزها. يوضح مثال Python التالي كيفية استخدام نمط المولّد مع واجهة برمجة تطبيقات التنبؤ بالنموذج للتعامل بكفاءة مع تدفق مستمر من الصور.
from ultralytics import YOLO
# Load the latest Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Using stream=True acts as a generator, iteratively processing inputs
# to keep memory usage low and throughput high
results = model.predict(source=["img1.jpg", "img2.jpg", "img3.jpg"], stream=True)
# Process each result as soon as it completes
for result in results:
print(f"Detected {len(result.boxes)} objects in this frame.")تتطلب إدارة جدولة الموارد على مستوى النظام تحقيق توازن بين السرعة الخام والتكلفة التشغيلية. وتعتمد الفرق التي تنشر نماذج الرؤية الحاسوبية (CV) والنماذج اللغوية على نطاق واسع بشكل متزايد على أطر عمل متقدمة لتقديم النماذج من أجل إدارة هذه الدُفعات الديناميكية. وبالنسبة إلى فرق المؤسسات التي تسعى إلى تبسيط بنيتها التحتية، توفر منصة Ultralytics أدوات قوية لتدريب النماذج ومراقبتها وتصديرها إلى بيئات إنتاج محسّنة بدرجة عالية.






