Model Quantization
تعلّم كيف تحسّن تكميم النماذج Ultralytics YOLO26 للذكاء الاصطناعي الطرفي. اكتشف كيفية تقليل الذاكرة وزمن الاستجابة وتصدير نماذج INT8 لاستدلال أسرع.
تكميم النموذج هو تقنية متقدمة لـتحسين النموذج تُستخدم لتقليل التكاليف الحسابية وتكاليف الذاكرة اللازمة لتشغيل نماذج التعلم العميق. في عمليات التدريب القياسية، تخزّن الشبكات العصبية عادةً المعلمات (الأوزان والانحيازات) وخرائط التنشيط باستخدام أرقام فاصلة عائمة ذات 32 بت (FP32). وبينما تضمن هذه الدقة العالية إجراء حسابات دقيقة أثناء التدريب، فإنها غالبًا ما تكون غير ضرورية أثناء الاستدلال. يحوّل التكميم هذه القيم إلى تنسيقات أقل دقة، مثل الأرقام الفاصلة العائمة ذات 16 بت (FP16) أو الأعداد الصحيحة ذات 8 بت (INT8)، مما يقلّص حجم النموذج ويسرّع سرعة التنفيذ بفاعلية دون التأثير بدرجة كبيرة في الدقة.
لماذا يُعدّ التكميم مهمًا#
الدافع الأساسي للتكميم هو الحاجة إلى نشر ذكاء اصطناعي قوي على أجهزة محدودة الموارد. ومع ازدياد تعقيد نماذج الرؤية الحاسوبية مثل YOLO26، تزداد متطلباتها الحسابية. ويعالج التكميم ثلاث اختناقات مهمة:
- بصمة الذاكرة: من خلال تقليل عرض البتات للأوزان (مثلًا، من 32 بت إلى 8 بت)، ينخفض متطلب تخزين النموذج بما يصل إلى 4x. وهذا أمر حيوي لتطبيقات الأجهزة المحمولة حيث يكون حجم التطبيق مقيّدًا.
- زمن استجابة الاستدلال: تكون العمليات منخفضة الدقة أقل تكلفة حسابية. ويمكن للمعالجات الحديثة، ولا سيما تلك المزودة بـوحدات معالجة عصبية (NPUs) متخصصة، تنفيذ عمليات INT8 بسرعة أكبر بكثير من FP32، مما يقلل بدرجة كبيرة زمن استجابة الاستدلال.
- استهلاك الطاقة: يؤدي نقل كمية أقل من البيانات عبر الذاكرة وإجراء عمليات حسابية أبسط إلى استهلاك طاقة أقل، مما يطيل عمر البطارية في الأجهزة المحمولة والمركبات ذاتية القيادة.
المقارنة مع المفاهيم ذات الصلة#
من المهم التمييز بين التكميم وتقنيات التحسين الأخرى، إذ إنها تعدّل النموذج بطرق مختلفة:
- التكميم مقابل التقليم: بينما يقلل التكميم حجم الملف عبر خفض عرض البتات للمعلمات، يتضمن تقليم النموذج إزالة الاتصالات غير الضرورية (الأوزان) بالكامل لإنشاء شبكة متناثرة. يغيّر التقليم بنية النموذج، بينما يغيّر التكميم تمثيل البيانات.
- التكميم مقابل تقطير المعرفة: تقطير المعرفة هو تقنية تدريب يتعلم فيها نموذج صغير يُسمى "الطالب" محاكاة نموذج كبير يُسمى "المعلّم". وغالبًا ما يُطبَّق التكميم على نموذج الطالب بعد التقطير لتحسين أداء الذكاء الاصطناعي الطرفي بدرجة أكبر.
التطبيقات الواقعية#
يُمكّن التكميم من استخدام الرؤية الحاسوبية والذكاء الاصطناعي في مختلف الصناعات التي تكون فيها الكفاءة أولوية قصوى.
-
الأنظمة ذاتية القيادة: في صناعة السيارات، يجب على السيارات ذاتية القيادة معالجة البيانات المرئية الواردة من الكاميرات وLiDAR في الوقت الفعلي. وتتيح النماذج المكمّمة المنشورة على محركات NVIDIA TensorRT لهذه المركبات اكتشاف المشاة والعوائق بزمن استجابة يبلغ ميلي ثانية، مما يضمن سلامة الركاب.
-
الزراعة الذكية: تستخدم الطائرات المسيّرة المزوّدة بكاميرات متعددة الأطياف نماذج مكمّمة لـاكتشاف الأجسام لتحديد أمراض المحاصيل أو مراقبة مراحل النمو. ويؤدي تشغيل هذه النماذج محليًا على الأنظمة المضمّنة للطائرة المسيّرة إلى إزالة الحاجة إلى اتصالات خلوية غير موثوقة في الحقول النائية.
تطبيق التكميم باستخدام Ultralytics#
تُبسّط مكتبة Ultralytics عملية التصدير، مما يتيح للمطورين تحويل نماذج مثل YOLO26 المتقدمة إلى تنسيقات مكمّمة. كما توفر منصة Ultralytics أدوات لإدارة عمليات النشر هذه بسلاسة.
يوضح المثال التالي كيفية تصدير نموذج إلى TFLite مع تفعيل تكميم INT8. وتتضمن هذه العملية خطوة معايرة يراقب فيها النموذج بيانات عيّنة لتحديد النطاق الديناميكي الأمثل للقيم المكمّمة.
from ultralytics import YOLO
# Load a standard YOLO26 model
model = YOLO("yolo26n.pt")
# Export to TFLite format with INT8 quantization
# The 'int8' argument triggers Post-Training Quantization
# 'data' provides the calibration dataset needed for mapping values
model.export(format="tflite", int8=True, data="coco8.yaml")غالبًا ما تُنشر النماذج المحسّنة باستخدام معايير قابلة للتشغيل البيني مثل ONNX أو محركات استدلال عالية الأداء مثل OpenVINO، مما يضمن توافقًا واسعًا عبر منظومات الأجهزة المتنوعة.









