Data Preprocessing
تعلّم كيف تحوّل المعالجة المسبقة للبيانات البيانات الخام إلى مدخلات نظيفة للذكاء الاصطناعي. استكشف تقنيات أساسية مثل التحجيم والتطبيع لتعزيز دقة Ultralytics YOLO26.
تُعدّ المعالجة المسبقة للبيانات الخطوة الأولى الحاسمة في مسار تعلّم الآلة، حيث تُحوَّل البيانات الخام إلى تنسيق نظيف ومفهوم للخوارزميات. في العالم الواقعي، غالبًا ما تكون البيانات غير مكتملة وغير متسقة وتفتقر إلى سلوكيات أو اتجاهات محددة، فتبدو «متسخة» أو «مشوشة» للحاسوب. وتسُدّ المعالجة المسبقة الفجوة بين المعلومات الخام والمدخلات المنظمة المطلوبة من الشبكات العصبية، مما يؤثر تأثيرًا كبيرًا في دقة النموذج النهائي وكفاءته. ومن خلال توحيد مجموعات البيانات وتنظيفها، يضمن المهندسون أن تتمكن البنى المتقدمة مثل YOLO26 من تعلّم أنماط ذات معنى بدلًا من الضوضاء.
لماذا تُعدّ المعالجة المسبقة للبيانات مهمة؟#
تتأثر نماذج تعلّم الآلة، ولا سيما المستخدمة في الرؤية الحاسوبية، بجودة بيانات الإدخال وحجمها. ومن دون معالجة مسبقة مناسبة، قد يواجه النموذج صعوبة في التقارب أثناء التدريب أو ينتج تنبؤات غير موثوقة. فعلى سبيل المثال، إذا كانت للصور في مجموعة البيانات دقات أو مقاييس ألوان مختلفة، فسيتعين على النموذج تخصيص سعة إضافية لتعلّم كيفية التعامل مع أوجه عدم الاتساق هذه بدلًا من التركيز على مهمة اكتشاف الأجسام الفعلية.
تهدف تقنيات المعالجة المسبقة عمومًا إلى ما يلي:
- تحسين جودة البيانات: إزالة الأخطاء والقيم الشاذة والتكرارات لضمان أن تمثل مجموعة البيانات نطاق المشكلة تمثيلًا دقيقًا.
- توحيد المدخلات: إعادة تحجيم السمات (مثل قيم البكسلات) إلى نطاق موحد، غالبًا ما يكون بين 0 و1، لمساعدة خوارزميات التحسين مثل الانحدار المتدرج على العمل بسلاسة أكبر.
- تقليل التعقيد: تبسيط تمثيلات البيانات باستخدام تقنيات مثل خفض الأبعاد، مما يجعل عملية التعلّم أسرع.
التقنيات الأساسية في المعالجة المسبقة#
تُستخدم عدة أساليب قياسية لإعداد البيانات للتدريب، ويخدم كل منها غرضًا محددًا في مسار البيانات.
- تنظيف البيانات: يتضمن ذلك معالجة القيم المفقودة (بالتعويض)، وتصحيح وضع التسميات غير المتسق، وتصفية الملفات التالفة. وفي سياق الذكاء الاصطناعي للرؤية، قد يعني ذلك إزالة الصور الضبابية أو تصحيح إحداثيات المربع المحيط غير الصحيحة.
- التسوية وإعادة التحجيم: نظرًا إلى أن شدة البكسلات قد تتباين على نطاق واسع، فإن تسوية الصور تضمن عدم هيمنة البكسلات ذات القيم المرتفعة على عملية التعلّم. وتشمل الأساليب الشائعة إعادة التحجيم بنطاق Min-Max وتسوية الدرجة المعيارية Z.
- الترميز: يجب تحويل البيانات الفئوية، مثل تسميات الفئات (على سبيل المثال، «قطة» و«كلب»)، إلى تنسيقات رقمية. وتُعدّ تقنيات مثل الترميز أحادي التفعيل أو ترميز التسميات ممارسة قياسية.
- تغيير الحجم والتنسيق: تتوقع نماذج التعلّم العميق عادةً مدخلات ذات حجم ثابت. وتعمل مسارات المعالجة المسبقة تلقائيًا على تغيير حجم الصور المتباينة إلى بُعد قياسي، مثل 640x640 بكسل، وهو أمر شائع في الاستدلال الآني.
التطبيقات الواقعية#
تنتشر المعالجة المسبقة للبيانات في مختلف القطاعات، إذ تضمن تحويل المدخلات الخام إلى رؤى قابلة للتنفيذ.
تشخيص التصوير الطبي#
في الذكاء الاصطناعي في الرعاية الصحية، تُعدّ المعالجة المسبقة ضرورية لتحليل صور الأشعة السينية أو فحوصات MRI. غالبًا ما تحتوي الصور الطبية الخام على ضوضاء ناتجة عن المستشعرات أو على اختلافات في الإضاءة والتباين تبعًا للجهاز المستخدم. وتعمل خطوات المعالجة المسبقة مثل معادلة المدرج التكراري على تحسين التباين لجعل الأورام أو الكسور أكثر وضوحًا، بينما توضح مرشحات تقليل الضوضاء بنية الصورة. ويتيح هذا الإعداد للنماذج إجراء اكتشاف الأورام بدقة أعلى، مما قد ينقذ الأرواح عبر تقليل النتائج السلبية الكاذبة.
القيادة الذاتية#
تعتمد السيارات ذاتية القيادة على مدخلات من مستشعرات متعددة، بما في ذلك LiDAR والرادار والكاميرات. وتنتج هذه المستشعرات بيانات بمعدلات ومقاييس مختلفة. وتعمل المعالجة المسبقة على مزامنة هذه التدفقات وتصفية الضوضاء البيئية، مثل المطر أو الوهج، قبل دمج البيانات. وبالنسبة إلى المركبات ذاتية القيادة، يضمن ذلك أن يتلقى نظام الإدراك رؤية متماسكة للطريق، مما يتيح الملاحة الآمنة واكتشاف المشاة الموثوق في البيئات الآنية.
المفاهيم ذات الصلة#
من المهم التمييز بين المعالجة المسبقة للبيانات والمصطلحات الأخرى التي تظهر في سير عمل تعلّم الآلة.
- مقابل زيادة البيانات: بينما تُعدّ المعالجة المسبقة البيانات لتكون قابلة للاستخدام تقنيًا من جانب النموذج (مثل تغيير الحجم)، تُنشئ زيادة البيانات تنويعات جديدة من البيانات الموجودة (مثل تدوير الصور أو قلبها) لزيادة تنوع مجموعة البيانات. راجع دليلنا حول زيادة بيانات YOLO لمزيد من التفاصيل.
- مقابل هندسة السمات: تتعلق المعالجة المسبقة بالتنظيف والتنسيق. أما هندسة السمات فتتضمن إنشاء متغيرات جديدة ذات معنى من البيانات لتحسين أداء النموذج، مثل حساب «مؤشر كتلة الجسم» من عمودي الطول والوزن.
- مقابل وسم البيانات: الوسم هو عملية تحديد الحقيقة الأساسية، مثل رسم المربعات المحيطة حول الأجسام. وتحدث المعالجة المسبقة بعد جمع البيانات ووسمها، ولكن قبل إدخال البيانات إلى الشبكة العصبية.
مثال عملي#
في منظومة Ultralytics، تُعالَج البيانات مسبقًا غالبًا تلقائيًا أثناء مسار التدريب. ومع ذلك، يمكنك أيضًا معالجة الصور مسبقًا يدويًا باستخدام مكتبات مثل OpenCV. ويوضح المقتطف التالي تحميل صورة، وتغيير حجمها إلى حجم إدخال قياسي لنموذج مثل YOLO26، وتسوية قيم البكسلات.
import cv2
import numpy as np
# Load an image using OpenCV
image = cv2.imread("bus.jpg")
# Resize the image to 640x640, a standard YOLO input size
resized_image = cv2.resize(image, (640, 640))
# Normalize pixel values from 0-255 to 0-1 for model stability
normalized_image = resized_image / 255.0
# Add a batch dimension (H, W, C) -> (1, H, W, C) for inference
input_tensor = np.expand_dims(normalized_image, axis=0)
print(f"Processed shape: {input_tensor.shape}")بالنسبة إلى المشاريع واسعة النطاق، يمكن أن يؤدي استخدام أدوات مثل منصة Ultralytics إلى تبسيط مسارات العمل هذه. وتعمل المنصة على تبسيط إدارة مجموعات البيانات، وأتمتة العديد من مهام المعالجة المسبقة والتعليق التوضيحي لتسريع الانتقال من البيانات الخام إلى النموذج المنشور.









