Data Labeling
تعلم أساسيات تصنيف البيانات (data labeling) لتعلم الآلة. اكتشف أنواعًا رئيسية مثل الكشف عن الكائنات وكيفية تسريع سير العمل باستخدام Ultralytics YOLO26.
تسميات البيانات هي العملية الأساسية لتحديد البيانات الخام - مثل الصور، أو إطارات الفيديو، أو النصوص، أو الصوت - وإضافة علامات أو بيانات وصفية توضيحية لتوفير السياق. في عالم machine learning (ML)، لا تستطيع الخوارزميات فهم العالم المادي بالفطرة؛ بل تتطلب "معلماً" لإرشادها. تأتي هذه الإرشاد في شكل مجموعات بيانات مسماة تُستخدم أثناء supervised learning. تعمل التسميات كـ ground truth، ممثلةً الإجابات الصحيحة التي يسعى النموذج للتنبؤ بها. وسواء كنت تتدرب على مصنف بسيط أو هندسة معقدة مثل Ultralytics YOLO26، فإن دقة هذه التسميات واتساقها وﺠﻮدتها هي المحددات الأساسية لنجاح أي نموذج.
توسيم البيانات مقابل تعليق البيانات#
على الرغم من استخدام المصطلحات بالتبادل في المحادثات العادية، إلا أن هناك تمييزاً طفيفاً يجدر ذكره. يشير مصطلح "تسميات البيانات" عموماً إلى الفعل الواسع المتمثل في تعيين فئة أو علامة لقطعة من البيانات (مثل وسم بريد إلكتروني كـ "بريد مزعج"). في المقابل، غالباً ما تكون data annotation أكثر تحديداً لـ computer vision (CV)، وتتضمن التحديد الدقيق للأجسام باستخدام مربعات الإحاطة، أو المضلعات، أو النقاط الرئيسية. ومع ذلك، في معظم سير عمل ML operations (MLOps)، يصف كلا المصطلحين إنشاء training data عالية الجودة.
الأنواع الرئيسية في رؤية الحاسوب#
تتغير طريقة التوسيم بناءً على المهمة التي يجب أن يؤديها النموذج. تشمل الأنواع الشائعة ما يلي:
- Image Classification: تعيين تسمية واحدة لصورة بأكملها، مثل تحديد حالة الطقس كـ "غائم" أو "مشمس".
- Object Detection: رسم ثنائي الأبعاد لـ bounding boxes حول الأجسام المتميزة لتعليم النموذج ماهية الجسم ومكان توقعه.
- Instance Segmentation: إنشاء أقنعة أو polygons مثالية للبكسل حول الأجسام، وهو أمر ضروري لتحديد الأشكال والحدود بدقة.
- Pose Estimation: تحديد keypoints محددة على موضوع ما، مثل المفاصل الهيكلية، لتحليل الحركة أو الوضعية.
تطبيقات العالم الحقيقي#
تمتد فائدة توسيم البيانات عبر كل صناعة تقريباً توظف الذكاء الاصطناعي.
-
المركبات المستقلة: تعتمد السيارات ذاتية القيادة على مجموعات بيانات ضخمة يتم فيها تسمية كل مركبة، ومشاة، وإشارة مرور، وعلامة مسار بدقة متناهية. تتيح هذه البيانات المسماة لنظام الإدراك التنقل في البيئات المعقدة بأمان. تستثمر شركات Autonomous vehicle بشكل مكثف في التسميات على مستوى البكسل لضمان الامتثال للسلامة.
-
الزراعة الدقيقة: في الزراعة الحديثة، يتم استخدام AI in agriculture لاكتشاف أمراض المحاصيل أو مراقبة مراحل النمو. يستخدم المزارعون نماذج مدربة على صور مسماة لأوراق "سليمة" مقابل "مصابة" لأتمتة المعالجة، مما يقلل من استخدام المواد الكيميائية ويزيد من الإنتاجية.
مسار عمل التوسيم#
غالباً ما يكون إنشاء مجموعة بيانات مسماة هو الجزء الأكثر استهلاكاً للوقت في مشروع الذكاء الاصطناعي. تتضمن العملية عادةً نهج "الإنسان في الحلقة" (HITL)، حيث يتحقق المعلقون البشريون من التسميات لضمان دقة عالية. تستفيد سير العمل الحديثة من أدوات مثل Ultralytics Platform، مما يبسيط إدارة مجموعات البيانات ويسمح للفرق بالتعاون في التعليقات التوضيحية. يمكن أيضاً استخدام تقنيات متقدمة مثل active learning، حيث يقوم نموذج بتسمية البيانات مسبقاً، ويقوم البشر فقط بتصحيح التنبؤات ذات الثقة المنخفضة، مما يسرع العملية بشكل ملحوظ.
يوضح المثال التالي كيفية استخدام نموذج Ultralytics YOLO26 مدرب مسبقًا لتوليد تسميات تلقائيًا (التسمية التلقائية) لصورة جديدة، والتي يمكن بعد ذلك تصحيحها بواسطة البشر:
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Save the detection results to a text file in standard YOLO format
# This file can now be used as a starting point for data labeling
results[0].save_txt("bus_labels.txt")





