K-Means Clustering
استكشف التجميع بطريقة K-Means للتعلّم غير الخاضع للإشراف. اكتشف كيف تقسّم هذه الخوارزمية البيانات، وتعزّز تطبيقات الذكاء الاصطناعي، وتفيد نماذج مثل Ultralytics YOLO26.
يُعدّ التجميع باستخدام K-Means خوارزمية أساسية واسعة الاستخدام في مجال التعلّم غير الخاضع للإشراف، وقد صُممت للكشف عن البنى الخفية داخل البيانات غير الموسومة. ويتمثل هدفها الأساسي في تقسيم مجموعة البيانات إلى مجموعات فرعية متميزة تُعرف باسم العناقيد، بحيث تكون نقاط البيانات داخل المجموعة نفسها متشابهة قدر الإمكان، بينما تختلف النقاط الموجودة في المجموعات الأخرى. وبصفته ركيزة أساسية في تنقيب البيانات والتحليل الاستكشافي، يتيح K-Means لعلماء البيانات تنظيم المعلومات المعقدة تلقائيًا ضمن فئات قابلة للإدارة، من دون الحاجة إلى تسميات محددة مسبقًا أو إشراف بشري.
كيفية عمل الخوارزمية#
تعمل خوارزمية K-Means بطريقة تكرارية، وتعتمد على مقاييس المسافة لتحديد التجميع الأمثل لـبيانات التدريب. وتنظم الخوارزمية العناصر في K عناقيد، حيث ينتمي كل عنصر إلى العنقود ذي المتوسط الأقرب، أو المركز. وتعمل هذه العملية على تقليل التباين داخل كل مجموعة. ويتبع سير العمل عمومًا الخطوات التالية:
-
التهيئة: تختار الخوارزمية K نقاط أولية لتكون مراكز. ويمكن اختيار هذه النقاط عشوائيًا أو باستخدام أساليب محسّنة مثل k-means++ لتسريع التقارب.
-
الإسناد: تُسنَد كل نقطة بيانات في مجموعة البيانات إلى المركز الأقرب استنادًا إلى مقياس مسافة محدد، وأكثرها شيوعًا المسافة الإقليدية.
-
التحديث: يُعاد حساب المراكز من خلال أخذ متوسط جميع نقاط البيانات المسندة إلى ذلك العنقود.
-
التكرار: تُكرَّر الخطوتان 2 و3 حتى تتوقف المراكز عن التحرك بشكل ملحوظ أو يتم الوصول إلى الحد الأقصى لعدد التكرارات.
يُعد تحديد العدد الصحيح للعناقيد (K) جانبًا بالغ الأهمية عند استخدام هذه الخوارزمية. وغالبًا ما يستخدم الممارسون تقنيات مثل طريقة الكوع أو يحللون درجة الظل لتقييم مدى انفصال العناقيد الناتجة عن بعضها.
التطبيقات الواقعية في الذكاء الاصطناعي#
يتمتع التجميع باستخدام K-Means بمرونة كبيرة، ويُستخدم في مختلف القطاعات للتبسيط والمعالجة المسبقة للبيانات.
- ضغط الصور وتكميم الألوان: في الرؤية الحاسوبية (CV)، يساعد K-Means على تقليل حجم ملفات الصور من خلال تجميع ألوان وحدات البكسل. ومن خلال تجميع آلاف الألوان في مجموعة أصغر من الألوان السائدة، تنفذ الخوارزمية فعليًا خفض الأبعاد مع الحفاظ على البنية المرئية للصورة. وغالبًا ما تُستخدم هذه التقنية قبل تدريب نماذج متقدمة لـاكتشاف الأجسام لتوحيد بيانات الإدخال.
- تقسيم العملاء إلى شرائح: تستفيد الشركات من التجميع لتصنيف العملاء استنادًا إلى سجل المشتريات أو الخصائص الديموغرافية أو سلوكهم على مواقع الويب. ويتيح ذلك وضع استراتيجيات تسويق مستهدفة، وهو عنصر أساسي في حلول الذكاء الاصطناعي في قطاع التجزئة. ومن خلال تحديد المتسوقين ذوي القيمة العالية أو العملاء المعرضين لخطر التوقف عن التعامل، تستطيع الشركات تخصيص رسائلها بفعالية.
- اكتشاف الحالات الشاذة: من خلال تعلّم بنية عناقيد البيانات «الطبيعية»، تستطيع الأنظمة تحديد القيم المتطرفة التي تقع بعيدًا عن أي مركز. ويُعد ذلك مفيدًا لاكتشاف الاحتيال في القطاع المالي واكتشاف الحالات الشاذة في أمن الشبكات، إذ يساعد على تمييز الأنشطة المشبوهة التي تنحرف عن الأنماط المعتادة.
- إنشاء صناديق الارتساء: استخدمت كاشفات الأجسام تاريخيًا، مثل إصدارات YOLO الأقدم، تقنية K-Means لحساب صناديق الارتساء المثلى من مجموعات بيانات التدريب. وبينما تستخدم النماذج الحديثة مثل YOLO26 أساليب متقدمة لا تعتمد على الارتساء، يظل فهم K-Means ذا صلة بتطور بنيات الكشف.
مثال على التنفيذ#
بينما تتولى أطر التعلّم العميق، مثل منصة Ultralytics، إدارة مسارات التدريب المعقدة، يُستخدم K-Means غالبًا لتحليل إحصاءات مجموعات البيانات. ويوضح مقتطف Python التالي كيفية تجميع الإحداثيات ثنائية الأبعاد — لمحاكاة مراكز الأجسام — باستخدام مكتبة Scikit-learn الشائعة.
import numpy as np
from sklearn.cluster import KMeans
# Simulated coordinates of detected objects (e.g., from YOLO26 inference)
points = np.array([[10, 10], [12, 11], [100, 100], [102, 101], [10, 12], [101, 102]])
# Initialize K-Means to find 2 distinct groups (clusters)
kmeans = KMeans(n_clusters=2, random_state=0, n_init="auto").fit(points)
# Output the cluster labels (0 or 1) for each point
print(f"Cluster Labels: {kmeans.labels_}")
# Output: [1 1 0 0 1 0] -> Points near (10,10) are Cluster 1, near (100,100) are Cluster 0مقارنة مع الخوارزميات ذات الصلة#
من المهم التمييز بين K-Means والخوارزميات الأخرى ذات الأسماء أو الوظائف المتشابهة لضمان اختيار الأداة المناسبة للمشروع.
- K-Means مقابل الجيران الأقرب K (KNN): غالبًا ما يحدث الخلط بينهما بسبب الحرف «K» في اسميهما. K-Means خوارزمية غير خاضعة للإشراف تُستخدم لتجميع البيانات غير الموسومة. وعلى النقيض، فإن الجيران الأقرب K (KNN) خوارزمية تعلّم خاضعة للإشراف تُستخدم في تصنيف الصور والانحدار، وتعتمد على البيانات الموسومة لإجراء التنبؤات استنادًا إلى الفئة الغالبة لدى الجيران.
- K-Means مقابل DBSCAN: بينما تعمل كلتا الخوارزميتين على تجميع البيانات، تفترض K-Means أن العناقيد كروية الشكل، وتتطلب تحديد عدد العناقيد مسبقًا. أما DBSCAN فتجمع البيانات استنادًا إلى الكثافة، ويمكنها العثور على عناقيد ذات أشكال عشوائية، كما تتعامل مع الضوضاء بصورة أفضل. وهذا يجعل DBSCAN متفوقة على التعامل مع البيانات المكانية المعقدة الموجودة في مجموعات البيانات ذات البنى غير المنتظمة، حيث يكون عدد العناقيد غير معروف.









