Capsule Networks (CapsNet)
استكشف شبكات الكبسولات (CapsNets) وكيف تعالج قيود CNNs. تعرّف إلى التوجيه الديناميكي والتسلسلات الهرمية المكانية ومقارنة CapsNets بـ YOLO26.
تمثل شبكات الكبسولات، التي يُشار إليها غالبًا بالاختصار CapsNets، بنية متقدمة في مجال التعلم العميق، صُممت للتغلب على قيود محددة موجودة في الشبكات العصبية التقليدية. وقد قدّمها Geoffrey Hinton وفريقه، وتسعى CapsNets إلى محاكاة التنظيم العصبي البيولوجي للدماغ البشري بصورة أقرب من النماذج القياسية. وعلى خلاف الشبكة العصبية الالتفافية (CNN) النموذجية، التي تتفوق في اكتشاف الميزات لكنها غالبًا ما تفقد العلاقات المكانية بسبب الاختزال، تنظّم شبكة الكبسولات العصبونات في مجموعات تُسمى «كبسولات». ولا ترمّز هذه الكبسولات احتمال وجود كائن فحسب، بل ترمّز أيضًا خصائصه المحددة، مثل الاتجاه والحجم والملمس، مما يحافظ بفاعلية على العلاقات المكانية الهرمية داخل البيانات المرئية.
قيود شبكات CNN التقليدية#
لفهم الابتكار الذي تقدمه CapsNets، من المفيد إلقاء نظرة على طريقة عمل نماذج الرؤية الحاسوبية القياسية. تستخدم شبكة CNN التقليدية طبقات من استخراج الميزات تتبعها طبقات التجميع، وتحديدًا التجميع بأخذ القيمة العظمى، لتقليل العبء الحسابي وتحقيق الثبات تجاه الانتقال. وهذا يعني أن شبكة CNN تستطيع تحديد «قطة» بصرف النظر عن موضعها في الصورة.
ومع ذلك، تتخلص هذه العملية غالبًا من بيانات الموقع الدقيقة، مما يؤدي إلى «مشكلة بيكاسو»: فقد تصنّف شبكة CNN وجهًا تصنيفًا صحيحًا حتى لو كان الفم في موضع الجبهة، لمجرد وجود جميع الميزات اللازمة. وتعالج CapsNets ذلك بإزالة طبقات التجميع واستبدالها بعملية تحترم التدرجات المكانية للكائنات.
آلية عمل شبكات الكبسولات#
اللبنة الأساسية لهذه البنية هي الكبسولة، وهي مجموعة متداخلة من العصبونات تُخرج متجهًا بدلًا من قيمة قياسية. في رياضيات المتجهات، يمتلك المتجه مقدارًا واتجاهًا. في CapsNet:
- المقدار (الطول): يمثل احتمال وجود كيان محدد في الإدخال الحالي.
- الاتجاه (التوجّه): يرمّز معلمات التجسيد، مثل تقدير وضعية الكائن ومقياسه ودورانه.
تتنبأ الكبسولات الموجودة في الطبقات السفلى، التي تكتشف أشكالًا بسيطة مثل الحواف، بمخرجات الكبسولات الموجودة في الطبقات العليا، التي تكتشف كائنات معقدة مثل العيون أو الإطارات. وتُدار هذه الاتصالات بواسطة خوارزمية تُسمى «التوجيه الديناميكي» أو «التوجيه بالاتفاق». فإذا توافق تنبؤ كبسولة منخفضة المستوى مع حالة كبسولة عالية المستوى، تعزّز الاتصال بينهما. ويتيح ذلك للشبكة التعرّف على الكائنات من وجهات نظر ثلاثية الأبعاد مختلفة، من دون الحاجة إلى زيادة البيانات الكبيرة اللازمة عادةً لتعليم شبكات CNN الدوران والمقياس.
الفروق الرئيسية: CapsNets مقابل شبكات CNN#
على الرغم من أن كلتا البنيتين أساسيتان في الرؤية الحاسوبية (CV)، فإنهما تختلفان في طريقة معالجة البيانات المرئية وتمثيلها:
- القيمة القياسية مقابل المتجه: تستخدم عصبونات CNN مخرجات قياسية للدلالة على وجود ميزة. أما CapsNets فتستخدم المتجهات لترميز الوجود (الطول) ومعلمات الوضعية (الاتجاه).
- التوجيه مقابل التجميع: تستخدم شبكات CNN التجميع لتقليل دقة البيانات، وغالبًا ما تفقد تفاصيل الموقع. بينما تستخدم CapsNets التوجيه الديناميكي للحفاظ على البيانات المكانية، مما يجعلها فعالة جدًا في المهام التي تتطلب تتبعًا دقيقًا للكائنات.
- كفاءة البيانات: نظرًا إلى أن الكبسولات تستوعب ضمنيًا وجهات النظر ثلاثية الأبعاد والتحويلات affine، فإنها تستطيع غالبًا التعميم انطلاقًا من قدر أقل من بيانات التدريب مقارنةً بشبكات CNN، التي قد تتطلب أمثلة واسعة لتعلّم كل دوران محتمل للكائن.
التطبيقات الواقعية#
على الرغم من أن CapsNets غالبًا ما تكون أعلى تكلفة حسابية من النماذج المحسّنة مثل YOLO26، فإنها تقدم مزايا مميزة في المجالات المتخصصة:
-
تحليل الصور الطبية: في مجال الرعاية الصحية، يُعد الاتجاه والشكل الدقيقان للشذوذ أمرين بالغي الأهمية. وقد طبّق الباحثون CapsNets على تقسيم أورام الدماغ، حيث يجب على النموذج تمييز الورم عن الأنسجة المحيطة استنادًا إلى تدرجات مكانية دقيقة قد تعمل شبكات CNN التقليدية على تسويتها. ويمكنك استكشاف أبحاث ذات صلة حول شبكات الكبسولات في التصوير الطبي.
-
التعرّف على الأرقام المتداخلة: حققت CapsNets نتائج متقدمة على مجموعة بيانات MNIST، وتحديدًا في الحالات التي تتداخل فيها الأرقام. وبما أن الشبكة تتتبع «وضعية» كل رقم، فإنها تستطيع فصل رقمين متداخلين (مثل الرقم '3' فوق الرقم '5') بوصفهما كائنين متميزين، بدلًا من دمجهما في خريطة ميزات واحدة مشوشة.
السياق العملي والتنفيذ#
تُعد شبكات الكبسولات بنيةً مخصصةً أساسًا للتصنيف. وعلى الرغم من أنها توفر متانة نظرية، فإن تطبيقات الصناعة الحديثة غالبًا ما تفضّل شبكات CNN أو Transformer عالية السرعة لتحقيق الأداء الفوري. ومع ذلك، فإن فهم معايير التصنيف المستخدمة مع CapsNets، مثل MNIST، يُعد مفيدًا.
يوضح المثال التالي كيفية تدريب نموذج تصنيف YOLO حديث على مجموعة بيانات MNIST باستخدام الحزمة ultralytics. ويوازي ذلك مهمة المعيار الأساسية المستخدمة للتحقق من صحة شبكات الكبسولات.
from ultralytics import YOLO
# Load a YOLO26 classification model (optimized for speed and accuracy)
model = YOLO("yolo26n-cls.pt")
# Train the model on the MNIST dataset
# This dataset helps evaluate how well a model learns handwritten digit features
results = model.train(data="mnist", epochs=5, imgsz=32)
# Run inference on a sample image
# The model predicts the digit class (0-9)
predict = model("https://docs.ultralytics.com/datasets/classify/mnist")مستقبل الكبسولات والذكاء الاصطناعي للرؤية#
تواصل المبادئ الكامنة وراء شبكات الكبسولات التأثير في أبحاث سلامة الذكاء الاصطناعي وقابليته للتفسير. فمن خلال نمذجة العلاقات بين الجزء والكل صراحةً، تقدم الكبسولات بديلًا «شفافًا» لطبيعة الشبكات العصبية العميقة «الصندوق الأسود»، مما يجعل القرارات أكثر قابلية للتفسير. وتتطلع التطورات المستقبلية إلى الجمع بين المتانة المكانية للكبسولات وسرعة الاستدلال في بنيات مثل YOLO11 أو YOLO26 الأحدث لتحسين الأداء في اكتشاف الكائنات ثلاثية الأبعاد والروبوتات. كما يستكشف الباحثون كبسولات المصفوفة مع التوجيه بـ EM لخفض التكلفة الحسابية لخوارزمية الاتفاق بدرجة أكبر.
بالنسبة إلى المطورين الراغبين في إدارة مجموعات البيانات وتدريب النماذج بكفاءة، توفر منصة Ultralytics بيئة موحدة لوضع التعليقات التوضيحية على البيانات، والتدريب في السحابة، ونشر النماذج التي توازن بين سرعة شبكات CNN والدقة اللازمة لمهام الرؤية المعقدة.









