دليل حول بنية U-Net وتطبيقاتها
تعرّف على بنية U-Net، وكيف تدعم تجزئة الصور، وتطبيقاتها، وسبب أهميتها في تطور الرؤية الحاسوبية.

الرؤية الحاسوبية هي فرع من الذكاء الاصطناعي (AI) يركّز على تحليل البيانات المرئية. وقد مهّدت الطريق أمام العديد من الأنظمة المتطورة، مثل أتمتة عملية فحص المنتجات في المصانع ومساعدة المركبات ذاتية القيادة على التنقل في الطرق.
تُعدّ عملية اكتشاف الكائنات إحدى أشهر مهام الرؤية الحاسوبية. تُمكّن هذه المهمة النماذج من تحديد مواقع الكائنات والتعرّف عليها داخل الصورة باستخدام المربعات المحيطة. وعلى الرغم من فائدة المربعات المحيطة في تطبيقات مختلفة، فإنها لا توفر سوى تقدير تقريبي لموقع الكائن.
لكن في مجالات مثل الرعاية الصحية، حيث تُعدّ الدقة أمرًا بالغ الأهمية، تعتمد حالات استخدام الذكاء الاصطناعي في الرؤية على أكثر من مجرد تحديد الكائن. فكثيرًا ما تتطلب أيضًا معلومات تتعلق بالشكل الدقيق للكائنات ومواضعها.
وهذا تحديدًا ما صُممت مهمة الرؤية الحاسوبية، التجزئة، لإنجازه. فبدلًا من استخدام المربعات المحيطة، تكتشف نماذج التجزئة الكائنات على مستوى البكسل. وعلى مر السنين، طوّر الباحثون نماذج متخصصة للرؤية الحاسوبية للتجزئة.
ومن هذه النماذج U-Net. وعلى الرغم من أن نماذج أحدث وأكثر تقدمًا قد تجاوزت أداءه، فإن U-Net يحتل مكانة مهمة في تاريخ الرؤية الحاسوبية. في هذه المقالة، سنلقي نظرةً أقرب على بنية U-Net، وكيفية عملها، وأماكن استخدامها، ومقارنتها بنماذج التجزئة الأحدث المتاحة اليوم.

الشكل 1. مثال على التجزئة باستخدام نموذج التعلم العميق U-Net. (المصدر)
تاريخ تجزئة الصور#
قبل أن نتعمق في ماهية U-Net، دعونا أولًا نكوّن فكرة أفضل عن كيفية تطور نماذج تجزئة الصور.
في البداية، اعتمدت الرؤية الحاسوبية على تقنيات تقليدية مثل اكتشاف الحواف، وتحديد العتبة، ونمو المناطق لفصل الكائنات في الصورة. استُخدمت هذه التقنيات لاكتشاف حدود الكائنات باستخدام الحواف، وفصل المناطق حسب شدة البكسل، وتجميع البكسلات المتشابهة. وقد نجحت في الحالات البسيطة، لكنها غالبًا ما أخفقت عندما احتوت الصور على ضوضاء أو أشكال متداخلة أو حدود غير واضحة.
بعد صعود التعلم العميق في 2012، قدّم الباحثون مفهوم الشبكات الالتفافية بالكامل (FCNs) في عام 2014 لمهام مثل التجزئة الدلالية. استبدلت هذه النماذج أجزاءً معينة من الشبكة الالتفافية، مما أتاح للحاسوب النظر إلى الصورة كاملةً دفعةً واحدة بدلًا من تقسيمها إلى أجزاء أصغر. وأتاح ذلك للنموذج إنشاء خرائط مفصلة توضّح محتوى الصورة بوضوح أكبر.

الشكل 2. تطور خوارزميات التجزئة القائمة على التعلم العميق. (المصدر)
استنادًا إلى الشبكات الالتفافية بالكامل (FCNs)، قدّم باحثون في جامعة فرايبورغ نموذج U-Net في عام 2015. وقد صُمم في الأصل من أجل تجزئة الصور الطبية الحيوية. وعلى وجه الخصوص، صُمم U-Net ليؤدي أداءً جيدًا في الحالات التي تكون فيها البيانات المشروحة محدودة.
في الوقت نفسه، أضافت الإصدارات اللاحقة مثل UNet++ وTransUNet تحسينات، مثل طبقات الانتباه واستخراج السمات بصورة أفضل. وتساعد طبقات الانتباه النموذج على التركيز على المناطق الرئيسية، بينما يلتقط استخراج السمات المحسّن معلومات أكثر تفصيلًا.
ما هو U-Net، وكيف تتدفق السمات عبر النموذج؟#
U-Net هو نموذج للتعلم العميق بُني خصيصًا لتجزئة الصور. يأخذ صورةً كمدخل وينتج قناع تجزئة يصنّف كل بكسل وفقًا للكائن أو المنطقة التي ينتمي إليها.
استمدّ النموذج اسمه من بنيته على شكل الحرف U. ويتكون من جزأين رئيسيين: مُرمّز يضغط الصورة ويتعلم سماتها، ومُفكّك ترميز يعيد توسيعها إلى حجمها الأصلي. وينشئ هذا التصميم شكل U متماثلًا، مما يساعد النموذج على فهم البنية العامة للصورة وتفاصيلها الدقيقة على حد سواء.
تتمثل إحدى السمات المهمة في U-Net في استخدام الوصلات التخطيّة، التي تتيح تمرير المعلومات من المُرمّز مباشرةً إلى مُفكّك الترميز. وهذا يعني أن النموذج يستطيع الحفاظ على التفاصيل المهمة التي قد تُفقد عند ضغط الصورة.
نظرة عامة على بنية U-Net#
إليك لمحة عن كيفية عمل بنية U-Net:
- صورة الإدخال: يبدأ U-Net بصورة ثنائية الأبعاد، مثل مسح طبي أو صورة قمر صناعي. والهدف هو إسناد تسمية فئة إلى كل بكسل في الصورة.
- التقليل التدريجي لأخذ العينات: تمر الصورة عبر طبقات التفاف تتعلم السمات المرئية المهمة. ومع انتقال الصورة عبر طبقات مختلفة، ينخفض وضوحها، ويحدد النموذج الأنماط الأوسع نطاقًا.
- طبقة عنق الزجاجة: في مركز الشبكة، تصل خرائط السمات إلى أصغر دقة مكانية لها، مع التقاط السمات الدلالية عالية المستوى. وببساطة، يمثّل هذا التمثيل المضغوط لخرائط السمات السياق العام للمدخل.
- الزيادة التدريجية لأخذ العينات: تعيد الشبكة بناء الصورة من خلال زيادة الدقة تدريجيًا. وتساعد الالتفافات المنقولة على توسيع خرائط السمات مجددًا باتجاه الحجم الأصلي.
- الوصلات التخطيّة: تُدمج خرائط السمات من مسار التقليل التدريجي لأخذ العينات مع الخرائط الموجودة في مسار الزيادة التدريجية لأخذ العينات. ويساعد ذلك على الحفاظ على التفاصيل المكانية الدقيقة مع دمج المعلومات السياقية عالية المستوى.
- الناتج هو خريطة تجزئة: الناتج النهائي هو قناع تجزئة على مستوى البكسل يطابق حجم المدخل. ويُصنّف كل بكسل ضمن فئة مثل كائن أو خلفية أو منطقة اهتمام.

الشكل 3. مخطط بنية U-Net. (المصدر)
فهم الفرق بين ViT وU-Net#
أثناء استكشافك لـ U-Net، قد تتساءل عن اختلافه عن نماذج التعلم العميق الأخرى، مثل المحوّل البصري (ViT)، الذي يستطيع أيضًا تنفيذ مهام التجزئة. وعلى الرغم من قدرة كلا النموذجين على تنفيذ مهام متشابهة، فإنهما يختلفان من حيث بنيتهما وطريقة تعاملهما مع التجزئة.
يعمل U-Net من خلال معالجة الصور على مستوى البكسل عبر طبقات التفاف ضمن بنية مُرمّز ومُفكّك ترميز. ويُستخدم غالبًا في المهام التي تتطلب تجزئة دقيقة، مثل المسوحات الطبية أو مشاهد السيارات ذاتية القيادة.
أما المحوّل البصري (ViT)، فيقسّم الصور إلى رقع ويعالجها في الوقت نفسه من خلال آليات الانتباه. ويستخدم الانتباه الذاتي (وهو آلية تتيح للنموذج ترجيح أهمية أجزاء مختلفة من الصورة بالنسبة إلى بعضها) لالتقاط العلاقة بين أجزاء الصورة المختلفة، بخلاف النهج الالتفافي الذي يتبعه U-Net.
ومن الفروق المهمة الأخرى أن ViT يحتاج عمومًا إلى مزيد من البيانات ليعمل جيدًا، لكنه بارع في التقاط الأنماط المعقدة. أما U-Net، فيؤدي أداءً جيدًا مع مجموعات بيانات أصغر، كما أنه أسرع في التدريب وغالبًا ما يتطلب وقتًا أقل للتدريب.
تطبيقات نموذج U-Net#
بعد أن كوّنا فهمًا أفضل لماهية U-Net وكيفية عمله، دعونا نستكشف كيفية تطبيق U-Net في مجالات مختلفة.
تجزئة نزيف الدماغ في التصوير الطبي#
أصبح U-Net أسلوبًا موثوقًا للتجزئة على مستوى البكسل للصور الطبية المعقدة، ولا سيما خلال ذروة استخدامه في الأبحاث. وقد استخدمه الباحثون لإبراز المناطق الرئيسية في المسوحات الطبية، مثل الأورام وعلامات النزيف الداخلي في صور CT وMRI. وأسهم هذا النهج بدرجة كبيرة في تحسين دقة التشخيص وتبسيط تحليل البيانات الطبية المعقدة في البيئات البحثية.
ومن أمثلة تأثير U-Net في أبحاث الرعاية الصحية استخدامه لتحديد السكتات الدماغية ونزيف الدماغ في المسوحات الطبية. إذ تمكّن الباحثون من استخدام U-Net لتحليل مسوحات الرأس وإبراز المناطق المثيرة للقلق، مما أتاح تحديد الحالات التي تتطلب عناية فورية بسرعة أكبر.

الشكل 4. تجزئة آفات السكتة الدماغية النزفية باستخدام 3D U-Net. (المصدر)
تجزئة المحاصيل في الزراعة#
من المجالات الأخرى التي استخدم فيها الباحثون U-Net الزراعة، ولا سيما لتجزئة المحاصيل والأعشاب الضارة والتربة. فهو يساعد المزارعين على مراقبة صحة النباتات، وتقدير الغلال، واتخاذ قرارات أفضل في المزارع الكبيرة. فعلى سبيل المثال، يستطيع U-Net فصل المحاصيل عن الأعشاب الضارة، مما يجعل استخدام مبيدات الأعشاب أكثر كفاءة ويقلل الهدر.
لمواجهة تحديات مثل ضبابية الحركة في صور الطائرات المسيّرة، حسّن الباحثون U-Net باستخدام تقنيات إزالة ضبابية الصور. ويضمن ذلك تجزئة أوضح، حتى عند جمع البيانات أثناء الحركة، مثل عمليات المسح الجوي.

الشكل 5. فصل المحاصيل عن الأعشاب الضارة في الحقول الزراعية باستخدام U-Net. (المصدر)
القيادة الذاتية#
قبل طرح نماذج الذكاء الاصطناعي الأكثر تقدمًا، أدّى U-Net دورًا حيويًا في استكشاف كيفية تعزيز التجزئة للقيادة الذاتية. وفي المركبات ذاتية القيادة، يمكن استخدام التجزئة الدلالية في U-Net لتصنيف كل بكسل في الصورة ضمن فئات مثل الطريق والمركبة والمشاة وعلامات المسارات. ويوفر ذلك للسيارة رؤية واضحة لمحيطها، مما يساعد على التنقل الآمن واتخاذ القرارات الفعّال.

الشكل 6. مشهد لطريق جرى فيه تجزئة المنطقة القابلة للقيادة باستخدام U-Net. (المصدر)
إيجابيات U-Net وسلبياته#
حتى اليوم، يظل U-Net خيارًا جيدًا لتجزئة الصور بين الباحثين بفضل توازنه بين البساطة والدقة وقابلية التكيف. فيما يلي بعض المزايا الرئيسية التي تميّزه:
- قابلية التكيف مع الأنماط المختلفة: جرى تكييف U-Net مع أنواع مختلفة من البيانات، بما في ذلك المسوحات الطبية ثلاثية الأبعاد، وصور الأقمار الصناعية، وحتى إطارات الفيديو.
- استدلال سريع عند التحسين: عند ضبطه على النحو المناسب، يستطيع U-Net العمل بكفاءة، مما يجعله مناسبًا للتطبيقات في الوقت الفعلي أو شبه الفعلي.
- مفتوح المصدر ومدعوم من المجتمع: يتوفر U-Net عبر مكتبات التعلم العميق الرئيسية، ويدعمه مجتمع كبير من المطورين والباحثين.
على الرغم من أن U-Net يتمتع بالعديد من نقاط القوة، فهناك أيضًا بعض القيود التي ينبغي أخذها في الاعتبار. فيما يلي بعض العوامل التي يجب مراعاتها:
- حساس لجودة البيانات: قد يتأثر أداء U-Net سلبًا بالبيانات منخفضة الجودة، مثل الصور المشوشة أو منخفضة الدقة.
- معرّض للإفراط في التكيّف مع مجموعات البيانات الصغيرة: على الرغم من أن U-Net يؤدي أداءً جيدًا مع البيانات المحدودة، فإنه يظل معرضًا للإفراط في التكيّف إذا لم يُنظّم تنظيمًا مناسبًا، ولا سيما عندما تكون مجموعة البيانات صغيرة جدًا أو تفتقر إلى التنوع.
- الموارد الحاسوبية: قد يكون U-Net مكلفًا حاسوبيًا، لا سيما عند العمل مع مجموعات بيانات كبيرة، إذ يتطلب موارد عتادية كبيرة للتدريب.
أهم النقاط المستخلصة#
كان U-Net محطةً رئيسيةً في تطور تجزئة الصور. فقد أثبت أن نماذج التعلم العميق يمكنها تقديم نتائج دقيقة باستخدام مجموعات بيانات أصغر، ولا سيما في مجالات مثل التصوير الطبي.
وقد مهّد هذا الإنجاز الطريق أمام تطبيقات أكثر تقدمًا في مجالات متنوعة. ومع استمرار تطور الرؤية الحاسوبية، تظل نماذج التجزئة مثل U-Net أساسيةً لتمكين الآلات من فهم البيانات المرئية وتفسيرها بدقة عالية.
هل تتطلع إلى بناء مشاريعك الخاصة في مجال الرؤية الحاسوبية؟ استكشف مستودع GitHub لدينا للتعمق في الذكاء الاصطناعي، واطّلع على خيارات الترخيص لدينا. تعرّف على كيفية مساهمة الرؤية الحاسوبية في الرعاية الصحية في تحسين الكفاءة، واستكشف تأثير الذكاء الاصطناعي في قطاع التجزئة بزيارة صفحات حلولنا! انضم إلى مجتمعنا المتنامي الآن!









