Florence-2: أحدث نموذج للرؤية واللغة من Microsoft
تعرّف على Florence-2، نموذج Microsoft للرؤية واللغة الذي يوفر أداءً محسنًا في كشف الأجسام والتجزئة والتعلم من دون أمثلة، بكفاءة عالية.

في يونيو 2024، قدّمت Microsoft نموذج Florence-2، وهو نموذج لغة بصري (VLM) متعدد الوسائط مصمم للتعامل مع مجموعة واسعة من المهام، بما في ذلك اكتشاف الأجسام، والتقسيم، وإنشاء أوصاف للصور، والإرساء البصري. يضع Florence-2 معيارًا جديدًا لأداء اللقطات الصفرية، أي إنه يستطيع تنفيذ المهام من دون تدريب محدد مسبقًا، كما يتميز بحجم نموذج أصغر من نماذج اللغة والرؤية المتطورة الأخرى.
إن Florence-2 ليس مجرد نموذج آخر؛ إذ تتمتع قدراته المتعددة وأداؤه المحسّن بإمكانات تؤهله لإحداث تأثير كبير في مختلف الصناعات من خلال تحسين الدقة وتقليل الحاجة إلى التدريب المكثف. سنستكشف في هذه المقالة الميزات المبتكرة لـ Florence-2، ونقارن أداءه بأداء نماذج VLM الأخرى، ونناقش تطبيقاته المحتملة.
ما هو Florence-2؟#
يستطيع Florence-2 التعامل مع مجموعة متنوعة من المهام ضمن إطار عمل موحّد واحد. وتعود قدرات النموذج المذهلة جزئيًا إلى مجموعة بيانات التدريب الضخمة التي تُسمى FLD-5B. وتتضمن FLD-5B 5.4 مليارات تعليق توضيحي موزعة على 126 مليون صورة. أُنشئت مجموعة البيانات الشاملة هذه خصيصًا لتزويد Florence-2 بالقدرات اللازمة للتعامل مع مجموعة واسعة من مهام الرؤية بدقة وكفاءة عاليتين.
إليك نظرةً أقرب على المهام التي يدعمها Florence-2:
- اكتشاف الأجسام: يستطيع تحديد الأجسام داخل الصور وتحديد مواقعها بدقة عالية.
- التقسيم: تتضمن هذه المهمة تقسيم الصورة إلى أجزاء ذات معنى لتسهيل تحليلها وتفسيرها.
- إنشاء أوصاف للصور: يستطيع Florence-2 إنشاء أوصاف توضيحية للصور توفر السياق والتفاصيل.
- الإرساء البصري: يستطيع النموذج ربط عبارات أو كلمات محددة في الوصف بالمناطق المناظرة لها في الصورة.
- أداء اللقطات الصفرية: يستطيع تنفيذ المهام من دون تدريب محدد.

الشكل 1. فهم كيفية تدريب Florence-2.
يدعم النموذج المهام القائمة على النصوص والمهام القائمة على المناطق على حد سواء. وتُضاف رموز مواقع خاصة إلى مفردات النموذج للمهام التي تتضمن مناطق محددة من الصورة. وتساعد هذه الرموز النموذج على فهم الأشكال المختلفة، مثل المستطيلات المحيطة بالأجسام (تمثيل الصندوق)، والأشكال الرباعية (تمثيل الصندوق الرباعي)، والأشكال متعددة الأضلاع (تمثيل المضلع). ويُدرَّب النموذج باستخدام طريقة تُسمى خسارة الانتروبيا المتقاطعة، التي تساعده على التعلم من خلال مقارنة تنبؤاته بالإجابات الصحيحة وضبط معلماته الداخلية وفقًا لذلك.
إنشاء مجموعة بيانات FLD-5B#
تتضمن مجموعة بيانات FLD-5B أنواعًا مختلفة من التعليقات التوضيحية: أوصافًا نصية، وأزواجًا من المناطق والنصوص، ومجموعات من النصوص والعبارات والمناطق. أُنشئت من خلال عملية مؤلفة من خطوتين تتضمن جمع البيانات والتعليق التوضيحي. واستُمدت الصور من مجموعات بيانات شائعة مثل ImageNet-22k وObject 365 وOpen Images وConceptual Captions وLAION. ومعظم التعليقات التوضيحية في مجموعة بيانات FLD-5B اصطناعية، أي إنها أُنشئت تلقائيًا بدلًا من وسمها يدويًا.

الشكل 2. إنشاء مجموعة بيانات FLD-5B.
في البداية، أنشأت نماذج متخصصة وماهرة في مهام محددة، مثل اكتشاف الأجسام أو التقسيم، هذه التعليقات التوضيحية. ثم استُخدمت عملية ترشيح وتحسين لضمان تفصيل التعليقات التوضيحية ودقتها. وبعد إزالة أي ضوضاء، خضعت مجموعة البيانات للتحسين التكراري، حيث استُخدمت مخرجات Florence-2 لتحديث التعليقات التوضيحية وتحسينها باستمرار.
فهم بنية نموذج Florence-2#
تتبع بنية نموذج Florence-2 منهجية تعلّم التسلسل إلى التسلسل. وهذا يعني أن النموذج يعالج تسلسلًا إدخاليًا، مثل صورة مع مطالبة نصية، وينشئ تسلسلًا إخراجيًا، مثل وصف أو تسمية، بطريقة تدريجية. وفي إطار التسلسل إلى التسلسل، تُعامل كل مهمة باعتبارها مسألة ترجمة: يأخذ النموذج صورة إدخال ومطالبة خاصة بالمهمة، ثم ينشئ المخرج المناظر.

الشكل 3. بنية نموذج Florence-2 للغة والرؤية.
في صميم بنية النموذج يوجد Transformer متعدد الوسائط بنمط المُرمّز-فكّاك الترميز، يجمع بين مُرمّز الصور ومُرمّز-فكّاك ترميز متعدد الوسائط. ويعالج مُرمّز الصور، الذي يُسمى DaViT (Transformer للرؤية عالي الكفاءة من حيث البيانات)، صور الإدخال من خلال تحويلها إلى تضمينات رموز بصرية، وهي تمثيلات مدمجة للصورة تلتقط المعلومات المكانية (مواضع الأشياء) والدلالية (ماهية الأشياء) على حد سواء. ثم تُدمج هذه الرموز البصرية مع تضمينات النص (تمثيلات النص)، ما يتيح للنموذج دمج البيانات النصية والبصرية بسلاسة.
مقارنة Florence-2 بنماذج VLM الأخرى#
يتميز Florence-2 عن نماذج اللغة والرؤية الأخرى بفضل قدراته المذهلة في اللقطات الصفرية. فعلى خلاف نماذج مثل PaliGemma، التي تعتمد على الضبط الدقيق المكثف للتكيف مع المهام المختلفة، يعمل Florence-2 بكفاءة مباشرةً دون إعداد إضافي. كما يستطيع Florence-2 منافسة نماذج أكبر مثل GPT-4V وFlamingo، التي غالبًا ما تحتوي على عدد أكبر بكثير من المعلمات، لكنها لا تضاهي دائمًا أداء Florence-2. فعلى سبيل المثال، يحقق Florence-2 نتائج أفضل في اللقطات الصفرية من Kosmos-2، رغم أن Kosmos-2 يضم أكثر من ضعف عدد المعلمات.
أظهر Florence-2 في اختبارات المعايير أداءً لافتًا في مهام مثل إنشاء أوصاف COCO وفهم العبارات الإحالية. وتفوق على نماذج مثل PolyFormer وUNINEXT في مهام اكتشاف الأجسام والتقسيم على مجموعة بيانات COCO. وهو خيار منافس للغاية للتطبيقات الواقعية التي تكون فيها الكفاءة من حيث الأداء والموارد أمرًا بالغ الأهمية.
تطبيقات Florence-2#
يمكن استخدام Florence-2 في العديد من الصناعات المختلفة، مثل الترفيه، وإمكانية الوصول، والتعليم، وغير ذلك. دعونا نستعرض بعض الأمثلة لفهم ذلك بصورة أفضل.
تطبيقات إنشاء أوصاف للصور#
عندما تكون على منصة بث وتحاول تحديد ما ستشاهده، قد تقرأ ملخصًا لفيلم لمساعدتك على الاختيار. ماذا لو تمكنت المنصة أيضًا من تقديم وصف تفصيلي لملصق الفيلم؟ يستطيع Florence-2 تحقيق ذلك من خلال إنشاء أوصاف للصور، إذ ينشئ نصوصًا وصفية للصور. ويمكن لـ Florence-2 إنشاء أوصاف تفصيلية لملصقات الأفلام، ما يجعل منصات البث أكثر شمولًا للمستخدمين ذوي الإعاقة البصرية. ومن خلال تحليل العناصر البصرية للملصق، مثل الشخصيات والمشهد والنص، يستطيع Florence-2 إنشاء أوصاف تفصيلية تنقل محتوى الملصق وأجواءه. وتوضح الصورة أدناه مستوى التفاصيل الذي يستطيع Florence-2 تقديمه في وصفه.

الشكل 4. مثال على وصف صورة أنشأه Florence-2.
إليك بعض الأمثلة الأخرى على الحالات التي يمكن أن يكون فيها إنشاء أوصاف للصور مفيدًا:
- التجارة الإلكترونية: يمكن لإنشاء أوصاف للصور توفير أوصاف تفصيلية لصور المنتجات، ما يساعد العملاء على فهم ميزات المنتجات وتفاصيلها بوضوح أكبر.
- السفر والسياحة: يمكنه توفير أوصاف تفصيلية للمعالم ومناطق الجذب في أدلة السفر والتطبيقات.
- التعليم: يمكن لإنشاء أوصاف للصور تسمية الصور والمخططات التعليمية ووصفها، مما يساعد في التعليم والتعلّم.
- العقارات: يمكنه توفير أوصاف تفصيلية لصور العقارات تبرز الميزات ووسائل الراحة للمشترين المحتملين.
استخدام الإرساء البصري أثناء الطهي#
يمكن أيضًا استخدام Florence-2 لإثراء تجارب الطهي. فعلى سبيل المثال، يمكن لكتاب وصفات إلكتروني استخدام Florence-2 لإرساء أجزاء صورة وصفة معقدة بصريًا وتسميتها. ويساعد الإرساء البصري هنا من خلال ربط أجزاء محددة من الصورة بالنص الوصفي المناظر لها. ويمكن تسمية كل مكوّن وكل خطوة وشرحها بدقة، مما يسهل على الطهاة في المنزل اتباع الوصفة وفهم دور كل مكوّن في الطبق.

الشكل 5. مثال على الإرساء البصري باستخدام Florence-2.
OCR القائم على المناطق للمستندات المالية#
يمكن أن يكون OCR مع المعالجة القائمة على المناطق، التي تركز على استخراج النص من مناطق محددة داخل المستند، مفيدًا في مجالات مثل المحاسبة. ويمكن تحليل المناطق المحددة من المستندات المالية لاستخراج معلومات مهمة تلقائيًا، مثل تفاصيل المعاملات وأرقام الحسابات وتواريخ الاستحقاق. ومن خلال تقليل الحاجة إلى إدخال البيانات يدويًا، فإنه يقلل الأخطاء ويسرّع أوقات المعالجة. ويمكن للمؤسسات المالية استخدامه لتبسيط مهام مثل معالجة الفواتير، وتسوية الإيصالات، ومقاصة الشيكات، مما يؤدي إلى معاملات أسرع وخدمة عملاء أفضل.

الشكل 6. مثال على استخراج OCR باستخدام المناطق مع Florence-2.
التقسيم القائم على المناطق في التطبيقات الصناعية#
يمكن للتقسيم القائم على المناطق، الذي يتضمن تقسيم الصورة إلى أجزاء ذات معنى لإجراء تحليل مركز وفحص تفصيلي، أن يدعم التطبيقات الصناعية التي تحسّن الدقة والكفاءة في مختلف العمليات. ومن خلال التركيز على مناطق محددة داخل الصورة، تتيح هذه التقنية إجراء فحص وتحليل تفصيليين للمكوّنات والمنتجات. وفيما يتعلق بمراقبة الجودة، يمكنها تحديد العيوب أو حالات عدم الاتساق في المواد، مثل التشققات أو عدم المحاذاة، بما يضمن وصول المنتجات الأعلى جودة فقط إلى السوق.

الشكل 7. مثال على التقسيم القائم على المناطق باستخدام Florence-2.
كما يحسّن خطوط التجميع المؤتمتة من خلال توجيه الأذرع الروبوتية إلى أجزاء محددة وتحسين مواضع المكوّنات وتجميعها. وبالمثل، يساعد في إدارة المخزون على تتبع حالة السلع ومواقعها ومراقبتها، مما يؤدي إلى لوجستيات أكثر كفاءة وتقليل وقت التوقف. وبوجه عام، يعزز التقسيم القائم على المناطق الدقة والإنتاجية، مما يؤدي إلى خفض التكاليف ورفع جودة المنتجات في البيئات الصناعية.
أهم النقاط المستخلصة#
بدأنا نرى اتجاهًا تصبح فيه نماذج الذكاء الاصطناعي أخف وزنًا مع الحفاظ على أداء عالٍ. ويمثل Florence-2 خطوة كبيرة إلى الأمام من حيث نماذج اللغة والرؤية. فهو يستطيع التعامل مع مهام متنوعة مثل اكتشاف الأجسام، والتقسيم، وإنشاء أوصاف للصور، والإرساء البصري، مع أداء مذهل في اللقطات الصفرية. وعلى الرغم من حجمه الأصغر، يتميز Florence-2 بالكفاءة وتعدد الوظائف، مما يجعله مفيدًا للغاية من حيث التطبيقات في مختلف الصناعات. وتتيح نماذج مثل Florence-2 مزيدًا من الإمكانات، وتوسّع نطاق فرص الابتكار في مجال الذكاء الاصطناعي.
استكشف المزيد حول الذكاء الاصطناعي بزيارة مستودع GitHub والانضمام إلى مجتمعنا. واطّلع على صفحات حلولنا لقراءة المزيد عن تطبيقات الذكاء الاصطناعي في التصنيع والزراعة. 🚀









