PaliGemma 2 من Google: رؤى حول نماذج VLM المتقدمة
انضموا إلينا لنلقي نظرةً عن كثب على نماذج Google الجديدة للغة والرؤية: PaliGemma 2. يمكن أن تساعد هذه النماذج في فهم الصور والنصوص وتحليلها.

في 5 ديسمبر 2024، قدّمت Google نموذج PaliGemma 2، أحدث إصدار من نموذج الرؤية واللغة (VLM) المتطور. صُمّم PaliGemma 2 للتعامل مع المهام التي تجمع بين الصور والنصوص، مثل إنشاء التسميات التوضيحية، والإجابة عن الأسئلة المرئية، واكتشاف الكائنات في العناصر المرئية.
استنادًا إلى PaliGemma الأصلي، الذي كان بالفعل أداة قوية لإنشاء التسميات التوضيحية متعددة اللغات والتعرّف على الكائنات، يقدّم PaliGemma 2 العديد من التحسينات الرئيسية. وتشمل هذه التحسينات أحجامًا أكبر للنموذج، ودعم الصور ذات الدقة الأعلى، وأداءً أفضل في المهام المرئية المعقدة. وتجعل هذه الترقيات النموذج أكثر مرونة وفعالية لمجموعة واسعة من الاستخدامات.
في هذه المقالة، سنلقي نظرة فاحصة على PaliGemma 2، بما في ذلك آلية عمله، وميزاته الرئيسية، والتطبيقات التي يتألق فيها. لنبدأ!
من Gemma 2 إلى PaliGemma 2#
بُني PaliGemma 2 على تقنيتين رئيسيتين: مشفّر الرؤية SigLIP ونموذج اللغة Gemma 2. يعالج مشفّر SigLIP البيانات المرئية، مثل الصور أو مقاطع الفيديو، ويحوّلها إلى سمات يستطيع النموذج تحليلها. وفي الوقت نفسه، يتولى Gemma 2 معالجة النصوص، ما يمكّن النموذج من فهم اللغة متعددة اللغات وإنشائها. وتشكل التقنيتان معًا نموذج VLM مصممًا لتفسير المعلومات المرئية والنصية وربطها بسلاسة.
ما يجعل PaliGemma 2 خطوة كبيرة إلى الأمام هو قابليته للتوسع وتعدد استخداماته. فعلى خلاف الإصدار الأصلي، يتوفر PaliGemma 2 بثلاثة أحجام: 3 مليارات (3B)، و10 مليارات (10B)، و28 مليارًا (28B) من المعلمات. وتشبه هذه المعلمات الإعدادات الداخلية للنموذج، إذ تساعده على تعلم البيانات ومعالجتها بفعالية. كما يدعم دقات صور مختلفة (مثل 224 × 224 بكسل للمهام السريعة و896 × 896 للتحليل التفصيلي)، ما يجعله قابلًا للتكيف مع تطبيقات متنوعة.

الشكل 1. نظرة عامة على PaliGemma 2.
يؤدي دمج إمكانات Gemma 2 اللغوية المتقدمة مع معالجة SigLIP للصور إلى جعل PaliGemma 2 أكثر ذكاءً بدرجة ملحوظة. ويمكنه التعامل مع مهام مثل:
- إنشاء تسميات توضيحية للصور أو مقاطع الفيديو: يستطيع النموذج إنشاء أوصاف نصية تفصيلية للعناصر المرئية، ما يجعله مفيدًا لإنشاء التسميات التوضيحية تلقائيًا.
- الإجابة عن الأسئلة المرئية: يستطيع PaliGemma 2 الإجابة عن الأسئلة استنادًا إلى الصور، مثل تحديد الكائنات أو الأشخاص أو الأفعال في أحد المشاهد.
- التعرّف على الكائنات: يحدد الكائنات داخل الصورة ويضع تسميات لها، مثل التمييز بين قطة أو طاولة أو سيارة في صورة.
يتجاوز PaliGemma 2 معالجة الصور والنصوص كلٌّ على حدة، إذ يجمع بينهما بطرق ذات معنى. فعلى سبيل المثال، يمكنه فهم العلاقات في أحد المشاهد، مثل التعرّف على أن «القطة تجلس على الطاولة»، أو تحديد الكائنات مع إضافة سياق، مثل التعرّف على معلم شهير.
آلية عمل نماذج VLM في PaliGemma 2 من Google#
سنستعرض بعد ذلك مثالًا باستخدام الرسم البياني الموضح في الصورة أدناه لفهم كيفية معالجة PaliGemma 2 للبيانات المرئية والنصية بصورة أفضل. لنفترض أنك حمّلت هذا الرسم البياني وسألت النموذج: «ماذا يمثّل هذا الرسم البياني؟»

الشكل 2. مثال على إمكانات PaliGemma 2.
تبدأ العملية باستخدام مشفّر الرؤية SigLIP في PaliGemma 2 لتحليل الصور واستخراج السمات الرئيسية. وفي حالة الرسم البياني، يشمل ذلك تحديد عناصر مثل المحاور ونقاط البيانات والتسميات. ويُدرَّب المشفّر على التقاط الأنماط العامة والتفاصيل الدقيقة على حد سواء. كما يستخدم التعرّف الضوئي على الحروف (OCR) لاكتشاف أي نص مضمن في الصورة ومعالجته. وتُحوَّل هذه السمات المرئية إلى رموز، وهي تمثيلات رقمية يستطيع النموذج معالجتها. ثم تُعدَّل هذه الرموز باستخدام طبقة إسقاط خطي، وهي تقنية تضمن إمكانية دمجها بسلاسة مع البيانات النصية.
في الوقت نفسه، يعالج نموذج اللغة Gemma 2 الاستعلام المصاحب لتحديد معناه ومقصده. ويُحوَّل نص الاستعلام إلى رموز، ثم تُدمج هذه الرموز مع الرموز المرئية القادمة من SigLIP لإنشاء تمثيل متعدد الوسائط، وهو تنسيق موحّد يربط البيانات المرئية والنصية.
باستخدام هذا التمثيل المتكامل، ينشئ PaliGemma 2 استجابة خطوةً بخطوة عبر فك الترميز التلقائي الانحداري، وهي طريقة يتنبأ فيها النموذج بجزء واحد من الإجابة في كل مرة استنادًا إلى السياق الذي عالجه بالفعل.
الإمكانات الرئيسية لـ PaliGemma 2#
بعد أن فهمنا آلية عمله، لنستكشف الميزات الرئيسية التي تجعل PaliGemma 2 نموذجًا موثوقًا للرؤية واللغة:
- مرونة الضبط الدقيق: يتكيف بسهولة مع مجموعات بيانات ومهام محددة، ويؤدي أداءً جيدًا في تطبيقات مثل إنشاء التسميات التوضيحية للصور، والاستدلال المكاني، والتصوير الطبي.
- بيانات تدريب متنوعة: دُرّب على مجموعات بيانات مثل WebLI وOpenImages، ما يمنحه إمكانات قوية للتعرّف على الكائنات وإنتاج مخرجات متعددة اللغات.
- تكامل OCR: يتضمن التعرّف الضوئي على الحروف لاستخراج النصوص من الصور وتفسيرها، ما يجعله مثاليًا لتحليل المستندات والمهام النصية الأخرى.
- مخرجات متعددة اللغات: ينشئ تسميات توضيحية واستجابات بلغات متعددة، ما يجعله مثاليًا للتطبيقات العالمية.
- التكامل مع الأدوات: يتوافق مع أُطر عمل مثل Hugging Face Transformers وPyTorch وKeras، ما يتيح النشر والتجريب بسهولة.
مقارنة PaliGemma 2 وPaliGemma: ما الذي تحسّن؟#
تُعدّ دراسة بنية الإصدار الأول من PaliGemma طريقة جيدة لرؤية تحسينات PaliGemma 2. ويتمثل أحد أبرز التغييرات في استبدال نموذج اللغة Gemma الأصلي بـ Gemma 2، الذي يقدّم تحسينات كبيرة في الأداء والكفاءة على حد سواء.
يتوفر Gemma 2 بأحجام 9B و27B من المعلمات، وقد صُمّم لتقديم دقة وسرعة رائدتين ضمن الفئة مع خفض تكاليف النشر. ويحقق ذلك من خلال بنية مُعاد تصميمها ومحسّنة لكفاءة الاستدلال عبر إعدادات متنوعة للأجهزة، بدءًا من وحدات GPU القوية ووصولًا إلى التكوينات الأكثر توافرًا.

الشكل 3. نظرة إلى الإصدار الأول من PaliGemma 2.
ونتيجة لذلك، يُعدّ PaliGemma 2 نموذجًا دقيقًا للغاية. ويحقق إصدار 10B من PaliGemma 2 درجة أقل تبلغ 20.3 لمقياس الجملة غير المستلزمة (NES)، مقارنةً بدرجة 34.3 للنموذج الأصلي، ما يعني أخطاءً واقعية أقل في مخرجاته. وتجعل هذه التطورات PaliGemma 2 أكثر قابلية للتوسع ودقةً وتكيفًا مع نطاق أوسع من التطبيقات، بدءًا من إنشاء التسميات التوضيحية التفصيلية ووصولًا إلى الإجابة عن الأسئلة المرئية.
تطبيقات PaliGemma 2: الاستخدامات الواقعية لنماذج VLM#
يمتلك PaliGemma 2 القدرة على إعادة تعريف الصناعات من خلال الجمع السلس بين الفهم المرئي واللغوي. فعلى سبيل المثال، فيما يتعلق بـإمكانية الوصول، يمكنه إنشاء أوصاف تفصيلية للكائنات والمشاهد والعلاقات المكانية، مقدمًا مساعدة بالغة الأهمية للأشخاص ذوي الإعاقة البصرية. وتساعد هذه الإمكانية المستخدمين على فهم بيئاتهم بصورة أفضل، مما يوفر استقلالية أكبر في المهام اليومية.

الشكل 4. يمكن لـ PaliGemma 2 أن يجعل العالم أكثر سهولة في الوصول.
إضافةً إلى إمكانية الوصول، يُحدث PaliGemma 2 أثرًا في صناعات متنوعة، منها:
- التجارة الإلكترونية: يعزز النموذج تصنيف المنتجات من خلال تحليل العناصر الموجودة في الصور ووصفها، ما يبسّط إدارة المخزون ويحسّن تجربة البحث للمستخدمين.
- الرعاية الصحية: يدعم المتخصصين الطبيين من خلال تفسير صور الأشعة الطبية، مثل الأشعة السينية وMRI، إلى جانب الملاحظات السريرية لتوفير تشخيصات أكثر دقة واستنارة.
- التعليم: يساعد PaliGemma 2 المعلمين على إنشاء مواد تعليمية وصفية سهلة الوصول من خلال إنشاء تسميات توضيحية وتوفير معلومات سياقية للصور.
- إنشاء المحتوى: يؤتمت النموذج عملية إنشاء التسميات التوضيحية والأوصاف المرئية لمحتوى الوسائط المتعددة، مما يوفر الوقت لمنشئي المحتوى.
جرّبه بنفسك: PaliGemma 2#
لتجربة PaliGemma 2، يمكنك البدء بالعرض التفاعلي من Hugging Face. ويتيح لك استكشاف إمكاناته في مهام مثل إنشاء التسميات التوضيحية للصور والإجابة عن الأسئلة المرئية. ما عليك سوى تحميل صورة وطرح أسئلة على النموذج بشأنها أو طلب وصف للمشهد.

الشكل 5. عرض توضيحي لـ PaliGemma 2 (المصدر: Hugging Face).
إذا كنت ترغب في التعمق أكثر، فإليك كيفية البدء عمليًا:
- النماذج المُدرَّبة مسبقًا: يمكنك الوصول إلى النماذج المُدرَّبة مسبقًا والتعليمات البرمجية من منصات مثل Hugging Face وKaggle. وتوفر هذه الموارد كل ما تحتاج إليه لبدء العمل مع النموذج.
- دفاتر الملاحظات: تتوفر وثائق شاملة ودفاتر ملاحظات نموذجية لتعريفك بـ PaliGemma 2. ويمكنك البدء بأمثلة الاستدلال والتجريب بضبط النموذج دقيقًا على مجموعة البيانات الخاصة بك لمهام محددة.
- التكاملات: يتوافق PaliGemma 2 مع أُطر العمل واسعة الاستخدام مثل Hugging Face Transformers وKeras وPyTorch وJAX وGemma.cpp، ما يتيح لك دمجه بسهولة في مهام سير العمل الحالية.
إيجابيات وسلبيات PaliGemma 2 من Google#
بعد أن فهمنا كيفية البدء باستخدام PaliGemma 2، لنلقِ نظرة فاحصة على نقاط قوته الرئيسية وعيوبه التي ينبغي وضعها في الحسبان عند استخدام هذه النماذج.
إليك ما يميز PaliGemma 2 بوصفه نموذجًا للرؤية واللغة:
- مكاسب الكفاءة: بالاستفادة من بنية Gemma 2 المحسّنة، يقدّم PaliGemma 2 أداءً عاليًا مع تقليل تكاليف النشر إلى أدنى حد.
- ميزات أمان محسّنة: يتضمن PaliGemma 2 تحسينات كبيرة في مجال الأمان ضمن عملية تدريبه، مثل التصفية الصارمة لبيانات ما قبل التدريب للحد من التحيزات، والتقييم الدقيق مقابل معايير الأمان.
- زمن انتقال منخفض للتكوينات الأصغر: يوفر نموذج 3B أوقات استدلال أسرع، ما يجعله مناسبًا لحالات الاستخدام التي تكون فيها السرعة أمرًا بالغ الأهمية، مثل توصيات منتجات التجارة الإلكترونية أو أنظمة الدعم المباشر.
في المقابل، إليك بعض المجالات التي قد يواجه فيها PaliGemma 2 قيودًا:
- زمن الانتقال: رغم قوة النماذج الأكبر، فقد تواجه مشكلات في زمن الانتقال، لا سيما عند نشرها لمهام تتطلب استجابات فورية، مثل أنظمة الذكاء الاصطناعي التفاعلية في الوقت الفعلي.
- الاعتماد على مجموعات بيانات كبيرة: يرتبط أداء PaliGemma 2 ارتباطًا وثيقًا بجودة مجموعات بيانات التدريب وتنوعها، ما قد يحد من فعاليته في المجالات قليلة التمثيل أو اللغات غير المدرجة في بيانات التدريب.
- متطلبات موارد مرتفعة: رغم التحسينات، تتطلب إصدارات 10B و28B من المعلمات قدرة حسابية كبيرة، مما يجعلها أقل إتاحة للمؤسسات الصغيرة ذات الموارد المحدودة.
أهم النقاط المستخلصة#
يمثل PaliGemma 2 تطورًا مثيرًا للاهتمام في نمذجة الرؤية واللغة، إذ يوفر قابلية محسّنة للتوسع، ومرونة في الضبط الدقيق، ودقة أفضل. ويمكن أن يكون أداة قيّمة لتطبيقات تتراوح بين حلول إمكانية الوصول والتجارة الإلكترونية، وصولًا إلى تشخيصات الرعاية الصحية والتعليم.
ومع أن له بعض القيود، مثل المتطلبات الحسابية والاعتماد على بيانات عالية الجودة، فإن نقاط قوته تجعله خيارًا عمليًا لمعالجة المهام المعقدة التي تدمج البيانات المرئية والنصية. ويمكن لـ PaliGemma 2 توفير أساس متين للباحثين والمطورين لاستكشاف إمكانات الذكاء الاصطناعي في التطبيقات متعددة الوسائط وتوسيعها.
كن جزءًا من نقاش الذكاء الاصطناعي من خلال الاطلاع على مستودع GitHub ومجتمعنا. واقرأ عن كيفية إحراز الذكاء الاصطناعي تقدمًا في الزراعة والرعاية الصحية! 🚀









