تعرّف عمليًا على Google Gemini 2.5 لمهام الرؤية الحاسوبية
تعرّف عمليًا على Google Gemini 2.5 لمهام الرؤية الحاسوبية مثل اكتشاف الأجسام، ووصف الصور، وOCR لحلول الذكاء الاصطناعي للرؤية.

تتسارع تطورات الذكاء الاصطناعي، إذ تتصدر الابتكارات الجديدة عناوين الأخبار تقريبًا كل يوم. ومن بين هذه الاختراقات الحديثة Gemini 2.5، أحدث نموذج متعدد الوسائط من Google DeepMind، والذي أُطلق في 26 مارس. وبينما يمكن لـ نماذج اللغة الكبيرة (LLMs) التقليدية التعلّم من كميات هائلة من البيانات لتوليد نصوص شبيهة بالنصوص البشرية، فإن Gemini 2.5 يتجاوز ذلك.
صُمّم بوصفه «نموذجًا تفكيريًا» قادرًا على معالجة الصور والصوت والفيديو. كما يتمتع بقدرات محسّنة في الاستدلال والبرمجة. ومن المثير للاهتمام أنه يحقق أداءً استثنائيًا أيضًا في مهام الرؤية الحاسوبية، حيث تفسّر الآلات البيانات المرئية وتحللها، مثل اكتشاف الكائنات، ووصف الصور، والتعرّف البصري على الحروف (OCR).

الشكل 1. مثال على استخدام Gemini 2.5 لفهم محتوى صورة.
في هذه المقالة، سنستعرض إحدى دفاتر ملاحظات Ultralytics التي يمكن أن تساعدك على التعرّف عمليًا على إمكانات Gemini 2.5 في مجال الرؤية الحاسوبية. وسنلقي أيضًا نظرة فاحصة على الميزات الأساسية لـ Gemini 2.5، ونوضح كيفية استخدامه لبناء حلول الرؤية الحاسوبية لتطبيقات العالم الحقيقي. لنبدأ!
نظرة عامة على Gemini 2.5: الميزات والقدرات#
الإصدار الأول الذي أُطلق حديثًا ضمن سلسلة نماذج Gemini 2.5 هو إصدار تجريبي من Gemini 2.5 Pro. وقد صُمّم للتعامل مع المشكلات المعقدة من خلال التفكير في استجاباته قبل تقديم الإجابة. ويستخدم أساليب مثل التعلم بالتعزيز (حيث يتعلم النموذج من التغذية الراجعة) والاستحثاث بسلسلة الأفكار (نهج خطوة بخطوة لحل المشكلات).
من أبرز ميزاته نافذة السياق الضخمة، التي يمكنها استيعاب مليون رمز مميز (نحو مليون كلمة أو جزء من كلمة)، ومن المتوقع أن تتوسع إلى مليوني رمز. وهذا يعني أن النموذج يستطيع استيعاب قدر كبير من المعلومات دفعة واحدة، ما يؤدي إلى نتائج أكثر تفصيلًا ودقة.
إضافةً إلى معالجة اللغة، يمكن استخدام Gemini 2.5 في مهام الرؤية الحاسوبية التالية:
-
اكتشاف الكائنات: هو عملية تحديد الكائنات الموجودة داخل صورة وتحديد مواقعها. ويمكن استخدامه في تطبيقات مثل المراقبة أو السيارات ذاتية القيادة.
-
وصف الصور: تتضمن هذه المهمة إنشاء نص وصفي لصورة. وهي تجعل المحتوى المرئي أكثر سهولة في الوصول والفهم.
-
التعرّف البصري على الحروف: تحوّل هذه التقنية النص الموجود في الصور إلى نص قابل للتحرير والقراءة آليًا. وهي مفيدة لرقمنة المستندات وأتمتة إدخال البيانات.
قياس أداء Google Gemini 2.5 ومقارنته بالنماذج الأخرى#
تتوفر اليوم عدة نماذج متعددة الوسائط في مجال الذكاء الاصطناعي، لذا من المهم فهم كيفية مقارنة Gemini 2.5 Pro بها. واستنادًا إلى نتائج قياس الأداء التي شاركتها DeepMind التابعة لـ Google، يُظهر Gemini 2.5 Pro أداءً مذهلًا عبر مجموعة من المهام.
فعلى سبيل المثال، في اختبار يُسمى اختبار البشرية الأخير، يحاكي امتحانًا صعبًا يغطي العديد من المواد ويختبر الاستدلال المتقدم والمعرفة العامة، يحقق Gemini 2.5 Pro نحو 18.8%، متفوقًا على نماذج مثل o3-mini من OpenAI، الذي يحقق نحو 14%.

الشكل 2. نظرة عامة على أداء Gemini 2.5 Pro في قياس الأداء.
كما يحقق أداءً جيدًا جدًا في تحديات الرياضيات والبرمجة، وغالبًا ما يضاهي أداء نماذج مثل OpenAI GPT-4.5 وClaude 3.7 Sonnet وGrok 3 Beta وDeepSeek R1 أو يتفوق عليه، ما يبرهن على قدرته على التعامل مع المهام المعقدة ومعالجة كميات كبيرة من البيانات.
تعرّف عمليًا على Gemini 2.5: كيفية استخدام Google Gemini API#
يتوفر Gemini 2.5 Pro على منصات متعددة. ويمكنك تجربته في Google AI Studio والوصول إليه عبر تطبيق Gemini للمستخدمين المشتركين في Gemini Advanced. وفي إعلان الإطلاق، ذكرت Google DeepMind أيضًا أن النموذج سيُدعَم قريبًا على Vertex AI. وتسهّل نقاط الوصول هذه على المطورين استخدام Gemini 2.5 Pro في تطبيقات الذكاء الاصطناعي الواقعية.
ومع ذلك، إذا كنت ترغب في استخدام Google Gemini API والبدء خلال دقائق قليلة دون إعداد معقد، وتريد فهم إمكاناته في مجال الرؤية الحاسوبية بشكل أفضل، فيمكنك الاطلاع على دفتر ملاحظات Ultralytics الذي يعرض مهامًا مثل اكتشاف الكائنات ووصف الصور باستخدام Gemini 2.5 Pro. ولنستعرض بالتفصيل ما يمكنك توقعه في دفتر الملاحظات.
إعداد الاستدلال باستخدام دفتر ملاحظات Google Gemini 2.5#
للبدء باستخدام دفتر ملاحظات Ultralytics وGoogle Gemini 2.5، ستحتاج أولًا إلى إنشاء مفتاح API عبر Google AI Studio. يتيح لك هذا المفتاح الوصول إلى Gemini API حتى تتمكن من استخدام النموذج.
بعد حصولك على مفتاح API، تأكد من تثبيت المكتبات اللازمة في بيئتك، بما في ذلك الحزم من Ultralytics ومجموعة أدوات الذكاء الاصطناعي من Google. توضّح هذه الخطوة بوضوح في دفتر الملاحظات، لذا يمكنك اتباع التعليمات بسهولة لإعداد مساحة عملك.
بعد إعداد كل شيء، يمكنك الاتصال بـ Gemini API بإدخال مفتاح API الخاص بك (كما هو موضح أدناه)، ما ينشئ رابطًا بين مساحة عملك والنموذج. وبعد ذلك، ستكون مستعدًا لإرسال الصور والمطالبات النصية إلى Gemini 2.5.
باختصار، يمكنك تزويد النموذج بصورة وتعليمة بسيطة (مثل «اكتشف الكائنات في هذه الصورة» أو «صِف ما تراه»)، وسيعيد إليك النتائج التي تحتاجها. وتسهّل هذه العملية المباشرة بدء استكشاف إمكانات Gemini 2.5 في مجال الرؤية الحاسوبية.
اكتشاف الكائنات باستخدام Google Gemini 2.5#
من الأمثلة الأساسية في دفتر الملاحظات اكتشاف الكائنات باستخدام Gemini 2.5 Pro. في هذا المثال، تزوّد النموذج بصورة ومطالبة بسيطة لاكتشاف الكائنات.
يعالج النموذج الصورة ويعيد مجموعة من الإحداثيات والتسميات لكل كائن يعثر عليه؛ وتُعطى هذه الإحداثيات بصيغة مُطبّعة. ثم تُستخدم الدوال من حزمة Ultralytics Python لتحويل هذه القيم المُطبّعة بما يتوافق مع الأبعاد الفعلية للصورة ورسم مربعات إحاطة واضحة حول كل كائن، كما هو موضح أدناه.

الشكل 3. استخدام Google Gemini 2.5 لاكتشاف الكائنات.
وصف الصور باستخدام Gemini 2.5#
من الأمثلة الأخرى المثيرة للاهتمام في دفتر الملاحظات وصف الصور باستخدام Gemini 2.5 Pro. في هذا المثال، تزوّد النموذج بصورة ومطالبة تطلب منه إنشاء وصف مفصل لما يظهر في الصورة.
يحلل النموذج بعد ذلك المحتوى المرئي ويعيد سردًا، غالبًا ما يكون منسقًا في صورة جمل متعددة، يلتقط محتوى الصورة وسياقها معًا. وتفيد هذه الميزة في تحسين إمكانية الوصول، وتلخيص المعلومات المرئية، بل وتعزيز السرد الإبداعي.
تحسين دقة OCR باستخدام نماذج Google Gemini#
تتمثل إحدى مهام الرؤية الحاسوبية التي تستخدم قدرة Gemini 2.5 Pro على قراءة النصوص في الصور في OCR. وفي دفتر الملاحظات، يمكنك تزويد النموذج بصورة تحتوي على نص إلى جانب مطالبة لاستخراج ذلك النص. ويعالج النموذج الصورة ويعيد النص المكتشف والإحداثيات التي يوجد فيها النص، كما هو موضح أدناه.
ثم تُستخدم الدوال من حزمة Ultralytics Python لتحويل هذه الإحداثيات المُطبّعة إلى الأبعاد الفعلية للصورة ورسم مربعات إحاطة حول مناطق النص. ويوضح هذا الناتج المشروح مكان وجود النص، ما يفيد في رقمنة المستندات، وأتمتة إدخال البيانات، وتحسين إمكانية الوصول.

الشكل 4. استخراج البيانات النصية في صورة باستخدام Google Gemini 2.5.
تطبيقات Google Gemini 2.5 في العالم الحقيقي#
بعد أن استعرضنا كيفية استخدام Google Gemini 2.5 Pro في مهام مختلفة للرؤية الحاسوبية، لنستكشف بعض تطبيقات العالم الحقيقي التي يمكن استخدام هذه القدرات فيها.
يمكن لقدرة Gemini 2.5 Pro على اكتشاف الكائنات، على سبيل المثال، أن تساعد في وسم مجموعات كبيرة من الصور وتنظيمها تلقائيًا، ما يجعل مهامًا مثل إنشاء مجموعة بيانات أو إدارة المحتوى أسرع بكثير. كما يمكن استخدامه لتحليل الصور في مجالات مثل البيع بالتجزئة والزراعة، كاكتشاف المنتجات على الرفوف أو تحديد علامات إجهاد المحاصيل في صور المزارع.

الشكل 5. تحليل Gemini 2.5 Pro لصحة نبات.
في المقابل، يمكن لميزة وصف الصور في النموذج أن تساعد المستخدمين ضعاف البصر على فهم ما يوجد في الصورة. فعلى سبيل المثال، إذا كانت لديك صورة لشارع مزدحم، فقد ينشئ النموذج وصفًا يصف المشهد بالتفصيل، ويذكر أنواع المركبات ونشاط المشاة، بل وحتى وقت اليوم استنادًا إلى مؤشرات الإضاءة.
إضافةً إلى ذلك، يمكن استخدام وظيفة OCR في Gemini 2.5 في مجموعة متنوعة من التطبيقات. فعلى سبيل المثال، يمكنك رقمنة المستندات المطبوعة عبر مسح الصفحات أو الإيصالات ضوئيًا. وتُعد هذه القدرة مثالية لأتمتة مهام إدخال البيانات، ومعالجة النماذج، بل وقراءة النصوص من بطاقات الأعمال واللافتات.
بوجه عام، يفتح Google Gemini 2.5 Pro الباب أمام مجموعة واسعة من تطبيقات الذكاء الاصطناعي العملية.
أهم النقاط المستخلصة#
إضافةً إلى توليد النصوص وتحليلها، يمكن استخدام Google Gemini 2.5 Pro في مهام الرؤية الحاسوبية مثل اكتشاف الكائنات ووصف الصور وOCR. وبفضل نافذة السياق الضخمة وقدراته المحسّنة على الاستدلال، ينتج نتائج مفصلة وواعية بالسياق تعمل جيدًا في سيناريوهات العالم الحقيقي.
مع استمرار تطور نماذج الذكاء الاصطناعي، تسهّل أدوات مثل Gemini 2.5 Pro حل المشكلات المعقدة في مختلف القطاعات. ومن المرجح أن نشهد اعتمادًا أوسع للذكاء الاصطناعي مع بحث المزيد من المؤسسات عن حلول مرنة متعددة الوسائط قادرة على التعامل مع مجموعة واسعة من المهام، بدءًا من الفهم المرئي ووصولًا إلى معالجة اللغة.
كن جزءًا من مجتمعنا وتعرّف على أحدث مشاريع الذكاء الاصطناعي في مستودعنا على GitHub. اطّلع على تطبيقات الذكاء الاصطناعي المرئي في الزراعة ودور الذكاء الاصطناعي في التصنيع في صفحات حلولنا. واستكشف خطط الترخيص لدينا وابنِ حلولًا للرؤية الحاسوبية اليوم!









