YOLO Vision 2026:
الذكاء الاصطناعي المرئي

ابدأ تجربة عملية مع Google Gemini 2.5 لمهام الرؤية الحاسوبية

تعرف على كيفية البدء العملي مع Google Gemini 2.5 لمهام الرؤية الحاسوبية مثل اكتشاف الأشياء، والتعليق على الصور، والتعرف الضوئي على الحروف (OCR) لحلول الرؤية الحاسوبية القائمة على الذكاء الاصطناعي.

ABAbirami Vina5 min read
استخدام Google Gemini 2.5 لمهام الرؤية الحاسوبية

تتقدم تطورات الذكاء الاصطناعي بخطى سريعة، حيث تتصدر الابتكارات الجديدة عناوين الأخبار تقريبًا كل يوم. أحد هذه الإنجازات الحديثة هو Gemini 2.5، أحدث نموذج متعدد الوسائط من Google DeepMind، والذي تم إطلاقه في 26 مارس. وفي الوقت الذي تستطيع فيه نماذج اللغات الكبيرة (LLMs) التقليدية التعلم من كميات هائلة من البيانات لتوليد نصوص تشبه النصوص البشرية، فإن Gemini 2.5 يتجاوز ذلك.

تم تصميمه كـ "نموذج تفكير" يمكنه معالجة الصور والصوت والفيديو. وهو يتمتع بمهارات محسنة في الاستدلال والبرمجة. ومن المثير للاهتمام أنه يؤدي أيضًا بشكل استثنائي فيما يتعلق بـ مهام الرؤية الحاسوبية، حيث تقوم الآلات بتفسير وتحليل البيانات المرئية، مثل كشف الكائنات، وتسمية الصور، والتعرف الضوئي على الحروف (OCR).

Using Gemini 2.5 to understand the contents of an image

الشكل 1. مثال على استخدام Gemini 2.5 لفهم محتويات صورة.

في هذه المقالة، سنستعرض أحد دفاتر الملاحظات الخاصة بـ Ultralytics والذي يمكن أن يساعدك في التعرف بشكل عملي على إمكانيات الرؤية الحاسوبية لـ Gemini 2.5. سنلقي نظرة أقرب أيضًا على الميزات الرئيسية لـ Gemini 2.5 ونعرض كيف يمكن استخدامه لبناء حلول الرؤية الحاسوبية للتطبيقات الواقعية. لنبدأ!

نظرة عامة على Gemini 2.5: الميزات والقدرات#

الإصدار الأول في سلسلة نماذج Gemini 2.5 الذي تم إصداره للتو هو إصدار تجريبي من Gemini 2.5 Pro. وهو مصمم للتعامل مع المشكلات المعقدة من خلال التفكير في استجاباته قبل تقديم الإجابة. وهو يستخدم طرقًا مثل التعلم التعزيزي (حيث يتعلم النموذج من التغذية الراجعة) وسلسلة الأفكار (نهج خطوة بخطوة لحل المشكلات).

إحدى ميزاته الرئيسية هي نافذة السياق الضخمة الخاصة به، والتي يمكنها استيعاب مليون رمز (حوالي مليون كلمة أو أجزاء من كلمات) ومن المتوقع أن تنمو لتصل إلى مليوني رمز. وهذا يعني أن النموذج يمكنه استيعاب الكثير من المعلومات في وقت واحد، مما يؤدي إلى نتائج أكثر تفصيلاً ودقة.

بالإضافة إلى معالجة اللغة، يمكن استخدام Gemini 2.5 لمهام رؤية الحاسوب التالية:

  • كشف الكائنات: هو عملية تحديد وتتبع الكائنات داخل الصورة. ويمكن استخدامه في تطبيقات مثل المراقبة أو السيارات ذاتية القيادة.

  • وصف الصور: تتضمن هذه المهمة إنشاء نص وصفي لصورة. وهي تجعل المحتوى المرئي أكثر سهولة في الوصول إليه وأسهل في الفهم.

  • التعرف الضوئي على الحروف: تحول هذه التقنية النصوص الموجودة في الصور إلى نص قابل للتعديل والقراءة الآلية. وهي مفيدة لرقمنة المستندات وأتمتة إدخال البيانات.

قياس أداء ومقارنة Google Gemini 2.5 مع النماذج الأخرى#

هناك العديد من النماذج متعددة الوسائط المتاحة في مجال الذكاء الاصطناعي اليوم، لذا من المهم فهم كيفية مقارنة Gemini 2.5 Pro بها. بناءً على نتائج قياس الأداء التي شاركتها Google DeepMind، يُظهر Gemini 2.5 Pro أداءً مذهلاً عبر مجموعة من المهام.

على سبيل المثال، في اختبار يسمى "امتحان الإنسانية الأخير" (Humanity’s Last Exam)، الذي يحاكي اختبارًا صعبًا يغطي العديد من الموضوعات ويختبر الاستدلال المتقدم والمعرفة العامة، حصل Gemini 2.5 Pro على حوالي 18.8%، متفوقًا على نماذج مثل o3-mini من OpenAI، والتي حصلت على حوالي 14%.

An overview of Gemini 2.5 Pro's benchmark performance

Fig 2. نظرة عامة على أداء المعايير لـ Gemini 2.5 Pro.

وهو يؤدي أيضًا بشكل جيد للغاية في تحديات الرياضيات والبرمجة، وغالبًا ما يطابق أو يتجاوز أداء نماذج مثل OpenAI GPT-4.5، وClaude 3.7 Sonnet، وGrok 3 Beta، وDeepSeek R1، مما يوضح قدرته على التعامل مع المهام المعقدة ومعالجة كميات كبيرة من البيانات.

البدء العملي مع Gemini 2.5: كيفية استخدام Google Gemini API#

يتوفر Gemini 2.5 Pro على منصات متعددة. يمكنك تجربته في Google AI Studio والوصول إليه عبر تطبيق Gemini لمستخدمي Gemini Advanced. في إعلان إطلاقه، ذكرت Google DeepMind أيضًا أن النموذج سيتم دعمه على Vertex AI قريبًا. تجعل نقاط الوصول هذه من السهل على المطورين استخدام Gemini 2.5 Pro لتطبيقات الذكاء الاصطناعي الواقعية.

وممع ذلك، إذا كنت ترغب في استخدام Google Gemini API والبدء في غضون بضع دقائق فقط دون إعداد معقد وتتطلع إلى اكتساب فهم أفضل لإمكانيات الرؤية الحاسوبية الخاصة به، يمكنك الاطلاع على دفتر ملاحظات Ultralytics الذي يعرض مهام مثل كشف الكائنات وتسمية الصور باستخدام Gemini 2.5 Pro. دعنا نستعرض بالتفصيل ما يمكنك توقعه في دفتر الملاحظات.

إعداد الاستدلال (Inferencing) باستخدام دفتر ملاحظات Google Gemini 2.5#

للبدء باستخدام دفتر ملاحظات Ultralytics واستخدام Google Gemini 2.5، ستحتاج أولاً إلى إنشاء مفتاح API من خلال Google AI Studio. يمنحك هذا المفتاح إمكانية الوصول إلى Gemini API حتى تتمكن من استخدام النموذج.

بمجرد حصولك على مفتاح API، تأكد من تثبيت المكتبات اللازمة في بيئتك - وتتضمن هذه الحزم من Ultralytics ومجموعة أدوات الذكاء الاصطناعي من Google. يتم توضيح هذه الخطوة بوضوح في دفتر الملاحظات، حتى تتمكن من اتباع التعليمات بسهولة لإعداد مساحة العمل الخاصة بك.

مع تهيئة كل شيء، يمكنك الاتصال بـ Gemini API عن طريق إدخال مفتاح API الخاص بك (كما هو موضح أدناه)، مما ينشئ رابطًا بين مساحة العمل الخاصة بك والنموذج. بعد ذلك، ستكون جاهزًا لإرسال الصور والمطالبات النصية إلى Gemini 2.5.

بشكل أساسي، يمكنك تقديم صورة وتعليمات بسيطة (مثل "اكتشف الأشياء في هذه الصورة" أو "صف ما تراه") للنموذج، وسيعيد النتائج التي تحتاجها. تجعل هذه العملية المباشرة من السهل البدء في استكشاف قدرات رؤية الحاسوب في Gemini 2.5.

اكتشاف الأشياء باستخدام Google Gemini 2.5#

أحد الأمثلة الرئيسية في دفتر الملاحظات هو اكتشاف الأشياء باستخدام Gemini 2.5 Pro. في هذا المثال، تقدم للنموذج صورة ومطالبة بسيطة لاكتشاف الأشياء.

يقوم النموذج بمعالجة الصورة وإرجاع مجموعة من الإحداثيات والتسميات لكل كائن يجد؛ وتُعطى هذه الإحداثيات في شكل مُطَبَّع (normalized). تُستخدم بعد ذلك الدوال الوظيفية من حزمة بايثون من Ultralytics لتحويل هذه القيم المُطَبَّعَة لتتناسب مع الأبعاد الفعلية للصورة ورسم مربعات احاطة واضحة حول كل كائن، كما هو موضح أدناه.

Using Google Gemini 2.5 for object detection

الشكل 3. استخدام Google Gemini 2.5 لاكتشاف الأشياء.

وصف الصور باستخدام Gemini 2.5#

مثال آخر مثير للاهتمام في دفتر الملاحظات هو تسمية الصور باستخدام Gemini 2.5 Pro. في هذا المثال، تزود النموذج بصورة وموجه (prompt) يطلب منه توليد تعليق تفصيلي يصف ما هو موجود في الصورة.

ثم يقوم النموذج بتحليل المحتوى المرئي وإرجاع سرد، غالبًا ما يتم تنسيقه كجمل متعددة، يلتقط كلاً من المحتوى وسياق الصورة. هذه الميزة مفيدة لتحسين الوصول، وتلخيص المعلومات المرئية، وحتى تعزيز السرد القصصي الإبداعي.

تعزيز دقة OCR باستخدام نماذج Google Gemini#

مهمة رؤية الحاسوب التي تستخدم قدرة Gemini 2.5 Pro على قراءة النص في الصور هي OCR. في دفتر الملاحظات، يمكنك تزويد النموذج بصورة تحتوي على نص مع مطالبة لاستخراج ذلك النص. يعالج النموذج الصورة ويعيد كلاً من النص المكتشف والإحداثيات التي يقع فيها النص، كما هو موضح أدناه.

تُستخدم بعد ذلك الدوال الوظيفية من حزمة بايثون من Ultralytics لتحويل هذه الإحداثيات المُطَبَّعَة إلى الأبعاد الفعلية للصورة ورسم مربعات احاطة حول مناطق النص. يجعل هذا الناتج المشروح المكان الذي يوجد فيه النص واضحًا، وهو أمر مفيد لرقمنة المستندات، وأتمتة إدخال البيانات، وتحسين إمكانية الوصول.

Extracting textual data in an image using Google Gemini 2.5

الشكل 4. استخراج البيانات النصية في صورة باستخدام Google Gemini 2.5.

التطبيقات الواقعية لـ Google Gemini 2.5#

الآن بعد أن استعرضنا كيفية استخدام Google Gemini 2.5 Pro لمهام رؤية الحاسوب المختلفة، دعنا نستكشف بعض التطبيقات الواقعية حيث يمكن استخدام هذه القدرات.

تستطيع قدرة كشف الكائنات في Gemini 2.5 Pro، على سبيل المثال، المساعدة في تسمية وتنظيم مجموعات كبيرة من الصور تلقائيًا، مما يجعل مهام مثل إنشاء مجموعات البيانات أو إدارة المحتوى أسرع بكثير. ويمكن استخدامها أيضًا لتحليل الصور في مجالات مثل التجارة بالتجزئة والزراعة - على سبيل المثال، كشف المنتجات على الرفوف أو تحديد علامات إجهاد المحاصيل في صور المزارع.

Gemini 2.5 Pro analyzing a plant's health

الشكل 5. Gemini 2.5 Pro يحلل صحة نبات.

في الوقت نفسه، يمكن لميزة وصف الصور في النموذج أن تساعد المستخدمين ضعاف البصر على فهم ما هو موجود في الصورة. على سبيل المثال، إذا كان لديك صورة لشارع مزدحم، فقد ينتج النموذج وصفًا يصف المشهد بالتفصيل، مع ذكر أنواع المركبات، ونشاط المشاة، وحتى وقت اليوم بناءً على إشارات الإضاءة.

بالإضافة إلى ذلك، يمكن استخدام وظيفة OCR في Gemini 2.5 في مجموعة متنوعة من التطبيقات. على سبيل المثال، يمكنك رقمنة المستندات المطبوعة عن طريق مسح الصفحات أو الإيصالات ضوئيًا. هذه القدرة مثالية لأتمتة مهام إدخال البيانات، أو معالجة النماذج، أو حتى قراءة النصوص من بطاقات العمل واللافتات.

بشكل عام، يفتح Google Gemini 2.5 Pro الأبواب أمام مجموعة واسعة من تطبيقات الذكاء الاصطناعي العملية.

أبرز النقاط#

بالتجاوز عن مجرد إنشاء وتحليل النصوص، يمكن استخدام Google Gemini 2.5 Pro لمهام رؤية الحاسوب مثل اكتشاف الأشياء، ووصف الصور، وOCR. بفضل نافذة السياق الهائلة وقدرات الاستدلال المحسنة، فإنه ينتج نتائج مفصلة وواعية بالسياق تعمل بشكل جيد في سيناريوهات العالم الحقيقي.

مع استمرار تطور نماذج الذكاء الاصطناعي، تجعل أدوات مثل Gemini 2.5 Pro من الأسهل حل المشكلات المعقدة عبر الصناعات. من المحتمل أن نرى اعتمادًا أوسع للذكاء الاصطناعي مع بحث المزيد من المؤسسات عن حلول مرنة ومتعددة الوسائط يمكنها التعامل مع مجموعة واسعة من المهام، من الفهم المرئي إلى معالجة اللغة.

كن جزءًا من مجتمعنا وتعرف على مشاريع الذكاء الاصطناعي المتطورة على مستودع GitHub الخاص بنا. اطلع على تطبيقات رؤية الذكاء الاصطناعي في الزراعة ودور الذكاء الاصطناعي في التصنيع على صفحات الحلول الخاصة بنا. استكشف خطط الترخيص الخاصة بنا وابنِ حلول الرؤية الحاسوبية اليوم!

Explore solutions

Real-time AI that works with your team

الذكاء الاصطناعي في الروبوتات

شغّل آلات أكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدفع الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية، والإدراك، وتتبع الكائنات، والتحكم في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. تُمكّن الرؤية بالذكاء الاصطناعي فحص الطرود، والفرز، وتتبع المركبات، ومراقبة السلامة في المستودعات في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التجزئة

أعد تصور تجارة التجزئة مع نماذج Ultralytics YOLO. تعزز الرؤية بالذكاء الاصطناعي تتبع المخزون، ومراقبة الأرفف، وإدارة الطوابير، ورؤى أكثر ذكاءً للعملاء.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الرعاية الصحية

قم ببناء حلول الرعاية الصحية مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري في الرعاية الصحية على تعزيز سرعة التصوير الطبي، والتشخيص الأكثر ذكاءً، ومراقبة المرضى.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التصنيع

حسّن عمليات التصنيع باستخدام نماذج Ultralytics YOLO. تقود الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لمعدات الوقاية الشخصية (PPE)، وأتمتة خطوط التجميع.
اعرف المزيد
Real-time AI that works with your operation

الذكاء الاصطناعي في مجال السيارات

طبق رؤية الحاسوب في مجال السيارات مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري على تعزيز السلامة على الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
اعرف المزيد
Real-time AI tailored to your operation

الذكاء الاصطناعي في الزراعة

ادمج الذكاء الاصطناعي البصري في الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة للحصول على إنتاجية أعلى وأكثر ذكاءً.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الروبوتات

شغّل آلات أكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدفع الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية، والإدراك، وتتبع الكائنات، والتحكم في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. تُمكّن الرؤية بالذكاء الاصطناعي فحص الطرود، والفرز، وتتبع المركبات، ومراقبة السلامة في المستودعات في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التجزئة

أعد تصور تجارة التجزئة مع نماذج Ultralytics YOLO. تعزز الرؤية بالذكاء الاصطناعي تتبع المخزون، ومراقبة الأرفف، وإدارة الطوابير، ورؤى أكثر ذكاءً للعملاء.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الرعاية الصحية

قم ببناء حلول الرعاية الصحية مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري في الرعاية الصحية على تعزيز سرعة التصوير الطبي، والتشخيص الأكثر ذكاءً، ومراقبة المرضى.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التصنيع

حسّن عمليات التصنيع باستخدام نماذج Ultralytics YOLO. تقود الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لمعدات الوقاية الشخصية (PPE)، وأتمتة خطوط التجميع.
اعرف المزيد
Real-time AI that works with your operation

الذكاء الاصطناعي في مجال السيارات

طبق رؤية الحاسوب في مجال السيارات مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري على تعزيز السلامة على الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
اعرف المزيد
Real-time AI tailored to your operation

الذكاء الاصطناعي في الزراعة

ادمج الذكاء الاصطناعي البصري في الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة للحصول على إنتاجية أعلى وأكثر ذكاءً.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الروبوتات

شغّل آلات أكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدفع الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية، والإدراك، وتتبع الكائنات، والتحكم في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. تُمكّن الرؤية بالذكاء الاصطناعي فحص الطرود، والفرز، وتتبع المركبات، ومراقبة السلامة في المستودعات في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التجزئة

أعد تصور تجارة التجزئة مع نماذج Ultralytics YOLO. تعزز الرؤية بالذكاء الاصطناعي تتبع المخزون، ومراقبة الأرفف، وإدارة الطوابير، ورؤى أكثر ذكاءً للعملاء.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الرعاية الصحية

قم ببناء حلول الرعاية الصحية مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري في الرعاية الصحية على تعزيز سرعة التصوير الطبي، والتشخيص الأكثر ذكاءً، ومراقبة المرضى.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التصنيع

حسّن عمليات التصنيع باستخدام نماذج Ultralytics YOLO. تقود الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لمعدات الوقاية الشخصية (PPE)، وأتمتة خطوط التجميع.
اعرف المزيد
Real-time AI that works with your operation

الذكاء الاصطناعي في مجال السيارات

طبق رؤية الحاسوب في مجال السيارات مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري على تعزيز السلامة على الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
اعرف المزيد
Real-time AI tailored to your operation

الذكاء الاصطناعي في الزراعة

ادمج الذكاء الاصطناعي البصري في الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة للحصول على إنتاجية أعلى وأكثر ذكاءً.
اعرف المزيد

لنبنِ مستقبل الذكاء الاصطناعي معاً!

ابدأ رحلتك مع مستقبل تعلم الآلة