YOLO Vision 2026:
الذكاء الاصطناعي المرئي

FastVLM: Apple تقدم نموذجها الجديد والسريع للرؤية واللغة

تكشف Apple عن FastVLM في مؤتمر CVPR 2025. يتميز هذا النموذج مفتوح المصدر للرؤية واللغة بمشفر FastViTHD، مما يوفر سرعة تصل إلى 85 ضعفاً في الوصول إلى الرمز الأول.

ABAbirami Vina4 min read
نموذج FastVLM السريع للرؤية واللغة من Apple

في مؤتمر CVPR 2025، قدمت Apple نموذج ذكاء اصطناعي جديد مفتوح المصدر يسمى FastVLM. تم تصميمه لفهم الصور واللغة على حد سواء، وهو يعمل على أجهزة Apple مثل أجهزة iPhone وiPad وMac. هذا يعني أنه يمكنه تقديم نتائج ذكية بسرعة، دون إرسال بياناتك إلى السحابة.

ما يجعل FastVLM مثيراً للاهتمام بشكل خاص هو سرعته وكفاءته. فقد طورت Apple مشفراً بصرياً جديداً يُسمى FastViTHD، والذي يساعد النموذج على تفسير الصور عالية الجودة مع استهلاك أقل للذاكرة والطاقة. تتم جميع عمليات المعالجة محلياً على الجهاز، مما يؤدي إلى استجابة أسرع مع الحفاظ على خصوصية المستخدم.

في هذه المقالة، سنستكشف آلية عمل FastVLM، وما يميزه، ولماذا يمكن أن يكون هذا الإصدار من Apple خطوة مهمة للأمام في تطبيقات الذكاء الاصطناعي اليومية على أجهزتك.

فهم نماذج الرؤية واللغة (VLMs)#

قبل أن نتعمق في ما يجعل FastVLM مميزًا، دعنا نستعرض ما يرمز إليه اختصار "VLM" في اسمه. إنه يشير إلى نموذج الرؤية واللغة، والذي تم تصميمه لفهم الربط بين المحتوى البصري واللغة.

تجمع نماذج VLM بين الفهم البصري واللغة، مما يمكنها من أداء مهام مثل وصف صورة، أو الإجابة على أسئلة حول لقطة شاشة، أو استخراج نصوص من مستند. تعمل نماذج الرؤية واللغة عادةً في جزأين: أحدهما يعالج الصورة ويحولها إلى بيانات، بينما يفسر الآخر تلك البيانات لإنتاج استجابة يمكنك قراءتها أو سماعها.

ربما تكون قد استخدمت هذا النوع من ابتكارات الذكاء الاصطناعي دون أن تدرك ذلك. التطبيقات التي تمسح الإيصالات ضوئياً، أو تقرأ بطاقات الهوية، أو تنشئ تسميات توضيحية للصور، أو تساعد الأشخاص ذوي الرؤية المحدودة على التفاعل مع شاشاتهم، تعتمد غالباً على نماذج الرؤية واللغة التي تعمل بهدوء في الخلفية.

ما هو FastVLM؟#

قامت Apple ببناء FastVLM لأداء نفس مهام نماذج الرؤية واللغة الأخرى، ولكن بسرعة أكبر وخصوصية أقوى وأداء محسّن على أجهزتها الخاصة. يمكنه فهم محتويات الصورة والرد بالنص، ولكن على عكس العديد من النماذج التي تعتمد على خوادم سحابية، يمكن لـ FastVLM العمل بالكامل على جهاز iPhone أو iPad أو Mac الخاص بك.

تعمل نماذج VLM بشكل عام بشكل أفضل مع الصور عالية الدقة. على سبيل المثال، كما هو موضح أدناه، لم يتمكن FastVLM من التعرف بشكل صحيح على لافتة الشارع كـ "ممنوع الدخول" إلا عند تزويده بنسخة عالية الدقة من الصورة. ومع ذلك، فإن المدخلات عالية الدقة عادةً ما تبطئ النماذج. وهنا يظهر دور FastViTHD في إحداث فرق.

أداء FastVLM على الصور ذات الدقة المنخفضة مقابل الدقة العالية

الشكل 1. أداء FastVLM على الصور ذات الدقة المنخفضة مقابل الدقة العالية. (المصدر)

يساعد مشفر الرؤية الجديد من Apple، FastViTHD، نموذج FastVLM على معالجة الصور عالية الجودة بكفاءة أكبر، مستهلكاً ذاكرة وطاقة أقل. وتحديداً، يتميز FastViTHD بخفة الوزن الكافية للعمل بسلاسة حتى على الأجهزة الصغيرة.

أيضاً، يتوفر FastVLM للجمهور على مستودع GitHub الخاص بـ FastVLM، حيث يمكن للمطورين الوصول إلى الكود المصدري، وإجراء تغييرات، واستخدامه في تطبيقاتهم الخاصة وفقاً لشروط ترخيص Apple.

مقارنة FastVLM بنماذج VLM الأخرى#

بالمقارنة مع نماذج الرؤية واللغة الأخرى، تم تحسين FastVLM ليعمل على الأجهزة اليومية مثل الهواتف الذكية وأجهزة الكمبيوتر المحمولة. في اختبارات الأداء، أنتج FastVLM كلمته الأولى أو مخرجاته بسرعة تصل إلى 85 ضعفاً مقارنة بنماذج مثل LLaVA-OneVision-0.5B.

مقارنة أداء FastVLM مع النماذج الأخرى

الشكل 2. مقارنة أداء FastVLM مع النماذج الأخرى. (المصدر)

إليك لمحة عن بعض المعايير القياسية التي تم تقييم FastVLM بناءً عليها:

  • DocVQA (الإجابة على الأسئلة المرئية للمستندات): يقيم هذا المعيار مدى قدرة النموذج على قراءة وفهم المعلومات النصية في المستندات، مثل النماذج أو الصفحات الممسوحة ضوئياً.
  • TextVQA (الإجابة على الأسئلة المرئية المستندة إلى نص): يقيم قدرة النموذج على تفسير الصور التي تحتوي على نص مضمن والإجابة على الأسئلة ذات الصلة بدقة.
  • GQA (الإجابة على الأسئلة المتعلقة بالرسوم البيانية): تختبر هذه المهمة مهارات الاستنتاج لدى النموذج من خلال مطالبته بفهم العلاقات بين الكائنات والمشاهد داخل الصورة.
  • MMMU (الفهم متعدد الوسائط لمواضيع متعددة): يقيس أداء النموذج عبر مجموعة واسعة من المواضيع والتنسيقات الأكاديمية، حيث يجمع بين الفهم البصري والنصي.
  • SeedBench (التقييم القياسي للبيانات المحسّنة للمقارنة المعيارية): يستكشف هذا المعيار القدرات العامة للنموذج في الفهم البصري والاستنتاج عبر مجالات متعددة.

عبر هذه المعايير، حقق FastVLM نتائج تنافسية مع استهلاك موارد أقل. إنه يجلب الذكاء الاصطناعي البصري العملي إلى الأجهزة اليومية مثل الهواتف والأجهزة اللوحية وأجهزة الكمبيوتر المحمولة.

مشفر الرؤية الفعال لـ FastVLM: FastViTHD#

بعد ذلك، دعونا نلقي نظرة فاحصة على FastViTHD، وهو مشفر الرؤية الذي يلعب دوراً حاسماً في أداء معالجة الصور في FastVLM.

تقوم معظم نماذج الرؤية واللغة بتقسيم الصورة إلى آلاف الرقع الصغيرة المسماة tokens. كلما زاد عدد هذه الرقع، زاد الوقت والطاقة التي يحتاجها النموذج لفهم الصورة. وهذا يمكن أن يجعل الأمور بطيئة، خاصة على الهواتف أو أجهزة الكمبيوتر المحمولة.

كيفية معالجة مشفر الرؤية للصورة

الشكل 3. كيفية معالجة مشفر الرؤية للصورة. (المصدر)

يتجنب FastViTHD البطء الناتج عن معالجة عدد كبير جدًا من الرموز المميزة باستخدام عدد أقل منها، مع الاستمرار في فهم الصورة بالكامل. وهو يجمع بين نهجين: محولات Transformer، التي تتميز بنمذجة الأنماط والعلاقات، والطبقات الالتفافية، التي تتسم بالكفاءة في معالجة البيانات البصرية. والنتيجة هي نظام يعمل بشكل أسرع ويستهلك ذاكرة أقل.

وفقًا لشركة Apple، فإن FastViTHD أصغر بنحوى 3.4 مرة من بعض مشفرات الرؤية التقليدية، مع الحفاظ على دقة عالية. وبدلاً من الاعتماد على تقنيات تحسين النماذج مثل تقليم الرموز المميزة (إزالة أجزاء الصورة الأقل أهمية تسريع المعالجة)، فإنه يحقق الكفاءة من خلال بنية أبسط وأكثر انسيابية.

متغيرات نموذج FastVLM وخط أنابيب التدريب#

أصدرت Apple نموذج FastVLM بثلاثة أحجام مختلفة: 0.5B و1.5B و7B بارامتر (حيث يرمز "B" إلى مليار، في إشارة إلى عدد الأوزان القابلة للتدريب في النموذج). تم تصميم كل إصدار ليتناسب مع أنواع مختلفة من الأجهزة. يمكن للنماذج الأصغر العمل على الهواتف والأجهزة اللوحية، بينما يعتبر نموذج 7B الأكبر أكثر ملاءمة لأجهزة الكمبيوتر المكتبية أو المهام الأكثر تطلباً.

وهذا يمنح المطورين المرونة لاختيار ما يناسب تطبيقاتهم. يمكنهم بناء شيء سريع وخفيف للجوال أو شيء أكثر تعقيداً للأنظمة الأكبر، كل ذلك مع استخدام بنية النموذج الأساسية نفسها.

قامت Apple بتدريب متغيرات نموذج FastVLM باستخدام خط أنابيب LLaVA-1.5، وهو إطار عمل لمواءمة نماذج الرؤية واللغة. بالنسبة لمكون اللغة، قاموا بتقييم FastVLM باستخدام نماذج مفتوحة المصدر موجودة مثل Qwen وVicuna، والمعروفة بتوليد نصوص طبيعية ومتماسكة. يتيح هذا الإعداد لـ FastVLM معالجة الصور البسيطة والمعقدة وإنتاج ردود قابلة للقراءة وذات صلة.

أهمية FastVLM: نهج Apple الفعال في الذكاء الاصطناعي#

قد تتساءل، لماذا تعتبر معالجة الصور الفعالة لـ FastVLM أمراً مهماً؟ يعود الأمر إلى مدى سلاسة عمل التطبيقات في الوقت الفعلي دون الاعتماد على السحابة. يمكن لـ FastVLM التعامل مع الصور عالية الدقة، التي تصل إلى 1152 في 1152 بكسل، مع البقاء سريعاً وخفيفاً بما يكفي للعمل مباشرة على جهازك.

هذا يعني أن التطبيقات يمكنها وصف ما تراه الكاميرا، أو مسح الإيصالات ضوئيًا فور التقاطها، أو الاستجابة للتغيرات على الشاشة، وكل ذلك مع الحفاظ على كل شيء محليًا. إنه مفيد بشكل خاص لمجالات مثل التعليم، وإمكانية الوصول، والإنتاجية، والتصوير الفوتوغرافي.

نظراً لأن FastViTHD فعال حتى مع الصور الكبيرة، فهو يساعد في الحفاظ على استجابة الأجهزة وبرودتها. إنه يعمل مع جميع أحجام النماذج، بما في ذلك أصغرها، والذي يعمل على هواتف iPhone الأساسية. وهذا يعني أن ميزات الذكاء الاصطناعي نفسها يمكن أن تعمل عبر الهواتف والأجهزة اللوحية وأجهزة Mac.

تطبيقات FastVLM#

يمكن لـ FastVLM تشغيل مجموعة واسعة من التطبيقات، بفضل مزاياه الرئيسية مثل السرعة والكفاءة وخصوصية الجهاز. إليك بعض الطرق التي يمكن استخدامه بها:

  • قراءة المستندات: يمكنه مسح الإيصالات أو النماذج أو بطاقات الهوية ضوئيًا واستخراج المعلومات ذات الصلة فقط. يمكنه التركيز على مناطق محددة في الصورة، وهو أمر مفيد للتطبيقات التي تحتاج إلى استخراج نص بسرعة ودقة.

  • تسميات الصور التوضيحية: من خلال تحليل صورة، يمكنه إنشاء وصف واضح لما يوجد في الصورة. يدعم هذا ميزات في تطبيقات الكاميرا، أو معارض الصور، أو أي أداة تستفيد من الفهم البصري في الوقت الفعلي.

  • دعم إمكانية الوصول: يمكن لـ FastVLM وصف المحتوى الذي يظهر على الشاشة للمستخدمين المكفوفين أو ضعاف البصر، مما يجعل الأزرار والقوائم وعناصر التخطيط أسهل في التنقل والاستخدام.

  • مساعدو الذكاء الاصطناعي على الجهاز: يمكن لـ FastVLM العمل بشكل جيد مع مساعدي الذكاء الاصطناعي الذين يحتاجون إلى فهم ما يظهر على الشاشة بسرعة. ونظراً لأنه يعمل مباشرة على الجهاز ويحافظ على خصوصية البيانات، فيمكنه المساعدة في مهام مثل قراءة النصوص، وتحديد الأزرار أو الأيقونات، وتوجيه المستخدمين في الوقت الفعلي دون الحاجة إلى إرسال معلومات إلى السحابة.

يمكن استخدام FastVLM للتعرف على النصوص والإجابة على الأسئلة المرئية

الشكل 4. يمكن استخدام FastVLM للتعرف على النصوص والإجابة على الأسئلة المرئية. (المصدر)

أبرز النقاط#

يجلب FastVLM ذكاء الرؤية واللغة إلى أجهزة Apple، جامعاً بين السرعة والخصوصية والكفاءة. وبفضل تصميمه خفيف الوزن وإصداره مفتوح المصدر، فإنه يتيح فهم الصور في الوقت الفعلي عبر تطبيقات الجوال والكمبيوتر المكتبي.

يساعد هذا في جعل الذكاء الاصطناعي أكثر عملية وسهولة في الاستخدام اليومي، ويمنح المطورين أساساً قوياً لبناء تطبيقات مفيدة تركز على الخصوصية. بالنظر إلى المستقبل، من المرجح أن تلعب نماذج الرؤية واللغة دوراً مهماً في كيفية تفاعلنا مع التكنولوجيا، مما يجعل الذكاء الاصطناعي أكثر استجابة ووعياً بالسياق ومفيداً في المواقف اليومية.

استكشف مستودع GitHub الخاص بنا لمعرفة المزيد حول الذكاء الاصطناعي. انضم إلى مجتمعنا النشط واكتشف الابتكارات في قطاعات مثل الذكاء الاصطناعي في صناعة السيارات والرؤية بالذكاء الاصطناعي في التصنيع. للبدء في رؤية الكمبيوتر اليوم، راجع خيارات الترخيص الخاصة بنا.

Explore solutions

Real-time AI that works with your team

الذكاء الاصطناعي في الروبوتات

شغّل آلات أكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدفع الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية، والإدراك، وتتبع الكائنات، والتحكم في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. تُمكّن الرؤية بالذكاء الاصطناعي فحص الطرود، والفرز، وتتبع المركبات، ومراقبة السلامة في المستودعات في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التجزئة

أعد تصور تجارة التجزئة مع نماذج Ultralytics YOLO. تعزز الرؤية بالذكاء الاصطناعي تتبع المخزون، ومراقبة الأرفف، وإدارة الطوابير، ورؤى أكثر ذكاءً للعملاء.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الرعاية الصحية

قم ببناء حلول الرعاية الصحية مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري في الرعاية الصحية على تعزيز سرعة التصوير الطبي، والتشخيص الأكثر ذكاءً، ومراقبة المرضى.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التصنيع

حسّن عمليات التصنيع باستخدام نماذج Ultralytics YOLO. تقود الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لمعدات الوقاية الشخصية (PPE)، وأتمتة خطوط التجميع.
اعرف المزيد
Real-time AI that works with your operation

الذكاء الاصطناعي في مجال السيارات

طبق رؤية الحاسوب في مجال السيارات مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري على تعزيز السلامة على الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
اعرف المزيد
Real-time AI tailored to your operation

الذكاء الاصطناعي في الزراعة

ادمج الذكاء الاصطناعي البصري في الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة للحصول على إنتاجية أعلى وأكثر ذكاءً.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الروبوتات

شغّل آلات أكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدفع الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية، والإدراك، وتتبع الكائنات، والتحكم في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. تُمكّن الرؤية بالذكاء الاصطناعي فحص الطرود، والفرز، وتتبع المركبات، ومراقبة السلامة في المستودعات في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التجزئة

أعد تصور تجارة التجزئة مع نماذج Ultralytics YOLO. تعزز الرؤية بالذكاء الاصطناعي تتبع المخزون، ومراقبة الأرفف، وإدارة الطوابير، ورؤى أكثر ذكاءً للعملاء.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الرعاية الصحية

قم ببناء حلول الرعاية الصحية مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري في الرعاية الصحية على تعزيز سرعة التصوير الطبي، والتشخيص الأكثر ذكاءً، ومراقبة المرضى.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التصنيع

حسّن عمليات التصنيع باستخدام نماذج Ultralytics YOLO. تقود الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لمعدات الوقاية الشخصية (PPE)، وأتمتة خطوط التجميع.
اعرف المزيد
Real-time AI that works with your operation

الذكاء الاصطناعي في مجال السيارات

طبق رؤية الحاسوب في مجال السيارات مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري على تعزيز السلامة على الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
اعرف المزيد
Real-time AI tailored to your operation

الذكاء الاصطناعي في الزراعة

ادمج الذكاء الاصطناعي البصري في الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة للحصول على إنتاجية أعلى وأكثر ذكاءً.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الروبوتات

شغّل آلات أكثر ذكاءً باستخدام نماذج Ultralytics YOLO. يدفع الذكاء الاصطناعي للرؤية في الروبوتات الملاحة الذاتية، والإدراك، وتتبع الكائنات، والتحكم في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الخدمات اللوجستية

بسّط العمليات اللوجستية باستخدام نماذج Ultralytics YOLO. تُمكّن الرؤية بالذكاء الاصطناعي فحص الطرود، والفرز، وتتبع المركبات، ومراقبة السلامة في المستودعات في الوقت الفعلي.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التجزئة

أعد تصور تجارة التجزئة مع نماذج Ultralytics YOLO. تعزز الرؤية بالذكاء الاصطناعي تتبع المخزون، ومراقبة الأرفف، وإدارة الطوابير، ورؤى أكثر ذكاءً للعملاء.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في الرعاية الصحية

قم ببناء حلول الرعاية الصحية مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري في الرعاية الصحية على تعزيز سرعة التصوير الطبي، والتشخيص الأكثر ذكاءً، ومراقبة المرضى.
اعرف المزيد
Real-time AI that works with your team

الذكاء الاصطناعي في التصنيع

حسّن عمليات التصنيع باستخدام نماذج Ultralytics YOLO. تقود الرؤية بالذكاء الاصطناعي مراقبة الجودة، واكتشاف العيوب، والامتثال لمعدات الوقاية الشخصية (PPE)، وأتمتة خطوط التجميع.
اعرف المزيد
Real-time AI that works with your operation

الذكاء الاصطناعي في مجال السيارات

طبق رؤية الحاسوب في مجال السيارات مع نماذج Ultralytics YOLO. يعمل الذكاء الاصطناعي البصري على تعزيز السلامة على الطرق، ومساعدة السائق، وأتمتة المركبات من أجل طرق أكثر ذكاءً.
اعرف المزيد
Real-time AI tailored to your operation

الذكاء الاصطناعي في الزراعة

ادمج الذكاء الاصطناعي البصري في الزراعة الذكية باستخدام نماذج Ultralytics YOLO. عزز مراقبة المحاصيل، وتتبع الماشية، والزراعة الدقيقة للحصول على إنتاجية أعلى وأكثر ذكاءً.
اعرف المزيد

لنبنِ مستقبل الذكاء الاصطناعي معاً!

ابدأ رحلتك مع مستقبل تعلم الآلة