FastVLM: تقدم Apple نموذجها الجديد السريع للرؤية واللغة
تكشف Apple عن FastVLM في CVPR 2025. ويتميز نموذج الرؤية واللغة مفتوح المصدر هذا ببرنامج ترميز FastViTHD، إذ يوفّر سرعة أعلى بما يصل إلى 85 مرة في الوصول إلى الرمز الأول.

في مؤتمر CVPR 2025، قدّمت Apple نموذجًا جديدًا مفتوح المصدر للذكاء الاصطناعي يُسمّى FastVLM. وقد صُمّم لفهم الصور واللغة معًا، ويعمل على أجهزة Apple مثل iPhones وiPads وأجهزة Mac. وهذا يعني أنه يستطيع تقديم نتائج ذكية بسرعة، من دون إرسال بياناتك إلى السحابة.
ما يجعل FastVLM مثيرًا للاهتمام بوجه خاص هو سرعته وكفاءته. طوّرت Apple مشفّرًا بصريًا جديدًا يُسمّى FastViTHD، يساعد النموذج على تفسير الصور عالية الجودة مع استخدام قدر أقل من الذاكرة والطاقة. وتتم جميع عمليات المعالجة محليًا على الجهاز، ما يؤدي إلى أوقات استجابة أسرع مع الحفاظ على خصوصية المستخدم.
في هذه المقالة، سنستكشف كيفية عمل FastVLM، وما الذي يميّزه، ولماذا قد يمثّل هذا الإصدار من Apple خطوة مهمة إلى الأمام لتطبيقات الذكاء الاصطناعي اليومية على أجهزتك.
فهم نماذج اللغة والرؤية (VLMs)#
قبل أن نتعمق في ما يجعل FastVLM مميزًا، دعونا نوضّح المقصود بـ “VLM” في اسمه. فهو يشير إلى نموذج اللغة والرؤية، المصمّم لفهم المحتوى المرئي وربطه باللغة.
تجمع نماذج اللغة والرؤية بين الفهم المرئي واللغة، ما يمكّنها من تنفيذ مهام مثل وصف صورة، أو الإجابة عن أسئلة حول لقطة شاشة، أو استخراج نص من مستند. وتعمل نماذج اللغة والرؤية عادةً على مرحلتين: تعالج إحداهما الصورة وتحولها إلى بيانات، بينما تفسّر الأخرى تلك البيانات لإنشاء استجابة يمكنك قراءتها أو سماعها.
ربما سبق لك استخدام هذا النوع من ابتكارات الذكاء الاصطناعي من دون أن تدرك ذلك. فالتطبيقات التي تمسح الإيصالات، أو تقرأ بطاقات الهوية، أو تنشئ أوصافًا للصور، أو تساعد ضعاف البصر على التفاعل مع شاشاتهم، غالبًا ما تعتمد على نماذج لغة ورؤية تعمل بهدوء في الخلفية.
ما هو FastVLM؟#
طوّرت Apple نموذج FastVLM لتنفيذ المهام نفسها التي تنفذها نماذج اللغة والرؤية الأخرى، ولكن بسرعة أكبر وخصوصية أعلى وأداء محسّن على أجهزتها. ويمكنه فهم محتويات الصورة والردّ بنص، لكن بخلاف العديد من النماذج التي تعتمد على خوادم سحابية، يستطيع FastVLM العمل بالكامل على iPhone أو iPad أو Mac.
تؤدي نماذج اللغة والرؤية أداءً أفضل عمومًا مع الصور عالية الدقة. فعلى سبيل المثال، كما هو موضح أدناه، لم يتمكن FastVLM من تحديد إشارة شارع “ممنوع الدخول” بشكل صحيح إلا عند تزويده بنسخة عالية الدقة من الصورة. إلا أن المدخلات عالية الدقة تؤدي عادةً إلى إبطاء النماذج. وهنا يأتي دور FastViTHD.

الشكل 1. أداء FastVLM مع الصور منخفضة الدقة مقابل عالية الدقة. (المصدر)
يساعد مشفّر الرؤية الجديد من Apple، FastViTHD، FastVLM على معالجة الصور عالية الجودة بكفاءة أكبر، مع استخدام قدر أقل من الذاكرة والطاقة. وعلى وجه التحديد، يتميز FastViTHD بخفة كافية ليعمل بسلاسة حتى على الأجهزة الأصغر.
يتوفر FastVLM أيضًا للعامة في مستودع FastVLM على GitHub، حيث يستطيع المطورون الوصول إلى الشيفرة المصدرية وإجراء التعديلات واستخدامه في تطبيقاتهم الخاصة وفقًا لشروط ترخيص Apple.
مقارنة FastVLM بنماذج اللغة والرؤية الأخرى#
مقارنةً بنماذج اللغة والرؤية الأخرى، تم تحسين FastVLM للعمل على الأجهزة اليومية مثل الهواتف الذكية وأجهزة الكمبيوتر المحمولة. وفي اختبارات الأداء، أنشأ FastVLM أول كلمة أو مخرج بسرعة تصل إلى 85 ضعفًا مقارنةً بنماذج مثل LLaVA-OneVision-0.5B.

الشكل 2. مقارنة أداء FastVLM بأداء النماذج الأخرى. (المصدر)
إليك لمحة عن بعض المعايير القياسية التي خضع FastVLM للتقييم عليها:
- DocVQA (الإجابة عن الأسئلة المرئية المتعلقة بالمستندات): يقيّم هذا المعيار مدى قدرة النموذج على قراءة المعلومات النصية في المستندات وفهمها، مثل النماذج أو الصفحات الممسوحة ضوئيًا.
- TextVQA (الإجابة عن الأسئلة المرئية المستندة إلى النص): يقيّم قدرة النموذج على تفسير الصور التي تحتوي على نص مضمن والإجابة عن الأسئلة ذات الصلة بدقة.
- GQA (الإجابة عن الأسئلة المتعلقة بالرسوم البيانية): تختبر هذه المهمة مهارات الاستدلال لدى النموذج من خلال مطالبته بفهم العلاقات بين الكائنات والمشاهد داخل الصورة.
- MMMU (الفهم متعدد الوسائط واسع النطاق متعدد التخصصات): يقيس أداء النموذج عبر مجموعة واسعة من المواد والصيغ الأكاديمية، من خلال الجمع بين الفهم المرئي والنصي.
- SeedBench (التقييم القياسي للبيانات المحسّنة لأغراض القياس): يستكشف هذا المعيار القدرات العامة للنموذج في الفهم المرئي والاستدلال عبر مجالات متعددة.
حقق FastVLM نتائج تنافسية عبر هذه المعايير مع استخدام موارد أقل. وهو يقدّم ذكاءً اصطناعيًا بصريًا عمليًا إلى الأجهزة اليومية مثل الهواتف والأجهزة اللوحية وأجهزة الكمبيوتر المحمولة.
مشفّر الرؤية الفعّال في FastVLM: FastViTHD#
بعد ذلك، سنلقي نظرة أقرب على FastViTHD، مشفّر الرؤية الذي يؤدي دورًا محوريًا في أداء FastVLM عند معالجة الصور.
تقسّم معظم نماذج اللغة والرؤية الصورة إلى آلاف الرقع الصغيرة التي تُسمّى رموزًا. وكلما زاد عدد الرموز، احتاج النموذج إلى وقت وطاقة أكبر لفهم الصورة. وقد يؤدي ذلك إلى إبطاء العملية، خصوصًا على الهواتف أو أجهزة الكمبيوتر المحمولة.

الشكل 3. كيفية معالجة مشفّر الرؤية للصورة. (المصدر)
يتجنب FastViTHD التباطؤ المصاحب لمعالجة عدد كبير جدًا من الرموز باستخدام عدد أقل منها، مع الاستمرار في فهم الصورة كاملةً. وهو يجمع بين نهجين: المحوّلات، الجيدة في نمذجة الأنماط والعلاقات، والطبقات الالتفافية، الفعّالة في معالجة البيانات المرئية. والنتيجة نظام يعمل بسرعة أكبر ويستخدم ذاكرة أقل.
وفقًا لـ Apple، فإن FastViTHD أصغر بما يصل إلى 3.4 مرات من بعض مشفّرات الرؤية التقليدية، مع الحفاظ على دقة عالية. وبدلًا من الاعتماد على تقنيات تحسين النماذج مثل تقليم الرموز (إزالة رقع الصور الأقل أهمية لتسريع المعالجة)، يحقق الكفاءة من خلال بنية أبسط وأكثر انسيابية.
إصدارات نموذج FastVLM وخط أنابيب التدريب#
أصدرت Apple نموذج FastVLM بثلاثة أحجام مختلفة: 0.5B و1.5B و7B من المعلمات (حيث يشير الحرف "B" إلى المليار، أي عدد الأوزان القابلة للتدريب في النموذج). وقد صُمم كل إصدار ليناسب أنواعًا مختلفة من الأجهزة. ويمكن للنماذج الأصغر العمل على الهواتف والأجهزة اللوحية، بينما يلائم نموذج 7B الأكبر أجهزة الكمبيوتر المكتبية أو المهام الأكثر تطلبًا.
يمنح ذلك المطورين مرونة اختيار الحل الأنسب لتطبيقاتهم. إذ يمكنهم بناء شيء سريع وخفيف للأجهزة المحمولة، أو شيء أكثر تعقيدًا للأنظمة الأكبر، مع استخدام بنية النموذج الأساسية نفسها.
درّبت Apple إصدارات نموذج FastVLM باستخدام خط أنابيب LLaVA‑1.5، وهو إطار لمواءمة نماذج اللغة والرؤية. وبالنسبة إلى مكوّن اللغة، قيّمت FastVLM باستخدام نماذج مفتوحة المصدر موجودة مثل Qwen وVicuna، المعروفة بتوليد نص طبيعي ومترابط. ويتيح هذا الإعداد لـ FastVLM معالجة الصور البسيطة والمعقدة وإنتاج استجابات مقروءة وملائمة.
أهمية FastVLM: نهج Apple الفعّال تجاه الذكاء الاصطناعي#
قد تتساءل: لماذا تهم كفاءة معالجة الصور في FastVLM؟ يعود ذلك إلى مدى سلاسة عمل التطبيقات في الوقت الفعلي من دون الاعتماد على السحابة. يستطيع FastVLM التعامل مع الصور عالية الدقة، التي تصل إلى 1152 × 1152 بكسل، مع بقائه سريعًا وخفيفًا بما يكفي للعمل مباشرةً على جهازك.
وهذا يعني أن التطبيقات تستطيع وصف ما تراه الكاميرا، أو مسح الإيصالات أثناء التقاطها، أو الاستجابة للتغييرات على الشاشة، مع إبقاء كل شيء محليًا. ويفيد ذلك بوجه خاص في مجالات مثل التعليم وإمكانية الوصول والإنتاجية والتصوير الفوتوغرافي.
وبما أن FastViTHD فعّال حتى عند التعامل مع الصور الكبيرة، فإنه يساعد في الحفاظ على استجابة الأجهزة وبرودتها. وهو يعمل مع جميع أحجام النماذج، بما في ذلك أصغرها، الذي يعمل على أجهزة iPhone للمبتدئين. وهذا يعني أن ميزات الذكاء الاصطناعي نفسها يمكن أن تعمل عبر الهواتف والأجهزة اللوحية وأجهزة Mac.
تطبيقات FastVLM#
يمكن لـ FastVLM تشغيل مجموعة واسعة من التطبيقات بفضل مزاياه الأساسية، مثل السرعة والكفاءة والخصوصية على الجهاز. وفيما يلي بعض طرق استخدامه:
-
قراءة المستندات: يمكنه مسح الإيصالات أو النماذج أو بطاقات الهوية واستخراج المعلومات ذات الصلة فقط. كما يمكنه التركيز على مناطق محددة في الصورة، وهو أمر مفيد للتطبيقات التي تحتاج إلى استخراج النص بسرعة ودقة.
-
أوصاف الصور: من خلال تحليل صورة، يمكنه إنشاء وصف واضح لما تحتويه الصورة. ويدعم ذلك الميزات الموجودة في تطبيقات الكاميرا ومعارض الصور وأي أداة تستفيد من الفهم المرئي في الوقت الفعلي.
-
دعم إمكانية الوصول: يستطيع FastVLM وصف المحتوى الظاهر على الشاشة للمستخدمين المكفوفين أو ضعاف البصر، ما يجعل الأزرار والقوائم وعناصر التخطيط أسهل في التصفح والاستخدام.
-
مساعدو الذكاء الاصطناعي على الجهاز: يمكن لـ FastVLM العمل بكفاءة مع مساعدي الذكاء الاصطناعي الذين يحتاجون إلى فهم ما يظهر على الشاشة بسرعة. وبما أنه يعمل مباشرةً على الجهاز ويحافظ على خصوصية البيانات، فإنه يستطيع المساعدة في مهام مثل قراءة النصوص وتحديد الأزرار أو الأيقونات وتوجيه المستخدمين في الوقت الفعلي من دون الحاجة إلى إرسال المعلومات إلى السحابة.

الشكل 4. يمكن استخدام FastVLM للتعرّف على النص والإجابة عن الأسئلة المرئية. (المصدر)
أهم النقاط المستخلصة#
يقدّم FastVLM ذكاءً اصطناعيًا للغة والرؤية على الجهاز إلى أجهزة Apple، جامعًا بين السرعة والخصوصية والكفاءة. وبفضل تصميمه خفيف الوزن وإصداره مفتوح المصدر، فإنه يتيح فهم الصور في الوقت الفعلي عبر تطبيقات الأجهزة المحمولة والمكتبية.
يساعد ذلك في جعل الذكاء الاصطناعي أكثر عملية وإتاحة للاستخدام اليومي، ويمنح المطورين أساسًا متينًا لبناء تطبيقات مفيدة تركز على الخصوصية. واستشرافًا للمستقبل، من المرجح أن تؤدي نماذج اللغة والرؤية دورًا مهمًا في طريقة تفاعلنا مع التكنولوجيا، إذ تجعل الذكاء الاصطناعي أكثر استجابة وإدراكًا للسياق وفائدةً في المواقف اليومية.
استكشف مستودعنا على GitHub لمعرفة المزيد عن الذكاء الاصطناعي. انضم إلى مجتمعنا النشط واكتشف الابتكارات في قطاعات مثل الذكاء الاصطناعي في صناعة السيارات والذكاء الاصطناعي البصري في التصنيع. وللبدء في استخدام الرؤية الحاسوبية اليوم، اطّلع على خيارات الترخيص.









