تحديثات أبحاث الذكاء الاصطناعي من Meta FAIR: SAM 2.1 وCoTracker3
استكشف أحدث نماذج الذكاء الاصطناعي من Meta FAIR، وهي SAM 2.1 وCoTracker3، التي توفر قدرات متقدمة للتجزئة والتتبع لتطبيقات متنوعة وواقعية.

الذكاء الاصطناعي هو مجال بحثي شهد مؤخراً حماساً وطاقة هائلين، مع ظهور ابتكار جديدة واختراقات أسرع من أي وقت مضى. في الأسابيع القليلة الماضية، كشفت فريق أبحاث الذكاء الاصطناعي الأساسية (FAIR) التابع لشركة ميتا عن مجموعة من الأدوات ونماذج تهدف إلى مواجهة التحديات في مختلف مجالات الذكاء الاصطناعي. تتضمن هذه الإصدارات تحديثات قد تؤثر على مجالات متنوعة مثل الرعاية الصحية، والروبوتات، والواقع المعزز.
على سبيل المثال، يحسن نموذج SAM 2.1 المُحدث عملية تجزيء الكائنات، مما يسهل تحديد وفصل الكائنات بدقة في الصور ومقاطع الفيديو. وفي الوقت نفسه، يركز CoTracker3 على تتبع النقاط، مما يساعد في متابعة النقاط في إطارات الفيديو حتى عندما تتحرك الكائنات أو يتم حجبها جزئياً.
كما قدمت ميتا إصدارات أخف وأسرع من نموذج لغة Llama للاستخدام الفعال على الجهاز، إلى جانب تقنية استشعار باللمس جديدة لـالروبوتات. في هذه المقالة، سنقوم باستعراض هذه الإصدارات الأخيرة من Meta FAIR، مع إلقاء نظرة على ما تقدمه كل أداة. لنبدأ!
نموذج Segment Anything Model المحسّن من Meta: SAM 2.1#
تجزئة الكائنات، وهي مهمة رؤية حاسوبية أساسية، تجعل من الممكن تحديد وفصل الكائنات المميزة داخل صورة أو فيديو، مما يسهل تحليل مناطق الاهتمام المحددة. منذ إصداره، تم استخدام نموذج التجزئة لأي شيء 2 (SAM 2) الخاص بشركة ميتا لتجزئة الكائنات عبر مختلف المجالات مثل التصوير الطبي والأرصاد الجوية. بناءً على تعليقات المجتمع، قدمت ميتا الآن SAM 2.1، وهو إصدار مُحسن مصمم لمعالجة بعض التحديات التي واجهت النموذج الأصلي وتقديم أداء أقوى بشكل عام.

الشكل 1. قياس أداء نموذج SAM 2.1.
يتضمن SAM 2.1 تحديثات للتعامل بشكل أفضل مع الكائنات المتشابهة بصرياً والأصغر حجماً، بفضل تقنيات زيادة البيانات الجديدة. كما أنه يحسن كيفية تعامل النموذج مع الاحتجاب (عندما يتم إخفاء أجزاء من الكائن عن الرؤية) من خلال تدريبه على تسلسلات فيديو أطول، مما يتيح له "تذكر" التعرف على الكائنات بمرور الوقت، حتى لو تم حجبها مؤقتْا. على سبيل المثال، إذا كان شخص ما يصور فيديو لشخص يمشى خلف شجرة، يمكن لـ SAM 2.1 تتبع الشخص أثناء ظهوره مرة أخرى على الجانب الآخر، مستخدماً ذاكرته عن موقع الكائن وحركته لملء الفجوات عندما تنقطع الرؤية لفترة وجيزة.
إلى جانب هذه التحديثات، أصدرت ميتا حزمة مطوري SAM 2، مما يوفر كود تدريب مفتوح المصدر وبنية أساسية كاملة للعروض التوضيحية حتى يتمكن المطورون من ضبط SAM 2.1 بدقة باستخدام بياناتهم الخاصة ودمجه في مجموعة من التطبيقات.
CoTracker3: نموذج التتبع من Meta ومميزاته وتحديثاته#
مهمة رؤية حاسوبية أخرى ممتعة هي تتبع النقاط. تتضمن متابعة نقاط أو ميزات محددة عبر إطارات متعددة في الفيديو. تخيل فيديو لـراكب دراجة يسير على مسار - يتيح تتبع النقاط للنموذج الاستمرار في تتبع النقاط على راكب الدراجة، مثل الخوذة أو العجلات، حتى لو تم إخفاؤها بواسطة عوائق لفترة قصيرة.
يعد تتبع النقاط أمراً بالغ الأهمية لتطبيقات مثل الاعادة البناء ثلاثية الأبعاد، والروبوتات، وتحرير الفيديو. تعتمد النماذج التقليدية غالباً على إعدادات معقدة ومجموعات بيانات اصطناعية ضخمة، مما يحد من فعاليتها عند تطبيقها على سيناريوهات العالم الحقيقي.
يعالج نموذج CoTracker3 للتتبع من ميتا هذه القيود من خلال تبسيط بنية النموذج. كما يقدم تقنية تصنيف زائف تتيح للنموذج التعلم من مقاطع فيديو حقيقية وغير معلنة، مما يجعل CoTracker3 أكثر كفاءة وقابلية للتوسع للاستخدام العملي.

الشكل 2. مقارنة CoTracker3 بنماذج التتبع الأخرى.
إحدى الميزات التي تجعل CoTracker3 يبرز هي قدرته على التعامل مع حالات الاحتجاب بشكل جيد. باستخدام الانتباه عبر المسارات، وهي تقنية تسمح للنموذج بمشاركة المعلومات عبر نقاط تتبع متعددة، يمكن لـ CoTracker3 استنتاج مواقع النقاط المخفية من خلال الإشارة إلى النقاط المرئية. من خلال القيام بذلك، تم تصميم CoTracker3 ليكون فعالاً للغاية في البيئات الديناميكية، مثل متابعة شخص عبر مشهد مزدحم.
يقدم CoTracker3 أيضاً وضعين عبر الإنترنت وغير متصل. يوفر وضع الإنترنت تتبَعاً في الوقت الفعلي، بينما يمكن استخدام الوضع غير المتصل لتتبع أكثر شمولاً عبر تسلسلات الفيديو بأكملها، وهو مثالي لمهام مثل تحرير الفيديو أو الرسوم المتحركة.
تحديثات وأبحاث أخرى من Meta FAIR#
بينما يعرض SAM 2.1 وCoTracker3 أحدث تطورات ميتا في الرؤية الحاسوبية، توجد أيضاً تحديثات مثيرة في مجالات أخرى من الذكاء الاصطناعي، مثل معالجة اللغات الطبيعية (NLP) والروبوتات. دعونا نلقي نظرة على بعض هذه التطورات الأخيرة الأخرى من Meta FAIR.
نموذج Spirit LM من Meta: ابتكارات الذكاء الاصطناعي في اللغات والنماذج متعددة الوسائط#
Meta’s Spirit LM is a new multimodal language model that combines text and speech capabilities, making interactions with AI feel more natural. Unlike traditional models that handle only text or only speech, Spirit LM can seamlessly switch between the two.
يمكن لـ Spirit LM فهم وتوليد اللغة بطرق تبدو أكثر شبهاً بالإنسان. على سبيل المثال، يمكنه تحسين المساعدين الافتراضيين الذين يمكنهم الاستماع والاستجابة بلغة منطوقة أو مكتوبة، أو دعم أدوات إمكانية الوصول التي تحول بين الكلام والنص.

الشكل 3. مثال على تحويل النص إلى كلام باستخدام Meta Spirit LM.
علاوة على ذلك، طورت ميتا تقنيات لجعل نماذج اللغة الكبيرة أكثر كفاءة. إحدى هذه التقنيات، والتي تسمى تخطي الطبقات، تساعد في تقليل الاحتياجات الحسابية وتكاليف الطاقة من خلال تنشيط الطبقات الضرورية لمهمة معينة فقط. هذا مفيد بشكل خاص للتطبيقات على الأجهزة ذات الذاكرة والطاقة المحدودة.
وخطوة أخرى نحو تلبية الحاجة إلى نشر تطبيقات الذكاء الاصطناعي على هذه الأجهزة، طرحت ميتا أيضاً إصدارات مكممة من نماذج Llama الخاصة بها. يتم ضغط هذه النماذج لت تعمل بشكل أسرع على الأجهزة المحمولة دون التضحية بـالدقة.
نظرة على مستقبل التحسين مع Meta Lingua#
مع نمو نماذج الذكاء الاصطناعي في الحجم والتعقيد، أصبح تحسين عملية تدريبها أمراً بالغ الأهمية. وفيما يتعلق بـالتحسين، قدمت ميتا Meta Lingua، وهي قاعدة أكواد مرنة وفعالة تجعل تدريب نماذج اللغة الكبيرة أسهل. يتيح التصميم المعياري لـ Meta Lingua للباحثين تخصيص وتوسيع نطاق تجاربهم بسرعة.
يمكن للباحثين قضاء وقت أقل في الإعداد التقني ووقت أكثر في البحث الفعلي. قاعدة الأكواد خفيفة الوزن أيضاً وسهلة التكامل، مما يجعلها مناسبة لكل من التجارب الصغيرة والمشاريع واسعة النطاق. من خلال إزالة هذه العقبات التقنية، يساعد Meta Lingua الباحثين على تحقيق تقدم أسرع واختبار أفكار جديدة بدرجة أكبر من السهولة.

الشكل 4. نظرة عامة على Meta Lingua.
تحسينات Meta في أمن الذكاء الاصطناعي#
مع تقدم تكنولوجيا الحوسبة الكمومية، فإنها تجلب تحديات جديدة لـأمان البيانات. على عكس أجهزة الكمبيوتر اليوم، فمن المرجح أن تكون أجهزة الكمبيوتر الكمومية قادرة على حل العمليات الحسابية المعقدة بشكل أسرع بكثير. هذا يعني أنها قد تحتمل اختراق طرق التشفير المستخدمة حالياً لـحماية المعلومات الحساسة. ولهذا السبب يصبح البحث في هذا المجال مهمًا بشكل متزايد - فالطرق الجديدة لتطوير حماية البيانات ضرورية بينما نستعد لمستقبل الحوسبة الكمومية.
ولمعالجة ذلك، طورت ميتا Salsa، وهي أداة تهدف إلى تعزيز أمان التشفير لما بعد الكم. تساعد Salsa الباحثين في اختبار الهجمات المدفوعة بالذكاء الاصطناعي وتحديد نقاط الضعف المحتملة، مما يمكنهم من فهم ومعالجة الثغرات الأمنية في أنظمة التشفير بشكل أفضل. من خلال محاكاة سيناريوهات الهجوم المتقدمة، توفر Salsa رؤى قيمة يمكن أن توجه تطوير تدابير أمان أقوى وأكثر مرونة لعصر الكم.
الذكاء الاصطناعي في Meta: أحدث الابتكارات في الروبوتات#
يركز أحدث عمل لـ ميتا في مجال الروبوتات على مساعدة الذكاء الاصطناعي في التفاعل بشكل أكثر طبيعية مع العالم المادي من خلال تعزيز إدراك اللمس، والبراعة، والتعاون مع البشر. على وجه الخصوص، يعد Meta Digit 360 مستشعراً باللمس متقدماً يمنح الروبوتات إحساساً دقيقاً باللمس. تساعد المستشعرات الروبوتات على اكتشاف تفاصيل مثل الملمس، والضغط، وحتى أشكال الكائنات. من هذه الرؤى، يمكن للروبوتات التعامل مع الكائنات بدقة أكبر؛ وهو أمر بالغ الأهمية في مجالات مثل الرعاية الصحية والتصنيع.
فيما يلي بعض الميزات الرئيسية التي يتضمنها Meta Digit 360:
- وهو مجهز بـ 18 ميزة استشعار متميزة ليكون قادراً على التقاط مجموعة واسعة من التفاصيل اللمسية.
- يمكن للمستشعر اكتشاف تغيرات الضغط الصغيرة التي تصل إلى 1 ميلي نيوتن، مما يمكن الروبوتات من الاستجابة للقوام الدقيق والحركات الطفيفة.
- وهو يتضمن أكثر من 8 ملايين "تاكسيل" (نقاط استشعار دقيقة) عبر سطح طرف الإصبع، مما يوفر خريطة عالية الدقة لمعلومات اللمس.
امتداد لـ Meta Digit 360 هو منصة Meta Digit Plexus، وهي منصة تدمج مستشعرات لمس مختلفة على يد روبوتية واحدة. يسمح هذا الإعداد للروبوتات بمعالجة معلومات اللمس من نقاط متعددة في وقت واحد، على غرار كيفية جمع اليد البشرية للبيانات الحسية.

الشكل 5. Meta Digit Plexus.
تمهيد الطريق للفصل القادم من الذكاء الاصطناعي#
تُظهر تحديثات الذكاء الاصطناعي الأخيرة من Meta، التي تتراوح من التقدم في الرؤية الحاسوبية مع SAM 2.1 و CoTracker3 إلى التطورات الجديدة في نماذج اللغة والروبوتات، كيف ينتقل الذكاء الاصطناعي بثبات من النظرية إلى حلول عملية ومؤثرة.
تم تصميم هذه الأدوات لجعل الذكاء الاصطناعي أكثر قابلية للتكيف وفائدة عبر مجالات مختلفة، مما يساعد في كل شيء بدءاً من تجزئة الصور المعقدة إلى فهم اللغة البشرية وحتى العمل بجانبنا في المساحات المادية.
من خلال إعطاء الأولوية لإمكانية الوصول والتطبيق الواقعي، تقربنا Meta FAIR من مستقبل يمكن فيه للذكاء الاصطناعي معالجة تحديات العالم الحقيقي وتعزيز حياتنا اليومية بطرق ذات مغزى.
هل أنت فضولي بشأن الذكاء الاصطناعي؟ انضم إلى مجتمعنا للحصول على آخر التحديثات والرؤى، واطلع على مستودع GitHub الخاص بنا. يمكنك أيضاً استكشاف كيف يمكن استخدام الرؤية الحاسوبية في صناعات مثل السيارات ذاتية القيادة والزراعة!






