استكشاف SAM 3: نموذج Segment Anything Model الجديد من Meta AI
اكتشف كيف يجعل SAM 3، وهو نموذج Segment Anything Model الجديد من Meta AI، اكتشاف الكائنات وتقسيمها وتتبعها عبر الصور ومقاطع الفيديو الواقعية أمرًا سهلًا.

في 19 نوفمبر 2025، أطلقت Meta AI نموذج تقسيم أي شيء 3، المعروف أيضًا باسم SAM 3. يقدم هذا الإصدار الأحدث من نموذج تقسيم أي شيء أساليب جديدة لاكتشاف الكائنات وتقسيمها وتتبعها في الصور ومقاطع الفيديو الواقعية باستخدام المطالبات النصية والمطالبات المرئية وأمثلة الصور.
يبني نموذج SAM 3 على SAM وSAM 2، ويقدم تطورات وميزات جديدة مثل تقسيم المفاهيم، واكتشاف المفردات المفتوحة، وتتبع الفيديو في الوقت الفعلي. ويمكنه فهم العبارات الاسمية القصيرة، وتتبع الكائنات عبر الإطارات، والتعرف على المفاهيم الدقيقة أو النادرة التي لم تكن النماذج السابقة تتعامل معها بالاتساق نفسه.
بالتزامن مع إطلاق SAM 3، قدمت Meta أيضًا SAM 3D. تعيد مجموعة النماذج من الجيل التالي هذه بناء الكائنات والمشاهد والأجسام البشرية الكاملة من صورة واحدة، وتوسع منظومة نموذج تقسيم أي شيء لتشمل فهم 3D. وتفتح هذه الإضافات المجال أمام تطبيقات جديدة في الرؤية الحاسوبية، والروبوتات، وتحرير الوسائط، وسير العمل الإبداعي.
في هذه المقالة، سنستكشف ماهية SAM 3، وما الذي يميزه عن SAM 2، وكيف يعمل النموذج، وتطبيقاته في العالم الحقيقي. لنبدأ!
ما هو SAM 3؟ نظرة على نموذج Meta لتقسيم أي شيء 3#
SAM 3 هو نموذج رؤية حاسوبية متطور قادر على تحديد الكائنات وفصلها وتتبعها في الصور ومقاطع الفيديو استنادًا إلى تعليمات بسيطة. وبدلًا من الاعتماد على قائمة ثابتة من التسميات، يفهم SAM 3 اللغة الطبيعية والإشارات المرئية، ما يسهّل إخبار النموذج بما تريد العثور عليه.
على سبيل المثال، يمكنك باستخدام SAM 3 كتابة عبارة قصيرة مثل «حافلة مدرسية صفراء» أو «قطة مخططة»، أو النقر على كائن، أو تحديد مثال في صورة. بعد ذلك، سيكتشف النموذج كل كائن مطابق وينشئ أقنعة تقسيم واضحة (مخططًا مرئيًا يوضح بالضبط وحدات البكسل التي تنتمي إلى الكائن). ويمكن لـ SAM 3 أيضًا تتبع هذه الكائنات عبر إطارات الفيديو، مع الحفاظ على اتساقها أثناء حركتها.
يتيح SAM 3D إعادة البناء الثلاثي الأبعاد من صورة واحدة#
ومن الأجزاء المهمة الأخرى في إعلان Meta AI هو SAM 3D، الذي يوسع مشروع نموذج تقسيم أي شيء ليشمل الفهم الثلاثي الأبعاد. يستطيع SAM 3D أخذ صورة ثنائية الأبعاد واحدة وإعادة بناء شكل كائن أو جسم إنسان أو وضعيته أو بنيته في ثلاثة أبعاد. وبعبارة أخرى، يمكن للنموذج تقدير كيفية شغل شيء ما للحيز حتى عند توفر منظور واحد فقط.
أُطلق SAM 3D في صورة نموذجين مختلفين: SAM 3D Objects، الذي يعيد بناء العناصر اليومية مع هندستها وملمسها، وSAM 3D Body، الذي يقدّر شكل جسم الإنسان ووضعية الجسم من صورة واحدة. ويستخدم كلا النموذجين ناتج التقسيم من SAM 3، ثم ينشئان تمثيلًا ثلاثي الأبعاد يتوافق مع مظهر الكائن وموضعه في الصورة الأصلية.

الشكل 1. مثال على استخدام SAM 3D. (المصدر: أُنشئ باستخدام منصة Meta AI لتقسيم أي شيء)
SAM 3: ميزات جديدة لتوحيد الاكتشاف والتقسيم والتتبع#
فيما يلي بعض التحديثات الرئيسية التي يقدمها SAM 3 لجمع الاكتشاف والتقسيم والتتبع في نموذج موحد واحد:
- مهام تقسيم المفاهيم: في SAM وSAM 2، كان تقسيم الكائنات يعتمد على المطالبات المرئية مثل النقرات أو المربعات. يضيف SAM 3 القدرة على تقسيم الكائنات استنادًا إلى عبارة نصية قصيرة أو اقتصاص نموذجي من الصورة. وهذا يعني أن النموذج يستطيع تحديد جميع الحالات المطابقة من دون الحاجة إلى النقر على كل حالة.
- المطالبات النصية ذات المفردات المفتوحة: بخلاف الإصدارات السابقة، يستطيع SAM 3 تفسير العبارات القصيرة باللغة الطبيعية. ويزيل ذلك الحاجة إلى قائمة تسميات ثابتة، ويتيح للنموذج التعامل مع مفاهيم أكثر تحديدًا أو أقل شيوعًا.
- نموذج واحد للاكتشاف والتقسيم والتتبع: يوحد SAM 3 الاكتشاف والتقسيم والتتبع في نموذج واحد، ما يلغي الحاجة إلى أنظمة منفصلة للعثور على الكائنات وإنشاء أقنعة التقسيم وتتبعها عبر إطارات الفيديو. وينشئ ذلك سير عمل أكثر اتساقًا وانسيابية للصور ومقاطع الفيديو على حد سواء. وعلى الرغم من أن SAM 2 قدم أيضًا بعض إمكانات التتبع، فإن SAM 3 يوفر أداءً أقوى وأكثر موثوقية بدرجة ملحوظة.
- نتائج أكثر استقرارًا في المشاهد المعقدة: نظرًا إلى قدرة SAM 3 على الجمع بين النصوص وصور الأمثلة والمطالبات المرئية، فإنه يتعامل مع المشاهد المزدحمة أو المتكررة بموثوقية أكبر من الإصدارات السابقة التي اعتمدت على النقرات المرئية فقط.

الشكل 2. يقدم SAM 3 تقسيم المفاهيم باستخدام أمثلة نصية أو صورية. (المصدر)
مقارنة SAM 3 وSAM 2 وSAM 1#
لنفترض أنك تشاهد مقطع فيديو لرحلة سفاري يضم العديد من الحيوانات المختلفة، وتريد اكتشاف الأفيال وتقسيمها فقط. كيف ستبدو هذه المهمة عبر الإصدارات المختلفة من SAM؟
مع SAM، ستحتاج إلى النقر يدويًا على كل فيل في كل إطار لإنشاء قناع تقسيم. ولا يتوفر التتبع، لذا يتطلب كل إطار جديد نقرات جديدة.
مع SAM 2، يمكنك النقر مرة واحدة على فيل والحصول على قناعه، وسيتتبع النموذج الفيل نفسه عبر الفيديو. ومع ذلك، ستظل بحاجة إلى تقديم نقرات منفصلة إذا أردت تقسيم عدة أفيال (كائنات محددة)، لأن SAM 2 لا يفهم الفئات مثل «فيل» من تلقاء نفسه.
مع SAM 3، يصبح سير العمل أبسط بكثير. يمكنك كتابة «فيل» أو رسم مربع إحاطة حول فيل واحد لتقديم مثال، وسيعثر النموذج تلقائيًا على كل فيل في الفيديو، ويقسمها، ويتتبعها باستمرار عبر الإطارات. ولا يزال يدعم مطالبات النقر والمربع المستخدمة في الإصدارات السابقة، لكنه يستطيع الآن أيضًا الاستجابة للمطالبات النصية والصور النموذجية، وهو ما لم يكن SAM وSAM 2 قادرين على فعله.
كيف يعمل نموذج SAM 3#
لنلقِ نظرةً أقرب بعد ذلك على كيفية عمل نموذج SAM 3 وكيفية تدريبه.
نظرة عامة على بنية نموذج SAM 3#
يجمع SAM 3 عدة مكونات معًا لدعم مطالبات المفاهيم والمطالبات المرئية في نظام واحد. ويستخدم النموذج في جوهره مُرمّز Meta Perception Encoder، وهو مُرمّز موحد مفتوح المصدر للصور والنصوص من Meta.
يمكن لهذا المُرمّز معالجة الصور والعبارات الاسمية القصيرة. وببساطة، يتيح ذلك لـ SAM 3 ربط الميزات اللغوية والمرئية بفعالية أكبر من الإصدارات السابقة من نموذج تقسيم أي شيء.
وفوق هذا المُرمّز، يتضمن SAM 3 كاشفًا يستند إلى عائلة نماذج Transformer الخاصة بـ DETR. ويحدد هذا الكاشف الكائنات في الصورة، ويساعد النظام على تحديد الكائنات التي تتوافق مع مطالبة المستخدم.
وبالتحديد، يستخدم SAM 3، في تقسيم الفيديو، مكون تتبع مبنيًا على بنك الذاكرة ومُرمّز الذاكرة من SAM 2. ويتيح ذلك للنموذج الاحتفاظ بمعلومات عن الكائنات عبر الإطارات، حتى يتمكن من إعادة تحديدها وتتبعها بمرور الوقت.

الشكل 3. كيفية عمل تقسيم أي شيء باستخدام المفاهيم (المصدر: scontent)
محرك البيانات القابل للتوسع وراء نموذج تقسيم أي شيء 3#
لتدريب SAM 3، احتاجت Meta إلى بيانات مشروحة تفوق بكثير ما هو متاح حاليًا على الإنترنت. فمن الصعب إنشاء أقنعة تقسيم وتسميات نصية عالية الجودة على نطاق واسع، كما أن تحديد كل حالة لمفهوم ما في الصور ومقاطع الفيديو يستغرق وقتًا طويلًا ومكلف.
ولحل هذه المشكلة، أنشأت Meta محرك بيانات جديدًا يجمع بين SAM 3 نفسه، ونماذج AI إضافية، ومشرفين بشريين يعملون معًا. يبدأ سير العمل بخط أنابيب من أنظمة AI، بما في ذلك SAM 3 ونموذج لوصف الصور قائم على Llama.
تفحص هذه الأنظمة مجموعات كبيرة من الصور ومقاطع الفيديو، وتنشئ أوصافًا، وتحول تلك الأوصاف إلى تسميات نصية، وتنتج مرشحين أوليين لأقنعة التقسيم. ثم يراجع المشرفون البشريون ومشرفو AI هؤلاء المرشحين.
ويعمل مشرفو AI، الذين دُرّبوا على مطابقة دقة البشر أو تجاوزها في مهام مثل التحقق من جودة الأقنعة والتحقق من تغطية المفاهيم، على تصفية الحالات المباشرة. ولا يتدخل البشر إلا في الأمثلة الأكثر تحديًا التي قد يظل النموذج يواجه صعوبة فيها.

الشكل 4. محرك بيانات SAM 3 (المصدر)
يمنح هذا النهج Meta دفعة كبيرة في سرعة وضع التعليقات التوضيحية. فمن خلال إسناد الحالات السهلة إلى مشرفي AI، يصبح خط الأنابيب أسرع بنحو خمس مرات في المطالبات السلبية، وأسرع بنسبة 36% في المطالبات الإيجابية ضمن المجالات الدقيقة.
أتاحت هذه الكفاءة توسيع مجموعة البيانات لتشمل أكثر من أربعة ملايين مفهوم فريد. كما أن الحلقة المستمرة من مقترحات AI والتصحيحات البشرية وتنبؤات النموذج المحدّثة تحسن جودة التسميات بمرور الوقت، وتساعد SAM 3 على تعلم مجموعة أوسع بكثير من المفاهيم المرئية والقائمة على النصوص.
تحسينات أداء SAM 3#
فيما يتعلق بالأداء، يقدم SAM 3 تحسنًا واضحًا مقارنةً بالنماذج السابقة. فعلى معيار SA-Co الجديد من Meta، الذي يقيّم اكتشاف المفاهيم وتقسيمها باستخدام المفردات المفتوحة، يحقق SAM 3 أداءً يقارب ضعف أداء الأنظمة السابقة في الصور ومقاطع الفيديو على حد سواء.
كما يضاهي SAM 2 أو يتفوق عليه في المهام المرئية التفاعلية مثل point-to-mask وmask-to-masklet. وتفيد Meta بوجود مكاسب إضافية في تقييمات أصعب مثل LVIS دون تدريب مسبق (حيث يجب على النماذج التعرف على الفئات النادرة من دون أمثلة تدريبية) وعدّ الكائنات (قياس ما إذا كان قد جرى اكتشاف جميع حالات الكائن)، ما يبرز قدرة أقوى على التعميم عبر المجالات.
إضافةً إلى تحسينات الدقة هذه، يتميز SAM 3 بالكفاءة؛ إذ يعالج صورة تضم أكثر من 100 كائن مكتشف في نحو 30 مللي ثانية على وحدة معالجة الرسومات H200، ويحافظ على سرعات قريبة من الوقت الفعلي عند تتبع عدة كائنات في الفيديو.
تطبيقات نموذج تقسيم أي شيء 3#
بعد أن أصبح لدينا فهم أفضل لـ SAM 3، دعونا نستعرض كيفية استخدامه في التطبيقات الواقعية، بدءًا من الاستدلال المتقدم الموجّه بالنص وصولًا إلى البحث العلمي ومنتجات Meta الخاصة.
التعامل مع الاستعلامات النصية المعقدة باستخدام SAM 3 Agent#
يمكن أيضًا استخدام SAM 3 كأداة داخل نموذج لغوي أكبر متعدد الوسائط، تطلق عليه Meta اسم SAM 3 Agent. فبدلًا من إعطاء SAM 3 عبارة قصيرة مثل «فيل»، يستطيع الوكيل تقسيم سؤال أكثر تعقيدًا إلى مطالبات أصغر يفهمها SAM 3.
على سبيل المثال، إذا سأل المستخدم: «ما الكائن الموجود في الصورة والمستخدم للتحكم في حصان وتوجيهه؟»، فسيجرب الوكيل عبارات اسمية مختلفة، ويرسلها إلى SAM 3، ويتحقق من الأقنعة المعقولة. ويواصل التنقيح حتى يعثر على الكائن الصحيح.
حتى من دون تدريبه على مجموعات بيانات متخصصة للاستدلال، يحقق SAM 3 Agent أداءً جيدًا في المعايير المصممة للاستعلامات النصية المعقدة، مثل ReasonSeg وOmniLabel. ويوضح ذلك أن SAM 3 قادر على دعم الأنظمة التي تحتاج إلى فهم اللغة والتقسيم المرئي الدقيق معًا.
التطبيقات العلمية وتطبيقات الحفاظ على البيئة لـ SAM 3#
ومن المثير للاهتمام أن SAM 3 يُستخدم بالفعل في بيئات بحثية تكون فيها التسميات المرئية التفصيلية مهمة. فقد تعاونت Meta مع Conservation X Labs وOsa Conservation لبناء SA-FARI، وهي مجموعة بيانات عامة لمراقبة الحياة البرية تضم أكثر من 10,000 مقطع فيديو من كاميرات مصائد.
يُوسم كل حيوان في كل إطار بالمربعات وأقنعة التقسيم، وهو أمر يستغرق وقتًا طويلًا للغاية عند تنفيذه يدويًا. وبالمثل، يُستخدم SAM 3 في أبحاث المحيطات بالتعاون مع FathomNet وMBARI لإنشاء أقنعة تقسيم للحالات من أجل الصور تحت الماء ودعم معايير تقييم جديدة.
تساعد مجموعات البيانات هذه العلماء على تحليل لقطات الفيديو بكفاءة أكبر ودراسة الحيوانات والموائل التي يصعب عادةً تتبعها على نطاق واسع. كما يمكن للباحثين استخدام هذه الموارد لبناء نماذجهم الخاصة للتعرف على الأنواع، وتحليل السلوك، والمراقبة البيئية المؤتمتة.
كيف تنشر Meta نموذج SAM 3 عبر منتجاتها#
إلى جانب استخداماته البحثية، يشغّل SAM 3 أيضًا ميزات وحالات استخدام جديدة عبر منتجات Meta الاستهلاكية. وفيما يلي لمحة عن بعض طرق دمجه بالفعل:
- تحريرات Instagram: يستطيع منشئو المحتوى تطبيق تأثيرات على شخص أو كائن محدد في مقطع فيديو من دون تنفيذ عمل يدوي إطارًا بإطار.
- تطبيق Meta AI وmeta.ai على الويب: يدعم SAM 3 أدوات جديدة لتعديل الصور ومقاطع الفيديو وتحسينها وإعادة مزجها.
- ميزة «العرض في الغرفة» في Facebook Marketplace: يعمل SAM 3 مع SAM 3D لتمكين الأشخاص من معاينة الأثاث أو الديكور في منازلهم باستخدام صورة واحدة.
- نظارات Aria Gen 2 البحثية: يساعد نموذج تقسيم أي شيء 3 على تقسيم الأيدي والكائنات وتتبعها من منظور الشخص الأول، بما يدعم AR (الواقع المعزز) والروبوتات وأبحاث AI السياقية.
أهم النقاط المستخلصة#
يمثل SAM 3 خطوة مهمة ومثيرة إلى الأمام في مجال التقسيم. فهو يقدم تقسيم المفاهيم، والمطالبات النصية ذات المفردات المفتوحة، وتحسينات في التتبع. ومع الأداء الأقوى بوضوح في الصور ومقاطع الفيديو على حد سواء، وإضافة SAM 3D، تفتح مجموعة النماذج آفاقًا جديدة أمام AI للرؤية، والأدوات الإبداعية، والبحث العلمي، والمنتجات الواقعية.
انضم إلى مجتمعنا واستكشف مستودع GitHub الخاص بنا لاكتشاف المزيد حول AI. وإذا كنت تتطلع إلى بناء مشروع AI للرؤية خاص بك، فاطّلع على خيارات الترخيص لدينا. واستكشف المزيد حول تطبيقات مثل AI في الرعاية الصحية وAI للرؤية في قطاع التجزئة بزيارة صفحات حلولنا.









