التعرّف إلى Llama 3.1: أحدث عائلة نماذج Meta مفتوحة المصدر
استكشف عائلة نماذج Llama 3.1 الجديدة مفتوحة المصدر من Meta، التي تضم النموذج المتعدد الاستخدامات 8B، والنموذج الشامل 70B، والنموذج الرائد 405B، وهو أكبر نماذجها وأكثرها تقدمًا حتى الآن.

في 23 يوليو 2024، أطلقت Meta عائلة النماذج الجديدة مفتوحة المصدر Llama 3.1، التي تضم النموذج المرن 8B، والنموذج القوي 70B، ونموذج Llama 3.1 405B، وقد تميّز الأخير بكونه أكبر نموذج لغوي كبير (LLM) مفتوح المصدر حتى الآن.
قد تتساءل عمّا يميز هذه النماذج الجديدة عن سابقاتها. ومع التعمق في هذه المقالة، ستكتشف أن إطلاق نماذج Llama 3.1 يمثل محطة مهمة في تكنولوجيا الذكاء الاصطناعي. تقدم النماذج المُطلقة حديثًا تحسينات كبيرة في معالجة اللغة الطبيعية؛ كما تقدم ميزات وتحسينات جديدة لم تكن موجودة في الإصدارات السابقة. ويبشّر هذا الإصدار بتغيير طريقة الاستفادة من الذكاء الاصطناعي في المهام المعقدة، عبر توفير مجموعة أدوات قوية للباحثين والمطورين على حد سواء.
في هذه المقالة، سنستكشف عائلة نماذج Llama 3.1، مع التعمق في بنيتها وتحسيناتها الرئيسية واستخداماتها العملية، وإجراء مقارنة مفصلة لأدائها.
ما هو Llama 3.1؟#
يحقق أحدث نموذج لغوي كبير من Meta، وهو Llama 3.1، تقدمًا ملحوظًا في مجال الذكاء الاصطناعي، وينافس قدرات النماذج الرائدة مثل Chat GPT-4o من OpenAI وClaude 3.5 Sonnet من Anthropic.
على الرغم من أنه قد يُعد تحديثًا طفيفًا لنموذج Llama 3 السابق، فقد دفعت Meta النموذج خطوة أخرى إلى الأمام من خلال تقديم بعض التحسينات الرئيسية إلى عائلة النماذج الجديدة، بما في ذلك:
- دعم ثماني لغات: تشمل الإنجليزية والألمانية والفرنسية والإيطالية والبرتغالية والهندية والإسبانية والتايلاندية، مما يوسّع نطاق الوصول إلى جمهور عالمي.
- 128,000 رمز لنافذة السياق: تمكين النماذج من التعامل مع مدخلات أطول بكثير والحفاظ على السياق عبر المحادثات أو المستندات الممتدة.
- قدرات أفضل على الاستدلال: تمكين النماذج من أن تكون أكثر مرونة وقدرة على إدارة المهام المعقدة بفعالية.
- أمان صارم: أُجريت اختبارات للتخفيف من المخاطر وتقليل التحيزات ومنع المخرجات الضارة، بما يعزز الاستخدام المسؤول للذكاء الاصطناعي.
إضافةً إلى ما سبق، تبرز عائلة نماذج Llama 3.1 الجديدة تقدمًا كبيرًا من خلال نموذجها المثير للإعجاب ذي الـ405 مليارات معلمة. ويمثل هذا العدد الضخم من المعلمات قفزة مهمة إلى الأمام في تطوير الذكاء الاصطناعي، إذ يعزز بدرجة كبيرة قدرة النموذج على فهم النصوص المعقدة وتوليدها. يضم نموذج 405B مجموعة واسعة من المعلمات، وتشير كل معلمة إلى الأوزان والتحيزات في الشبكة العصبية التي يتعلمها النموذج أثناء التدريب. ويسمح ذلك للنموذج بالتقاط أنماط لغوية أكثر تعقيدًا، ووضع معيار جديد للنماذج اللغوية الكبيرة، وإظهار الإمكانات المستقبلية لتكنولوجيا الذكاء الاصطناعي. ولا يحسن هذا النموذج واسع النطاق الأداء في مجموعة كبيرة من المهام فحسب، بل يدفع أيضًا حدود ما يمكن للذكاء الاصطناعي تحقيقه من حيث توليد النصوص وفهمها.
بنية النموذج#
تستفيد Llama 3.1 من بنية نموذج Transformer أحادي المُفكِّك، وهي ركيزة أساسية للنماذج اللغوية الكبيرة الحديثة. وتشتهر هذه البنية بكفاءتها وفعاليتها في التعامل مع المهام اللغوية المعقدة. ويتيح استخدام Transformer لـ Llama 3.1 التفوق في فهم النصوص الشبيهة بالنصوص البشرية وتوليدها، مما يوفر ميزة كبيرة مقارنةً بالنماذج التي تستخدم بنيات أقدم مثل LSTMs وGRUs.
بالإضافة إلى ذلك، تستخدم عائلة نماذج Llama 3.1 نموذج Transformer كثيفًا قياسيًا بدلًا من بنية مزيج الخبراء (MoE)، وهو خيار مقصود يعزز كفاءة التدريب واستقراره. ويضمن تجنب بنية MoE عملية تدريب أكثر اتساقًا وموثوقية، إذ قد تُدخل MoE أحيانًا تعقيدات يمكن أن تؤثر في استقرار النموذج وأدائه.

الشكل 1. رسم تخطيطي يوضح بنية نموذج Transformer في Llama 3.1.
تعمل بنية نموذج Llama 3.1 على النحو التالي:
1. رموز النص المُدخل: تبدأ العملية بالمدخل، الذي يتكون من رموز نصية. وهذه الرموز وحدات نصية فردية، مثل الكلمات أو الأجزاء الفرعية من الكلمات، سيعالجها النموذج.
2. تضمينات الرموز: تُحوَّل الرموز النصية بعد ذلك إلى تضمينات رمزية. والتضمينات هي تمثيلات متجهية كثيفة للرموز تلتقط معناها الدلالي وعلاقاتها داخل النص. ويُعد هذا التحويل مهمًا لأنه يتيح للنموذج التعامل مع البيانات الرقمية.
3. آلية الانتباه الذاتي: تتيح آلية الانتباه الذاتي للنموذج ترجيح أهمية الرموز المختلفة في تسلسل الإدخال عند ترميز كل رمز. وتساعد هذه الآلية النموذج على فهم السياق والعلاقات بين الرموز، بصرف النظر عن مواضعها في التسلسل. وفي آلية الانتباه الذاتي، يُمثَّل كل رمز في تسلسل الإدخال بمتجه من الأرقام. وتُستخدم هذه المتجهات لإنشاء ثلاثة أنواع مختلفة من التمثيلات: الاستعلامات والمفاتيح والقيم.
يحسب النموذج مقدار الانتباه الذي ينبغي أن يوليه كل رمز للرموز الأخرى من خلال مقارنة متجهات الاستعلام بمتجهات المفاتيح. وتنتج عن هذه المقارنة درجات توضح مدى صلة كل رمز بالرموز الأخرى.
4. الشبكة الانتقالية الأمامية: بعد عملية الانتباه الذاتي، تمر البيانات عبر شبكة انتقالية أمامية. وهذه الشبكة عبارة عن شبكة عصبية متصلة بالكامل تطبق تحويلات غير خطية على البيانات، مما يساعد النموذج على تمييز الأنماط المعقدة وتعلّمها.
5. الطبقات المتكررة: تُكدَّس طبقات الانتباه الذاتي والشبكة الانتقالية الأمامية مرات متعددة. ويتيح هذا التطبيق المتكرر للنموذج التقاط تبعيات وأنماط أكثر تعقيدًا في البيانات.
6. رمز النص الناتج: أخيرًا، تُستخدم البيانات المعالَجة لتوليد رمز النص الناتج. ويمثل هذا الرمز تنبؤ النموذج بالكلمة أو الجزء الفرعي التالي من الكلمة في التسلسل، استنادًا إلى سياق الإدخال.
أداء عائلة نماذج Llama 3.1 ومقارنتها بالنماذج الأخرى#
تكشف اختبارات المقارنة المعيارية أن Llama 3.1 لا تصمد أمام هذه النماذج المتطورة فحسب، بل تتفوق عليها أيضًا في بعض المهام، مما يبرهن على أدائها المتفوق.
Llama 3.1 405B: سعة عالية#
خضع نموذج Llama 3.1 لتقييم موسع عبر أكثر من 150 مجموعة بيانات للمعايير، حيث قورن بدقة بنماذج لغوية كبيرة رائدة أخرى. وقد خضع نموذج Llama 3.1 405B، المعروف بأنه الأقوى في السلسلة المُطلقة حديثًا، للمقارنة مع عمالقة المجال مثل GPT-4 من OpenAI وClaude 3.5 Sonnet. وتكشف نتائج هذه المقارنات أن Llama 3.1 يتمتع بميزة تنافسية، إذ يُظهر أداءً وقدرات متفوقة في مهام متنوعة.

الشكل 2. جدول يقارن أداء نموذج Llama 3.1 405B بأداء نماذج مماثلة.
يمكّن عدد المعلمات المثير للإعجاب والبنية المتقدمة هذا النموذج من التفوق في الفهم المعقد وتوليد النصوص، وغالبًا ما يتجاوز منافسيه في معايير محددة. وتبرز هذه التقييمات إمكانات Llama 3.1 في وضع معايير جديدة في مجال النماذج اللغوية الكبيرة، وتوفير أداة قوية للباحثين والمطورين لتطبيقات متنوعة.
Llama 3.1 70B: متوسطة النطاق#
تُظهر نماذج Llama الأصغر والأخف وزنًا أداءً ملحوظًا أيضًا عند مقارنتها بالنماذج المناظرة لها. وقد قورِن نموذج Llama 3.1 70B بنماذج أكبر مثل Mistral 8x22B وGPT-3.5 Turbo. فعلى سبيل المثال، يُظهر نموذج Llama 3.1 70B باستمرار أداءً متفوقًا في مجموعات بيانات الاستدلال مثل مجموعة بيانات ARC Challenge، ومجموعات بيانات البرمجة مثل مجموعات بيانات HumanEval. وتبرز هذه النتائج تعدد استخدامات سلسلة Llama 3.1 ومتانتها عبر أحجام النماذج المختلفة، مما يجعلها أداة قيّمة لمجموعة واسعة من التطبيقات.
Llama 3.1 8B: خفيف الوزن#
بالإضافة إلى ذلك، خضع نموذج Llama 3.1 8B للمقارنة المعيارية مع نماذج مماثلة في الحجم، بما في ذلك Gemma 2 9B وMistral 7B. وتكشف هذه المقارنات أن نموذج Llama 3.1 8B يتفوق على منافسيه في مجموعات بيانات المعايير المتنوعة، وفي مجالات مختلفة مثل مجموعة بيانات GPQA للاستدلال وMBPP EvalPlus للبرمجة، مما يبرز كفاءته وقدرته رغم صغر عدد معلماته.

الشكل 3. جدول يقارن أداء نموذجي Llama 3.1 70B و8B بأداء نماذج مماثلة.
كيف يمكنك الاستفادة من نماذج عائلة Llama 3.1؟#
أتاحت Meta تطبيق النماذج الجديدة بطرق عملية ومفيدة متنوعة للمستخدمين:
الضبط الدقيق#
يمكن للمستخدمين الآن إجراء الضبط الدقيق لأحدث نماذج Llama 3.1 بما يلائم حالات استخدام محددة. وتتضمن هذه العملية تدريب النموذج على بيانات خارجية جديدة لم يسبق أن تعرّض لها، مما يعزز أداءه وقدرته على التكيف مع التطبيقات المستهدفة. ويمنح الضبط الدقيق النموذج ميزة كبيرة، إذ يمكّنه من فهم المحتوى ذي الصلة بمجالات أو مهام محددة وتوليده بصورة أفضل.
الدمج في نظام RAG#
يمكن الآن دمج نماذج Llama 3.1 بسلاسة في أنظمة التوليد المعزز بالاسترجاع (RAG). ويتيح هذا الدمج للنموذج الاستفادة من مصادر البيانات الخارجية بصورة ديناميكية، مما يعزز قدرته على تقديم استجابات دقيقة وملائمة للسياق. ومن خلال استرجاع المعلومات من مجموعات البيانات الكبيرة ودمجها في عملية التوليد، تحسن Llama 3.1 أداءه بدرجة كبيرة في المهام كثيفة المعرفة، مما يوفر للمستخدمين مخرجات أكثر دقة واستنارة.
توليد البيانات الاصطناعية#
يمكنك أيضًا استخدام نموذج الـ405 مليارات معلمة لتوليد بيانات اصطناعية عالية الجودة، مما يعزز أداء النماذج المتخصصة لحالات استخدام محددة. ويستفيد هذا النهج من القدرات الواسعة لـ Llama 3.1 لإنتاج بيانات مستهدفة وملائمة، وبالتالي تحسين دقة وكفاءة تطبيقات الذكاء الاصطناعي المصممة خصيصًا.
أهم الاستنتاجات#
يمثل إطلاق Llama 3.1 قفزة مهمة إلى الأمام في مجال النماذج اللغوية الكبيرة، ويُظهر التزام Meta بتطوير تكنولوجيا الذكاء الاصطناعي.
بفضل العدد الكبير من المعلمات، والتدريب الموسع على مجموعات بيانات متنوعة، والتركيز على عمليات تدريب متينة ومستقرة، تضع Llama 3.1 معايير جديدة للأداء والقدرات في معالجة اللغة الطبيعية. وسواء في توليد النصوص أو التلخيص أو مهام المحادثة المعقدة، تُظهر Llama 3.1 ميزة تنافسية على النماذج الرائدة الأخرى. ولا يدفع هذا النموذج حدود ما يمكن للذكاء الاصطناعي تحقيقه اليوم فحسب، بل يمهّد أيضًا الطريق أمام ابتكارات مستقبلية في المشهد المتطور باستمرار للذكاء الاصطناعي.
في Ultralytics، نكرّس جهودنا لدفع حدود تكنولوجيا الذكاء الاصطناعي. لاستكشاف حلول الذكاء الاصطناعي المتطورة لدينا ومواكبة أحدث ابتكاراتنا، اطّلع على مستودع GitHub. وانضم إلى مجتمعنا النابض بالحياة على Discord، وشاهد كيف نُحدث تحولًا جذريًا في صناعات مثل السيارات ذاتية القيادة والتصنيع! 🚀









