xAI تطلق Grok 2.0 مع تكامل FLUX.1
تعرف على Grok 2.0 من xAI التابعة لـ Elon Musk وتكامله مع FLUX.1. استكشف تفاصيل مثل الميزات، ومعايير القياس، ومقارنات النماذج، وكيفية تجربته.

في 14 أغسطس، أعلنت شركة الذكاء الاصطناعي xAI التابعة لإيلون ماسك عن إطلاق Grok 2.0، وهو chatbot مدمج مع نموذج توليد الصور FLUX.1 من تطوير Black Forest Labs، على منصة X (تويتر سابقاً). يعتبر FLUX.1 نموذجاً متقدماً قادراً على إنتاج صور واقعية للغاية، بما في ذلك صور قد يُنظر إليها على أنها حساسة أو مضللة محتملة.
على عكس العديد من مولدي الصور الشائعين الذين يحظرون أو يفلترون أنواعاً معينة من المحتوى، مثل الصور العنيفة أو الصريحة أو المضللة، فإن FLUX.1 يمتلك قيوداً أقل. يرى البعض في ذلك انتصاراً لحرية التعبير، بينما يُعجب آخرون بقدراته المتقدمة. ومع ذلك، هناك أيضاً مخاوف بشأن الآثار الأخلاقية والاساءة المحتملة للاستخدام لمثل هذه التكنولوجيا القوية. دعنا نتعمق ونستكشف ما يقدمه Grok 2.0، وما يجعل FLUX.1 متميزاً، وكيف يمكنك تجربة هذه الأدوات المبتكرة بنفسك.
التعرف على FLUX.1: مولد صور بالذكاء الاصطناعي#
FLUX.1 هو مولد صور بالذكاء الاصطناعي متقدم ومفتوح المصدر تم إطلاقه بواسطة Black Forest Labs في 1 أغسطس 2024. Black Forest Labs هي شركة ناشئة تأسست بواسطة مهندسين سابقين في Stability AI والمعروفين بعملهم على نماذج Stable Diffusion المستخدمة على نطاق واسع. تم تصميم FLUX.1 لينافس مباشرة الشركات الراسخة مثل MidJourney و DALL-E 3 ويجلب مستوى جديداً من الجودة وال مرونة للصور المولدة بالذكاء الاصطناعي. على سبيل المثال، يقوم FLUX.1 بعمل رائع في التعامل مع التفاصيل الدقيقة الصعبة التي تواجهها العديد من النماذج، مثل توليد أيدي بشرية تبدو واقعية أو نصوص قابلة للقراءة على اللافتات.
توفر Black Forest Labs ثلاثة إصدارات مختلفة من FLUX.1 يمكن استخدامها في تطبيقات متنوعة. إليك نظرة فاحصة على هذه الإصدارات:
- FLUX.1 [pro]: النموذج الرائد مخصص للاستخدام التجاري ومصمم لتقديم أعلى جودة للمخرجات.
- FLUX.1 [dev]: نسخة ذات أوزان مفتوحة متاحة للاستخدام غير التجاري، وهي مثالية للبحث والتطوير.
- FLUX.1 [schnell]: نموذج مُحسَّن للسرعة بموجب ترخيص Apache 2.0، وهو مثالي للمشاريع الشخصية والتطوير المحلي حيث تكون الحاجة إلى توليد سريع للصور.

Fig 1. فهم تنوعات FLUX.1
كيف يعمل FLUX.1؟#
يستخدم FLUX.1 بنية نموذج هجينة تجمع بين تقنيات Transformer ونماذج الانتشار، بحجم نموذج يبلغ 12 مليار بارامتر (الأجزاء القابلة للتعديل في الشبكة العصبية التي تساعدها على التعلم من البيانات). تُعد Transformers نوعاً من الشبكات العصبية التي يمكنها فهم التسلسلات مثل النصوص والصور من خلال التعرف على الأنماط والعلاقات داخل البيانات. تعمل نماذج الانتشار عن طريق البدء بضوضاء عشوائية وصقلها خطوة بخطوة حتى تتشكل صورة واضحة. من خلال الجمع بين هاتين المقاربتين، يمكن لـ FLUX.1 استخدام نقاط القوة في كلا البنيتين لإنتاج صور عالية الجودة تطابق المطالبات النصية المقدمة.
يستخدم FLUX.1 أيضاً تقنيات متقدمة مثل التضمينات الموضعية الدوارة ومطابقة التدفق. تساعد التضمينات الموضعية الدوارة النموذج على فهم ترتيب وموقع العناصر في النصوص والصور لضمان توافق كل شيء بشكل منطقي معاً. مطابقة التدفق هي تقنية مستخدمة في النماذج التوليدية لجعل عملية إنشاء الصور من الضوضاء العشوائية أكثر سلاسة وكفاءة.
قياس أداء FLUX.1#
عند مقارنة FLUX.1 بنماذج شائعة أخرى مثل MidJourney v6.0 و DALL·E 3 (HD) و SD3-Ultra، يضع FLUX.1 معياراً جديداً في توليد الصور بالذكاء الاصطناعي. وهو يتفوق في مجالات رئيسية مثل جودة الصورة، ومدى الالتزام بالمطالبات، وتنوع المخرجات، ودعم مختلف الأحجام ونسب العرض إلى الارتفاع. تبرز نماذج FLUX.1 [pro] و [dev] في إنتاج صور عالية الجودة تطابق بدقة ما يريده المستخدمون، وغالباً ما تتفوق هذه النماذج على غيرها في تقديم نتائج واضحة ودقيقة. من ناحية أخرى، يُعد FLUX.1 [schnell] واحداً من أكثر النماذج تقدماً لتوليد الصور السريع، ويؤدي بشكل أفضل من نماذج أكثر تعقيداً مثل MidJourney.
![Comparison of Midjourney v6 and FLUX.1 [pro]](https://cdn.ul.run/i/bb42d5e186ce148c90511e3033298f9a.avif)
الشكل 2. مقارنة بين Midjourney v6 و FLUX.1[pro]
Grok 2.0: الأحدث من شركة xAI التابعة لـ إيلون ماسك#
Grok 2.0 هو أحدث نموذج لغوي كبير تطوره شركة الذكاء الاصطناعي xAI التابعة لـ إيلون ماسك. أُطلق Grok 2.0 في أغسطس 2024، وهو متاح لمشتركي X Premium و Premium+ على منصة X (تويتر سابقاً). كما أنه سيكون متاحاً قريباً للمطورين والشركات عبر API للمؤسسات.

Fig 3. مثال على قيام Grok 2.0 بشرح ميم (Meme).
بُني Grok 2.0 على بنية Transformer، ومقارنة بإصداره السابق Grok 1.5، فهو أكثر قدرة على اتباع التعليمات، والتعليل المنطقي لحل المشكلات، وتقديم معلومات دقيقة. تم اختبار الـ chatbot مقابل نماذج ذكاء اصطناعي رائدة أخرى وأظهر نتائج مبهرة. يتفوق Grok 2.0 على نماذج شائعة مثل GPT-4 Turbo و Claude 3.5 Sonnet و Llama 3 405B في اختبارات قياسية تشمل أسئلة علمية بمستوى الدراسات العليا، والمعلومات العامة، والمشكلات الرياضية المعقدة. يجيد Grok 2.0 أيضاً المهام التي تتطلب فهماً بصرياً، وقد حقق درجات عالية في التفكير الرياضي البصري والإجابة على الأسئلة المستندة إلى المستندات.
الرابط بين Grok 2.0 و FLUX.1#
تم دمج FLUX.1 في Grok 2.0 لتوفير مزيج سلس من توليد النصوص والصور. وبينما يُعد الجمع بين تقنيات مختلفة أمراً شائعاً اليوم لتحسين الوظائف وتجربة المستخدم، فإن هذا الدمج تحديداً حظي باهتمام كبير.
من ناحية، نال دمج FLUX.1 إشادة البعض لإضافته عنصراً "ممتعاً" إلى Grok 2.0. يمكن للمستخدمين تجربة توليد صور إبداعية وأحياناً جريئة - وهي أمور كانت ستكون مقيدة أو خاضعة لرقابة مشددة بواسطة أدوات ذكاء اصطناعي أخرى. على سبيل المثال، شارك مستخدمون على X صوراً تصور شخصيات عامة في مواقف غير لائقة أو مثيرة للجدل، زاعمين أن ذلك يدعم مفهوم حرية التعبير.
من ناحية أخرى، يجادل النقاد بأن افتقار FLUX.1 لمبادئ توجيهية أخلاقية واضحة قد يؤدي إلى قضايا أخلاقية واجتماعية خطيرة مثل التضليل والتزييف العميق. يخشى البعض من أن الجمع بين توليد نصوص وصور قوي وغير خاضع للرقابة على واحدة من أكثر منصات التواصل الاجتماعي تأثيراً قد يؤدي إلى تصاعد انتشار المعلومات المضللة.
Grok 2.0 ونهجه غير المقيد#
لا يتعلق الأمر بتوليد الصور فحسب. Grok 2.0 نفسه أكثر تحرراً من أدوات الذكاء الاصطناعي الأخرى التي اعتدنا عليها مؤخراً، مثل ChatGPT. هذا النقص في الرقابة يجعل من الممكن للنموذج تجاوز الحدود بطرق يجدها البعض مثيرة بينما يجدها آخرون مقلقة.
على سبيل المثال، لوحظ أن Grok 2.0 يولد محتوى نصياً يمكن تفسيره بسهولة على أنه أخبار كاذبة أو مضللة. تضمنت حادثة حديثة قيام Grok 2.0 بإنشاء قصة كاذبة حول لاعب NBA كلاي طومسون زعمت أنه كان في "نوبة تخريب بالطوب". لقد أساء روبوت المحادثة الذكي فهم مصطلح كرة السلة "رمي الطوب"، والذي يشير ببساطة إلى التصويبات الضائعة. بدلاً من ذلك، أخذ Grok 2.0 المصطلح حرفياً واختلق قصة حول قيام طومسون بارتكاب أفعال تخريبية باستخدام الطوب الفعلي. سرعان ما اكتسب المنشور انتشاراً واسعاً على X، حيث أضاف بعض المستخدمين حتى حسابات وهمية لضحايا لتغذية المعلومات الخاطئة.

الشكل 4. المنشور على منصة X الذي كتبه Grok 2.
على الرغم من هذه المخاوف، يقدر بعض المستخدمين موقف "حرية التعبير" لـ Grok 2.0. وهم يجادلون بأنه يتيح محادثات أكثر انفتاحاً وحرية إبداعية مقارنة بنماذج الذكاء الاصطناعي الخاضعة للرقابة المشددة. وهم يرون في Grok 2.0 رادعاً لما يدركونه على أنه ذكاء اصطناعي حذر بشكل مفرط، "woke" AI، والذي يحد من النقاش حول المواضيع الحساسة. بالنسبة هؤلاء المستخدمين، يقدم Grok 2.0 منصة تبدو أقل تقييداً بالمعايير المجتمعية.
جرب FLUX.1 و Grok 2.0 بنفسك#
هناك عدة خيارات مختلفة لتجربة FLUX.1 و Grok 2.0. يمكن الوصول إلى FLUX.1 مباشرة من خلال منصات الذكاء الاصطناعي مثل Hugging Face و Replicate و Fal.ai. في الوقت نفسه، Grok 2.0 متاح فقط لمشتركي X Premium و Premium+.
أبرز النقاط#
تدفع أدوات FLUX.1 و Grok 2.0 حدود الذكاء الاصطناعي وتثير محادثات ثاقبة. لقد وضع FLUX.1 معياراً جديداً في الصور المولدة بالذكاء الاصطناعي بفضل قدرته على إنتاج صور مفصلة وواقعية للغاية. يستخدم Grok 2.0 نموذج FLUX.1 لتعزيز قدراته بما يتجاوز التفاعلات النصية فقط. من ناحية، يشعر المتحمسون بسعادة غامرة تجاه الحرية الإبداعية والاستكشاف غير المقيد الذي توفره هذه الأدوات. من ناحية أخرى، يقرع النقاد أجراس الإنذار بشأن مخاطر التضليل والتزييف العميق والآثار الأخلاقية لمثل هذه القدرات غير المنظمة على منصة مؤثرة مثل X. مع تطور FLUX.1 و Grok 2.0، فإنهما يقفان في مركز نقاش حول الحرية والإبداع والمسؤولية في العصر الرقمي - وهو نقاش سيشكل على الأرجح مستقبل الذكاء الاصطناعي لسنوات قادمة.
لمعرفة المزيد حول Ultralytics، تحقق من مستودع GitHub الخاص بنا، وانضم إلى مجتمعنا، واستكشف أحدث حلول الذكاء الاصطناعي لدينا في قطاعات مثل الرعاية الصحية والتصنيع! 🚀






