تطلق xAI نموذج Grok 2.0 مع تكامل FLUX.1
تعرّف على Grok 2.0 من شركة xAI التابعة لإيلون ماسك وتكامله مع FLUX.1. واستكشف تفاصيل مثل الميزات والمعايير المرجعية ومقارنات النماذج وكيفية تجربته.

في 14 أغسطس، أعلنت شركة الذكاء الاصطناعي xAI التابعة لإيلون ماسك عن إطلاق Grok 2.0، وهو روبوت محادثة مدمج مع FLUX.1، وهو نموذج لتوليد الصور من Black Forest Labs، وذلك على منصة X (المعروفة سابقًا باسم Twitter). FLUX.1 هو نموذج متقدم قادر على إنشاء صور شديدة الواقعية، بما في ذلك صور قد تُعد حساسة أو مضللة محتملًا.
على خلاف العديد من مولدات الصور الشائعة التي تحظر أو ترشح أنواعًا معينة من المحتوى، مثل الصور العنيفة أو الصريحة أو الخادعة، يفرض FLUX.1 قيودًا أقل. ويرى بعضهم في ذلك انتصارًا لحرية التعبير، بينما ينبهر آخرون بقدراته المتقدمة. ومع ذلك، هناك أيضًا مخاوف بشأن الآثار الأخلاقية وإساءة الاستخدام المحتملة لهذه التقنية القوية. دعونا نستكشف ما يقدمه Grok 2.0، وما الذي يميز FLUX.1، وكيف يمكنك تجربة هذه الأدوات المبتكرة بنفسك.
التعرّف إلى FLUX.1: مولد صور بالذكاء الاصطناعي#
FLUX.1 هو مولد صور متقدم مفتوح المصدر بالذكاء الاصطناعي أطلقته Black Forest Labs في 1 أغسطس 2024. Black Forest Labs هي شركة ناشئة أسسها مهندسون سابقون في Stability AI، واشتهرت بعملها على نماذج Stable Diffusion واسعة الاستخدام. صُمم FLUX.1 لمنافسة الجهات الراسخة مباشرةً، مثل MidJourney وDALL-E 3، ويقدم مستوى جديدًا من الجودة والمرونة للصور المُنشأة بالذكاء الاصطناعي. فعلى سبيل المثال، يتعامل FLUX.1 بكفاءة مع التفاصيل المعقدة التي تواجه العديد من النماذج صعوبة فيها، مثل إنشاء أيدٍ بشرية تبدو واقعية أو نصوص مقروءة على اللافتات.
تقدم Black Forest Labs ثلاثة إصدارات مختلفة من FLUX.1 يمكن استخدامها في تطبيقات متنوعة. فيما يلي نظرة أقرب على هذه الإصدارات:
- FLUX.1 [pro]: النموذج الرائد مخصص للاستخدام التجاري، وصُمم لتقديم أعلى جودة ممكنة من المخرجات.
- FLUX.1 [dev]: إصدار ذو أوزان مفتوحة متاح للاستخدام غير التجاري. وهو مثالي للبحث والتطوير.
- FLUX.1 [schnell]: نموذج مُحسّن للسرعة بموجب ترخيص Apache 2.0، ومثالي للمشروعات الشخصية والتطوير المحلي حيث تكون هناك حاجة إلى توليد الصور بسرعة.

الشكل 1. فهم إصدارات FLUX.1
كيف يعمل FLUX.1؟#
يستخدم FLUX.1 بنية نموذج هجينة تجمع بين تقنيات Transformer والانتشار، ويبلغ حجم النموذج 12 مليار معلمة (وهي الأجزاء القابلة للضبط في الشبكة العصبية التي تساعده على التعلم من البيانات). وتُعد Transformers نوعًا من الشبكات العصبية القادرة على فهم التسلسلات، مثل النصوص والصور، من خلال التعرّف إلى الأنماط والعلاقات داخل البيانات. وتعمل نماذج الانتشار بالبدء بضوضاء عشوائية ثم تحسينها خطوةً تلو الأخرى حتى تتشكل صورة واضحة. ومن خلال الجمع بين هذين النهجين، يستطيع FLUX.1 الاستفادة من نقاط قوة كلتا البنيتين لإنتاج صور عالية الجودة تتطابق مع المطالبات النصية المقدمة.
يستخدم FLUX.1 أيضًا تقنيات متقدمة، مثل تضمينات الموضع الدورانية ومطابقة التدفق. وتساعد تضمينات الموضع الدورانية النموذج على فهم ترتيب العناصر ومواضعها في النصوص والصور، لضمان اتساقها معًا. أما مطابقة التدفق فهي تقنية تُستخدم في النماذج التوليدية لجعل عملية إنشاء الصور من الضوضاء العشوائية أكثر سلاسة وكفاءة.
تقييم FLUX.1#
عند مقارنة FLUX.1 بنماذج شائعة أخرى، مثل MidJourney v6.0 وDALL·E 3 (HD) وSD3-Ultra، يضع FLUX.1 معيارًا جديدًا في توليد الصور بالذكاء الاصطناعي. فهو يتفوق في مجالات رئيسية، مثل جودة الصور، ومدى التزامه بالمطالبات، وتنوع المخرجات، ودعم الأحجام ونسب العرض إلى الارتفاع المختلفة. ويتميز نموذجا FLUX.1 [pro] و[dev] بإنتاج صور عالية الجودة تتطابق بدرجة كبيرة مع ما يريده المستخدمون، وغالبًا ما يتفوقان على النماذج الأخرى في تقديم نتائج واضحة ودقيقة. ومن ناحية أخرى، يُعد FLUX.1 [schnell] أحد أكثر النماذج تقدمًا في توليد الصور بسرعة، ويؤدي أداءً أفضل من نماذج أكثر تعقيدًا مثل MidJourney.
![مقارنة بين Midjourney v6 وFLUX.1 [pro]](https://cdn.ul.run/i/bb42d5e186ce148c90511e3033298f9a.avif)
الشكل 2. مقارنة بين Midjourney v6 وFLUX.1[pro]
Grok 2.0: أحدث إصدارات xAI التابعة لإيلون ماسك#
Grok 2.0 هو أحدث نموذج لغوي كبير طورته شركة الذكاء الاصطناعي xAI التابعة لإيلون ماسك. أُطلق Grok 2.0 في أغسطس 2024، وهو متاح لمستخدمي X Premium وPremium+ على منصة X (المعروفة سابقًا باسم Twitter). كما سيتاح قريبًا للمطورين والشركات من خلال API للمؤسسات.

الشكل 3. مثال على شرح Grok 2.0 لميم.
يعتمد Grok 2.0 على بنية Transformer، وبالمقارنة مع إصداره الأقدم Grok 1.5، فهو أكثر قدرة على اتباع التعليمات، والاستدلال في حل المشكلات، وتقديم معلومات دقيقة. وقد اختُبر روبوت المحادثة مقابل نماذج ذكاء اصطناعي رائدة أخرى، وأظهر نتائج مثيرة للإعجاب. ويتفوق Grok 2.0 على نماذج شائعة مثل GPT-4 Turbo وClaude 3.5 Sonnet وLlama 3 405B في المعايير التي تتضمن أسئلة في العلوم على مستوى الدراسات العليا، والمعرفة العامة، والمسائل الرياضية المعقدة. كما يجيد Grok 2.0 المهام التي تتطلب فهمًا بصريًا، وحقق درجات مرتفعة في الاستدلال الرياضي البصري والإجابة عن الأسئلة المستندة إلى المستندات.
العلاقة بين Grok 2.0 وFLUX.1#
دُمج FLUX.1 في Grok 2.0 لتوفير مزيج سلس من توليد النصوص والصور. وعلى الرغم من أن الجمع بين التقنيات المختلفة أمر شائع اليوم لتحسين الوظائف وتجربة المستخدم، فقد حظي هذا الدمج تحديدًا باهتمام كبير.
من ناحية، أشاد بعضهم بدمج FLUX.1 لأنه أضاف عنصرًا «ممتعًا» إلى Grok 2.0. ويمكن للمستخدمين تجربة إنشاء صور إبداعية، وأحيانًا حادة أو استفزازية، وهي أمور كانت ستُقيّد أو تخضع لإشراف مكثف من أدوات ذكاء اصطناعي أخرى. فعلى سبيل المثال، شارك المستخدمون على X صورًا تُظهر شخصيات عامة في مواقف غير لائقة أو مثيرة للجدل، زاعمين أن ذلك يدعم مفهوم حرية التعبير.
من ناحية أخرى، يرى المنتقدون أن افتقار FLUX.1 إلى إرشادات أخلاقية واضحة قد يؤدي إلى مشكلات أخلاقية واجتماعية خطيرة، مثل المعلومات المضللة والتزييف العميق. ويخشى بعضهم أن يؤدي الجمع بين توليد النصوص والصور القوي وغير الخاضع للرقابة على إحدى أكثر منصات التواصل الاجتماعي تأثيرًا إلى تصعيد انتشار التضليل.
Grok 2.0 ونهجه غير المقيّد#
لا يقتصر الأمر على توليد الصور. فـGrok 2.0 نفسه أقل تقييدًا من أدوات ذكاء اصطناعي أخرى اعتدنا عليها مؤخرًا، مثل ChatGPT. ويجعل هذا الافتقار إلى الإشراف النموذجَ قادرًا على تجاوز الحدود بطرق يجدها بعضهم مثيرة، بينما يراها آخرون مقلقة.
فعلى سبيل المثال، لوحظ أن Grok 2.0 ينشئ محتوى نصيًا يمكن تفسيره بسهولة على أنه أخبار كاذبة أو مضللة. وقد تضمنت حادثة حديثة إنشاء Grok 2.0 قصة زائفة عن لاعب NBA كلاي تومسون يُزعم أنه كان في «جولة لتخريب الممتلكات بالطوب». فقد أساء روبوت المحادثة بالذكاء الاصطناعي فهم مصطلح كرة السلة «رمي الطوب»، الذي يشير ببساطة إلى التسديدات الضائعة. وبدلًا من ذلك، فسّر Grok 2.0 العبارة حرفيًا واختلق قصة عن ارتكاب تومسون أعمال تخريب باستخدام طوب حقيقي. وسرعان ما انتشر المنشور على X، حتى إن بعض المستخدمين أضافوا حسابات مزيفة لضحايا بهدف تأجيج المعلومات المضللة.

الشكل 4. المنشور على X الذي كتبه Grok 2.
على الرغم من هذه المخاوف، يقدّر بعض المستخدمين موقف Grok 2.0 الداعم لـ«حرية التعبير». ويرون أنه يتيح محادثات أكثر انفتاحًا وحرية إبداعية أكبر من نماذج الذكاء الاصطناعي الخاضعة لإشراف مكثف. ويعتبرون Grok 2.0 نقيضًا لما يرونه ذكاءً اصطناعيًا «مستيقظًا» ومفرط الحذر، يحد من النقاش حول الموضوعات الحساسة. وبالنسبة إلى هؤلاء المستخدمين، يقدم Grok 2.0 منصة تبدو أقل تقييدًا بالأعراف المجتمعية.
جرّب FLUX.1 وGrok 2.0 بنفسك#
توجد عدة خيارات لتجربة FLUX.1 وGrok 2.0. ويمكن الوصول إلى FLUX.1 مباشرةً من خلال منصات الذكاء الاصطناعي، مثل Hugging Face وReplicate وFal.ai. أما Grok 2.0، فلا يتاح إلا للمشتركين في X Premium وPremium+.
أهم النقاط المستخلصة#
يدفع FLUX.1 وGrok 2.0 حدود الذكاء الاصطناعي إلى الأمام ويحفزان محادثات ثرية. فقد وضع FLUX.1 معيارًا جديدًا في الصور المُنشأة بالذكاء الاصطناعي بفضل قدرته على إنتاج صور شديدة التفاصيل والواقعية. ويستخدم Grok 2.0 FLUX.1 لتعزيز قدراته بما يتجاوز التفاعلات القائمة على النصوص فحسب. فمن جهة، يشعر المتحمسون بحماس كبير إزاء الحرية الإبداعية والاستكشاف غير الخاضع للرقابة اللذين توفرهما هاتان الأداتان. ومن جهة أخرى، يطلق المنتقدون تحذيرات بشأن مخاطر المعلومات المضللة والتزييف العميق والآثار الأخلاقية لهذه القدرات غير المنظمة على منصة مؤثرة مثل X. ومع تطور FLUX.1 وGrok 2.0، يقفان في قلب نقاش حول الحرية والإبداع والمسؤولية في العصر الرقمي، وهو نقاش من المرجح أن يشكل مستقبل الذكاء الاصطناعي لسنوات قادمة.
لمعرفة المزيد عن Ultralytics، اطلع على مستودعنا على GitHub، وانضم إلى مجتمعنا، واستكشف أحدث حلولنا للذكاء الاصطناعي في قطاعات مثل الرعاية الصحية والتصنيع! 🚀









