Diffusion Language Models
تعلّم كيف تنشئ نماذج اللغة بالانتشار النصوص وتحرّرها من خلال إزالة الضوضاء التكرارية، مع رؤى حول المحوّلات والتطبيقات والفوائد والقيود.
نماذج اللغة بالانتشار هي نماذج توليدية تنتج النصوص أو تحررها من خلال إزالة الضوضاء تدريجيًا، بدلًا من توليد كل رمز بصرامة من اليسار إلى اليمين. وتبدأ بتسلسل تالف—غالبًا ما يحتوي على رموز مقنّعة أو مستبدلة أو غير مؤكدة—ثم تُحسِّن مواضع متعددة بشكل متكرر حتى يصبح النص متماسكًا. ويجمع هذا النهج بين أفكار من نمذجة اللغة ونماذج الانتشار، مقدمًا بديلًا للتوليد التقليدي للرمز التالي.
كيفية عمل نماذج اللغة بالانتشار#
يُقسَّم النص أولًا من خلال تجزئة الرموز إلى كلمات أو كلمات فرعية أو محارف أو وحدات منفصلة أخرى. وأثناء التدريب، تزيل عملية إفساد أمامية المعلومات تدريجيًا من تسلسلات الرموز. وبحسب التنفيذ، قد تُستبدل الرموز برموز قناع، أو ببدائل مُختارة بالعينات، أو بتمثيلات مستمرة مشوشة تُسمى التضمينات.
يتعلم النموذج العملية العكسية: التنبؤ بإصدارات أنقى من التسلسلات التالفة. وأثناء الاستدلال، يبدأ بكتلة مقنّعة أو مشوشة بدرجة كبيرة وينفذ عدة خطوات للتحسين. وتحدد الخطوات المبكرة المعنى والبنية العامين، بينما تصحح الخطوات اللاحقة المفردات والقواعد والتنسيق والاتساق المحلي.
تستخدم العديد من نماذج اللغة بالانتشار نموذج Transformer لمعالجة التسلسل. وتناسب نماذج Transformer هذه المهمة جيدًا لأن آلية الانتباه فيها تستطيع ربط كل رمز بالسياق المحيط به. وتقدم وثائق Transformer في PyTorch نظرة عامة مفيدة على هذه البنية الأساسية.
بخلاف نظام ثابت لملء الفراغات، يمكن لتوليد الانتشار إعادة النظر في التنبؤات بشكل متكرر. فالرمز الذي يُختار أثناء إحدى الخطوات ليس بالضرورة نهائيًا؛ إذ قد تراجعه التكرارات اللاحقة عندما يوفر باقي التسلسل سياقًا أفضل. وتوضح نظرة Google DeepMind العامة حول انتشار النصوص نمط التوليد التكراري على مستوى الكتل هذا.
نماذج الانتشار مقارنةً بالمفاهيم ذات الصلة#
تصف عدة مصطلحات مترابطة عن كثب أهدافًا أو بنيات مختلفة:
- تُولِّد نماذج اللغة الكبيرة الانحدارية الذاتية الرموز بالتتابع، بحيث يعتمد كل تنبؤ على المخرجات السابقة. وتتجلى هذه العملية السببية في البرنامج التعليمي لتوليد النص الانحداري الذاتي من TensorFlow. أما نماذج الانتشار فيمكنها بدلًا من ذلك تحديث مواضع متعددة أثناء كل خطوة تحسين.
- تتنبأ نماذج اللغة المقنّعة بالرموز المخفية عمدًا باستخدام السياق على جانبيها. ويوضح مثال نمذجة اللغة المقنّعة في Keras هدف التدريب هذا. وتوسع نماذج اللغة بالانتشار هذه الفكرة لتصبح عملية توليد كاملة ذات مستويات متعددة من الإفساد وتكرارات لإزالة الضوضاء.
- إن Stable Diffusion نظام لتوليد الصور، وليس نموذج لغة كبيرًا. وتُولِّد خدمات Stable Diffusion للصور من Stability AI المحتوى المرئي وتحرره، بينما تعمل نماذج اللغة بالانتشار على رموز النص أو تمثيلاتها.
- يصف Diffusion Transformers استخدام نماذج Transformer داخل أنظمة الانتشار، عادةً لتوليد الصور أو الفيديو. ويُعرَّف نموذج اللغة بالانتشار من خلال هدفه في توليد النص، وليس من خلال بنية شبكته العصبية وحدها.
التطبيقات الواقعية#
يتمثل أحد التطبيقات العملية في تحرير المستندات والتعليمات البرمجية. فبدلًا من إلحاق النص بعد المؤشر، يستطيع نموذج اللغة بالانتشار تحسين مسودة كاملة أو مقطع محدد. فعلى سبيل المثال، قد يعيد بناء دالة مفقودة مع مراجعة أسماء المتغيرات وعمليات الاستيراد والتعليقات عبر الكتلة. وتُعد القدرة على استخدام السياق السابق واللاحق معًا قيّمة عندما تؤثر التصحيحات في أحد المواضع على موضع آخر.
يتمثل تطبيق ثانٍ في التحليل متعدد الوسائط. إذ يستطيع نظام رؤية استخراج معلومات واقعية من صورة، وبعد ذلك يمكن لنموذج لغة بالانتشار صياغة تقرير أو تسمية توضيحية أو استجابة مستندة إلى تلك الملاحظات بشكل تكراري. فعلى سبيل المثال، قد يحدد اكتشاف الكائنات المركبات والأشخاص في مشهد مروري قبل أن يصوغ مكوّن اللغة ملخصًا للحادث.
يستخدم سير العمل التالي Ultralytics YOLO26 لإنشاء سياق مرئي منظم لتوليد اللغة في المراحل اللاحقة:
from ultralytics import YOLO
# Run object detection on a sample image
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detections into compact language-model context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)يعيد سير عمل التنبؤ في YOLO مخرجات منظمة، بينما يحول الطريقة Results.summary() الاكتشافات إلى قواميس يسهل تمريرها إلى خط أنابيب اللغة. ويتيح هذا الفصل لنموذج الرؤية تقديم ملاحظات مؤسسة على الأدلة، بينما يتولى نموذج اللغة الصياغة التكرارية.
الفوائد والقيود والإرشادات العملية#
يمكن لنماذج اللغة بالانتشار اقتراح رموز متعددة بالتوازي، ومراجعة الاختيارات السابقة، ودعم الإكمال الداخلي أو التحرير المقيد بصورة طبيعية. غير أن التنبؤ المتوازي لا يضمن انخفاض زمن الاستجابة من البداية إلى النهاية؛ إذ لا يزال التوليد يتطلب عدة خطوات لإزالة الضوضاء، وتعتمد السرعة على طول التسلسل وحجم النموذج والعتاد واستراتيجية أخذ العينات.
والنص منفصل أيضًا، مما يجعل إفساده التدريجي أقل طبيعية من إضافة الضوضاء إلى وحدات بكسل الصورة المستمرة. وقد تنتج الأنظمة المُهيَّأة على نحو سيئ تكرارًا، أو تحذف تفاصيل مطلوبة، أو تغيّر نصًا صحيحًا دون داعٍ، أو تواجه صعوبة في تحديد طول المخرجات.
ينبغي للفرق تقييم دقة المهمة والواقعية والاستقرار أثناء التحرير وزمن الاستجابة واستخدام الموارد على مطالبات تمثيلية. وتوصي إرشادات Google Cloud بشأن تقييم الذكاء الاصطناعي التوليدي بالجمع بين المقاييس الآلية والتقييم البشري، لأن جودة اللغة تعتمد على السياق. كما ينبغي لعمليات النشر عالية التأثير اتباع عملية منظمة مثل إطار NIST لإدارة مخاطر الذكاء الاصطناعي.
بالنسبة إلى التطبيقات المرئية، تدعم Ultralytics Platform وسم مجموعات البيانات وتدريب النماذج ونشرها ومراقبتها، مما يساعد الفرق على بناء مكوّن الإدراك الذي يمكنه تأسيس سير عمل اللغة القائم على الانتشار في المراحل اللاحقة.






