Diffusion Language Models
تعرف على كيفية توليد نماذج لغات الانتشار للنصوص وتعديلها من خلال إزالة التشويش التكرارية، مع رؤى حول المحولات وتبيقاتها وفوائدها وقيودها.
نماذج لغة الانتشار هي نماذج توليدية تنتج النص أو تعدله من خلال إزالة التشويش التكراري بدلاً من توليد كل رمز بدقة من اليسار إلى اليمين. تبدأ بتسلسل تالف - وغالباً ما يحتوي على رموز محجوبة أو مستبدلة أو غير مؤكدة - وتقوم بتنقيح مواضع متعددة بشكل متكرر حتى يصبح النص متسقاً. يجمع هذا النهج بين أفكار من نمذجة اللغة ونماذج الانتشار، مما يقدم بديلاً لتوليد الرمز التالي التقليدي.
Link to this sectionكيف تعمل نماذج لغة الانتشار#
يتم تقسيم النص أولاً من خلال الترميز إلى كلمات أو كلمات فرعية أو أحرف أو وحدات منفصلة أخرى. وأثناء التدريب، تزيل عملية التالف الأمامي المعلومات تدريجياً من تسلسلات الرموز. اعتماداً على التنفيذ، قد يتم استبدال الرموز برموز الحجب، أو البدائل المأخوذة عشوائياً، أو التمثيلات المستمرة المليئة بالتشويش والمعروفة بالتضمينات.
يتعلم النموذج العملية العكسية: التنبؤ بنسخ أنظف للتسلسلات التالفة. وفي وقت الاستدلال، يبدأ بكتلة محجوبة أو مشوشة بشدة ويجري عدة خطوات تنقيح. تؤسس الخطوات المبكرة المعنى والهيكل العامين، بينما تصحح الخطوات اللاحقة المفردات والقواعد والتنسيق والاتساق المحلي.
تستخدم العديد من نماذج لغة الانتشار محول لمعالجة التسلسل. تعد المحولات مناسبة تماماً لهذه المهمة لأن آلية الانتباه الخاصة بها يمكنها ربط كل رمز بالسياق المحيط. توفر وثائق PyTorch Transformer نظرة عامة مفيدة لهذه البنية الأساسية.
على عكس نظام ملء الفراغات الثابت، يمكن لتوليد الانتشار إعادة النظر في التنبؤات بشكل متكرر. الرمز المحدد خلال خطوة واحدة ليس بالضرورة دائماً؛ فقد تراجعه التكرارات اللاحقة عندما يوفر باقي التسلسل سياقاً أفضل. توضح نظرة عامة على انتشار النص من Google DeepMind نمط التوليد التكراري القائم على الكتل هذا.
Link to this sectionنماذج الانتشار مقابل المفاهيم ذات الصلة#
تصف عدة مصطلحات شديدة الصلة أهدافاً أو هياكل مختلفة:
- نماذج اللغات الكبيرة ذاتية الانحدار تولد الرموز في تسلسل، مع شرط كل تنبؤ بالمخرجات السابقة. يتم توضيح هذه العملية السببية في الدرس التعليمي لتوليد النصوص ذاتية الانحدار الخاص بـ TensorFlow. وبدلاً من ذلك، يمكن لنماذج الانتشار تحديث العديد من المواضع خلال كل خطوة تنقيح.
- نماذج اللغة المحجوبة تتنبأ بالرموز المخفية عمداً باستخدام السياق على كلا الجانبين. يوضح مثال نمذجة اللغة المحجوبة في Keras هدف التدريب هذا. توسع نماذج لغة الانتشار الفكرة لتصبح عملية توليد كاملة مع مستويات تلف متعددة وتكرارات إزالة تشويش.
- Stable Diffusion هو نظام لتوليد الصور، وليس نموذج لغة كبير. تولد خدمات صور Stable Diffusion التابعة لشركة Stability AI المحتوى البصري وتحرره، بينما تعمل نماذج لغة الانتشار على رموز النص أو تمثيلاتها.
- محولات الانتشار تصف استخدام المحولات داخل أنظمة الانتشار، عادةً لتوليد الصور أو الفيديو. يتم تعريف نموذج لغة الانتشار من خلال هدف توليد النصوص الخاص به، وليس فقط من خلال بنية الشبكة العصبية الخاصة به.
Link to this sectionتطبيقات العالم الحقيقي#
أحد التطبيقات الملموسة هو تحرير المستندات والرموز البرمجية. بدلاً من إلحاق النص بعد المؤشر، يمكن لنموذج لغة الانتشار تنقيح مسودة بأكملها أو نطاق محدد. على سبيل المثال، قد يعيد بناء دالة مفقودة أثناء مراجعة أسماء المتغيرات، وواردات الحزم، والتعليقات عبر الكتلة. تعد القدرة على استخدام كل من السياق السابق واللاحق قيمة عندما تؤثر التصحيحات في مكان ما على مكان آخر.
التطبيق الثاني هو التحليل متعدد الوسائط. يمكن لنظام الرؤية استخراج معلومات واقعية من صورة، وبعد ذلك يمكن لنموذج لغة الانتشار صياغة تقرير أو شرح أو رد بشكل تكراري مستند إلى تلك الملاحظات. على سبيل المثال، قد يحدد اكتشاف الكائنات المركبات والأشخاص في مشهد مروري قبل أن يصوغ مكون اللغة ملخصاً للحوادث.
يستخدم سير العمل التالي Ultralytics YOLO26 لإنشاء سياق بصري منظم لتوليد اللغة في المراحل اللاحقة:
from ultralytics import YOLO
# Run object detection on a sample image
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detections into compact language-model context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)يعيد سير عمل تنبؤ YOLO مخرجات منظمة، بينما تحول طريقة Results.summary() الاكتشافات إلى قواميس يسهل تمريرها إلى خط أنابيب لغوي. يتيح هذا الفصل لنموذج الرؤية توفير ملاحظات قائمة على الواقع بينما يتعامل نموذج اللغة مع التركيب التكراري.
Link to this sectionالفوائد والقيود والتوجيهات العملية#
يمكن لنماذج لغة الانتشار اقتراح رموز متعددة بشكل متوازٍ، ومراجعة الخيارات السابقة، ودعم الملء أو التحرير المقيد بشكل طبيعي. ومع ذلك، لا يضمن التنبؤ المتوازي تقليل زمن الوصول الشامل: ما زالت عملية التوليد تتطلب خطوات متعددة لإزالة التشويش، وتعتمد السرعة على طول التسلسل، وحجم النموذج، والعتاد، وستراتيجية أخذ العينات.
النص منفصل أيضاً، مما يجعل التلف التدريجي أقل طبيعية من إضافة التشويش إلى بكسلات الصور المستمرة. قد تنتج الأنظمة سيئة التكوين تكراراً، أو تغفل التفاصيل المطلوبة، أو تغير النص الصحيح بلا داعٍ، أو تواجه صعوبة في تحديد طول المخرجات.
يجب على الفرق تقييم دقة المهام، وصحة الحقائق، واستقرار التحرير، وزمن الوصول، واستخدام الموارد على موجهات تمثيلية. توصي توجيهات Google Cloud بشأن تقييم الذكاء الاصطناعي التوليدي بالجمع بين المقاييس الآلية والتقييم البشري نظراً لأن جودة اللغة تعتمد على السياق. يجب أن تتبع عمليات النشر عالية التأثير أيضاً عملية منظمة مثل إطار عمل إدارة مخاطر الذكاء الاصطناعي من NIST.
بالنسبة للتطبيقات المرئية، تدعم منصة Ultralytics Platform تعليق مجموعات البيانات، وتدريب النموذج، والنشر، والمراقبة، مما يساعد الفرق على بناء مكون الإدراك الذي يمكنه ترسيخ سير عمل اللغة المستند إلى الانتشار في المراحل اللاحقة.






