GPT (Generative Pre-trained Transformer)
استكشف أساسيات GPT (المحوّل التوليدي المدرّب مسبقًا). تعرّف على كيفية عمل هذه النماذج وكيفية دمجها مع Ultralytics YOLO26 للرؤية.
يشير GPT (المحوّل التوليدي المُدرَّب مسبقًا) إلى عائلة من نماذج الشبكات العصبية المصممة لتوليد نصوص شبيهة بالنصوص البشرية وحل المهام المعقدة من خلال التنبؤ بالعنصر التالي في تسلسل ما. تُبنى هذه النماذج على بنية Transformer، وتستخدم تحديدًا كتل وحدة فك الترميز التي تتيح لها معالجة البيانات بالتوازي بدلًا من معالجتها بالتتابع. ويشير جانب «التدريب المسبق» إلى خضوع النموذج لمرحلة أولية من التعلّم غير الخاضع للإشراف على مجموعات بيانات ضخمة تشمل الكتب والمقالات والمواقع الإلكترونية، وذلك لتعلّم البنية الإحصائية للغة. أما «التوليدي» فيشير إلى القدرة الأساسية للنموذج: إنشاء محتوى جديد بدلًا من تصنيف المدخلات الموجودة فحسب.
البنية الأساسية والوظائف#
في صميم نموذج GPT توجد آلية الانتباه، وهي تقنية رياضية تتيح للشبكة ترجيح أهمية الكلمات المختلفة في الجملة بالنسبة إلى بعضها بعضًا. وتمكّن هذه الآلية النموذج من فهم السياق والفروق الدقيقة والتبعيات بعيدة المدى، مثل إدراك أن ضميرًا في نهاية فقرة يشير إلى اسم ذُكر في بدايتها.
بعد التدريب المسبق الأولي، تخضع هذه النماذج عادةً إلى الضبط الدقيق لتخصيصها لمهام محددة أو مواءمتها مع القيم الإنسانية. وغالبًا ما تُستخدم تقنيات مثل التعلّم بالتعزيز من الملاحظات البشرية (RLHF) لضمان إنتاج النموذج استجابات آمنة ومفيدة ودقيقة. وهذه العملية المؤلفة من خطوتين—التدريب المسبق العام يتبعه ضبط دقيق محدد—هي ما يجعل نماذج GPT نماذج تأسيسية متعددة الاستخدامات.
التطبيقات الواقعية#
انتقلت نماذج GPT من نطاق البحث النظري إلى أدوات عملية تُستخدم يوميًا في مختلف القطاعات.
- مساعدو البرمجة الأذكياء: يستخدم المطورون أدوات مدعومة بتقنية GPT لكتابة البرمجيات وتصحيح أخطائها وتوثيقها. وتُحلّل هذه العوامل الذكية للذكاء الاصطناعي سياق مستودع الشيفرة البرمجية لاقتراح دوال كاملة أو تحديد الأخطاء، ما يسرّع دورة حياة التطوير بدرجة كبيرة.
- أتمتة خدمة العملاء: تستفيد روبوتات المحادثة الحديثة من GPT للتعامل مع استفسارات العملاء المعقدة. وعلى خلاف الأنظمة الأقدم القائمة على القواعد، تستطيع هذه المساعدات الافتراضية فهم النية والحفاظ على سجل المحادثة وإنشاء استجابات مخصصة في الوقت الفعلي.
دمج GPT مع الرؤية الحاسوبية#
مع أن GPT يتفوق في معالجة اللغة الطبيعية (NLP)، فإنه يُدمج كثيرًا مع الرؤية الحاسوبية (CV) لإنشاء أنظمة متعددة الوسائط. ويتضمن سير العمل الشائع استخدام كاشف سريع مثل Ultralytics YOLO26 لتحديد الكائنات في صورة، ثم تمرير ذلك الناتج المنظم إلى نموذج GPT لإنشاء سرد وصفي.
يوضح المثال التالي كيفية استخراج أسماء الكائنات باستخدام Ultralytics YOLO26 لإنشاء سلسلة سياق لمطالبة GPT:
from ultralytics import YOLO
# Load the YOLO26 model (optimized for speed and accuracy)
model = YOLO("yolo26n.pt")
# Perform inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to construct a text description
class_names = [model.names[int(cls)] for cls in results[0].boxes.cls]
# This string serves as the context for a GPT prompt
print(f"Detected objects for GPT context: {', '.join(class_names)}")المفاهيم ذات الصلة والتمييز بينها#
من المفيد التمييز بين GPT والبنى الشائعة الأخرى لفهم دوره المحدد.
- GPT مقابل BERT: يستخدم كلاهما بنية Transformer، لكنهما يختلفان في الاتجاهية. يُعد BERT (تمثيلات المُرمِّز ثنائية الاتجاه من المحوّلات) نموذجًا يقتصر على المُرمِّز، وينظر إلى السياق من اليسار واليمين في الوقت نفسه، ما يجعله مثاليًا لمهام مثل التصنيف وتحليل المشاعر. أما GPT فهو نموذج يقتصر على مُفكِّك الترميز، ويتنبأ بالرمز التالي استنادًا إلى الرموز السابقة، ما يجعله مُحسّنًا لـتوليد النصوص.
- GPT مقابل LLM: يُعد مصطلح النموذج اللغوي الكبير (LLM) فئةً واسعة من النماذج الضخمة المدرَّبة على كميات هائلة من النصوص. وGPT بنية محددة وعلامة تجارية لنموذج LLM، وقد طوّرته على نحو بارز شركة OpenAI.
التحديات والتوقعات المستقبلية#
رغم قدراتها المذهلة، تواجه نماذج GPT تحديات مثل الهلوسة، حيث تنشئ معلومات زائفة بثقة. ويعمل الباحثون بنشاط على تحسين أخلاقيات الذكاء الاصطناعي وبروتوكولات السلامة. علاوة على ذلك، يتيح دمج GPT مع أدوات مثل منصة Ultralytics إنشاء مسارات عمل أكثر متانة، حيث تعمل نماذج الرؤية واللغة بتآزر لحل مشكلات معقدة في العالم الحقيقي.









