Image Captioning
ينشئ وصف الصور وصفًا باللغة الطبيعية للصورة باستخدام نماذج الرؤية واللغة. ويغطي الاستخدامات والقيود وإرساء الأوصاف باستخدام YOLO.
توليد وصف للصور هو مهمة في الذكاء الاصطناعي تنشئ تلقائيًا وصفًا باللغة الطبيعية للصورة. فمثلًا، قد ينتج نظام ما عن صورة شارع العبارة: «حافلة في المدينة تمر بجوار مشاة عند تقاطع». تجمع هذه المهمة بين الإدراك البصري وتوليد اللغة، لذا يجب على النموذج تحديد المحتوى المهم وفهم العلاقات بين الكائنات والتعبير عن تلك المعلومات بوضوح.
يُنفّذ توليد الأوصاف عادةً بواسطة نموذج للرؤية واللغة يعمل على البيانات المرئية والنصية. وعلى خلاف الوصف الذي يكتبه شخص يدويًا للصورة، فإن الوصف الذي يولّده الذكاء الاصطناعي هو تنبؤ يستند إلى أنماط تعلّمها من أزواج الصور والنصوص.
آلية عمل توليد أوصاف الصور#
يتألف نظام توليد أوصاف الصور عادةً من مرحلتين مترابطتين:
- يحوّل مُرمّز الرؤية وحدات البكسل إلى تمثيلات للسمات تصف الكائنات والأنسجة والمواضع والمعلومات العامة عن المشهد.
- يحوّل مُفكّك ترميز اللغة السمات المرئية إلى سلسلة من الكلمات.
تستخدم أنظمة كثيرة مُفكِّك ترميز من نوع Transformer. يبدأ برمز بداية، ويتنبأ بالرمز التالي، ويضيفه إلى التسلسل، ويكرر ذلك حتى ينتج رمز نهاية أو يبلغ حدًا للطول. وتُسمى هذه العملية، التي تتم رمزًا تلو الآخر، التوليد ذاتي الانحدار.
تبدو دورة المُرمِّز ومُفكِّك الترميز كاملةً كما يلي:
تساعد آلية الانتباه مُفكِّك الترميز على التركيز على مناطق الصور ذات الصلة أثناء اختيار كل كلمة. فعند توليد كلمة «حافلة»، قد يركز على المركبة؛ وعند توليد كلمة «شارع»، قد ينتبه إلى الطريق المحيط بها. ويجمع نموذج شامل لوصف الصور بين ميزات الصورة والتقسيم إلى رموز والانتباه المتقاطع ومُفكِّك ترميز النص.
يتطلب التدريب عمومًا صورًا مقرونة بوصف واحد أو أكثر من كتابة البشر. وتفيد الأوصاف المتعددة لأن الصورة نفسها يمكن وصفها بطرق مختلفة وصحيحة، مثل «طفل يلعب مع كلب» و«شخص صغير يرمي كرة لحيوان أليف».
الاختلافات عن مهام الرؤية ذات الصلة#
يتداخل توليد أوصاف الصور مع عدة مهام في الذكاء الاصطناعي، لكنه ينتج مخرجات متميزة:
- تصنيف الصور يسند تسمية واحدة أو أكثر إلى الصورة بأكملها، مثل «شاطئ». أما وصف الصور فيولّد جملة قد تصف الأجسام والأفعال والسمات والسياق.
- يحدد كشف الأجسام الأجسام المحددة مسبقًا ويحدد مواقعها باستخدام مربعات الإحاطة. وقد يذكر وصف الصور تلك الأجسام، لكنه يصف أيضًا العلاقات بينها، مثل «راكبان لدراجتين يسيران بجانب سيارة».
- يستخرج التعرّف الضوئي على المحارف الكتابة الظاهرة على اللافتات أو المستندات أو العبوات. أما الوصف فيلخص المشهد بدلًا من نسخ جميع النصوص.
- تجيب الإجابة عن الأسئلة المرئية عن سؤال محدد حول صورة. أما توليد الأوصاف فينشئ وصفًا عامًا من دون الحاجة إلى سؤال.
- ينقل النص البديل الغرض من الصورة في سياق معين. ويمكن للوصف الآلي أن يقدم مسودة، لكنه لا يصلح تلقائيًا نصًا بديلًا، لأن الصور الزخرفية والوظيفية والمعقدة تتطلب معاملة مختلفة وفقًا لـالدرس التعليمي للصور من W3C.
تطبيقات عملية#
-
محتوى ويب ميسّر: يمكن لمنصة نشر إنشاء أوصاف أولية للصور المُحمّلة حديثًا. ففي صورة إخبارية، قد يحدد الوصف الأشخاص الرئيسيين والمكان والحدث قبل أن يراجعه محرر للتحقق من دقته وملاءمته. أما المخططات المعقدة، فتحتاج إلى وصف مطوّل ومنظّم بدلًا من ملخص بصري عام.
-
مكتبات وسائط قابلة للبحث: يمكن لبائع تجزئة أو شركة إعلامية إنشاء أوصاف لمجموعات كبيرة من الصور وفهرسة النص الناتج. وعندئذٍ يستطيع المستخدمون البحث بعبارات مثل «حقيبة ظهر حمراء بجوار خيمة»، حتى إن لم تُوسم الملفات يدويًا مطلقًا. ويمكن للأوصاف أن تكمل التضمينات المرئية والبيانات الوصفية، فتحسّن البحث في الفهارس الكبيرة.
الإرساء العملي باستخدام Ultralytics YOLO#
قد تختلق مولدات الأوصاف تفاصيل لا تدعمها الصورة، ولا سيما في المشاهد المزدحمة أو غير المألوفة. ومن الأساليب العملية إرساء عملية التوليد بملاحظات منظّمة من Ultralytics YOLO26. يستخرج سير عمل التنبؤ في YOLO الموثّق أدناه أسماء الكائنات المكتشفة، لتستخدمها لاحقًا مكوّنات اللغة سياقًا بصريًا:
from ultralytics import YOLO
# اكتشف الكائنات التي يمكنها إرساء مولّد أوصاف لاحق
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# حوّل الاكتشافات إلى سياق نصي موجز
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)لا ينتج عن سير العمل هذا الوصف النهائي. بل يوفّر تسميات موثّقة للكائنات، يمكنها تقييد نموذج اللغة. وبالنسبة إلى المجالات المخصصة، تدعم منصة Ultralytics وسم مجموعات البيانات السحابية والتدريب والنشر والمراقبة لمكوّن الإدراك في مسار توليد الأوصاف.
القيود والتقييم#
قد تحذف الأوصاف أجسامًا مهمة، أو تخلط بين العلاقات، أو تعيد إنتاج تحيز مجموعة البيانات، أو تهلوس تفاصيل غير مرئية. ويمكن لدرجات الثقة، مثل تلك التي يعيدها واجهة برمجة تطبيقات وصف الصور، أن تساعد في ترتيب الأوصاف المرشحة، لكن الجملة السلسة ليست بالضرورة صحيحة.
لذلك، ينبغي أن يفحص التقييم تغطية الكائنات والإرساء إلى الحقائق وسهولة القراءة والتحيز والفائدة للجمهور المستهدف. ولأن عدة أوصاف قد تكون صحيحة بالقدر نفسه، ينبغي للفرق الجمع بين القياسات الآلية والمراجعة البشرية، واتباع ممارسات مثل تقييم الذكاء الاصطناعي التوليدي وإطار NIST لإدارة مخاطر الذكاء الاصطناعي الأوسع نطاقًا. ويظل الاعتماد البشري بالغ الأهمية للمحتوى المتعلق بإمكانية الوصول أو الطب أو السلامة الحرجة أو الموجّه للجمهور.










