Image Captioning
تعرف على كيفية استخدام التعليق على الصور لنماذج الرؤية واللغة لتوليد وصف للصور، واستكشف التطبيقات الواقعية، واربط التعليقات بالأرض باستخدام Ultralytics YOLO26.
التعليق على الصور هو مهمة في الذكاء الاصطناعي تولد تلقائياً وصفاً باللغة الطبيعية للصورة. على سبيل المثال، بالنظر إلى صورة لشارع، قد ينتج النظام: "حافلة مدينة تقود بجانب المشاة في تقاطع طرق." تدمج المهمة الإدراك البصري مع توليد اللغة، لذلك يجب على النموذج تحديد المحتوى المهم، وفهم العلاقات بين الكائنات، والتعبير عن تلك المعلومات بوضوح.
يتم تنفيذ التعليق عادةً بواسطة نموذج الرؤية واللغة، والذي يعمل عبر البيانات البصرية والنصية. على عكس تعليق الصور المكتوب يدوياً، فإن التعليق المولّد بالذكاء الاصطناعي هو تنبؤ يعتمد على أنماط مستفادة من أزواج الصور والنصوص.
كيف يعمل التعليق على الصور#
عادةً ما يحتوي نظام التعليق على الصور على مرحلتين متصلتين:
- يحول مشفر الرؤية البكسلات إلى تمثيلات ميزات تصف الكائنات، والأنسجة، والمواقع، ومعلومات المشهد الأوسع.
- يحول فاحص اللغة تلك الميزات البصرية إلى تسلسل من الكلمات.
تستخدم العديد من الأنظمة فاحص transformer. يبدأ برمز البدء، ويتنبأ بالرمز التالي، ويضيفه إلى التسلسل، ويكرر ذلك حتى يولد رمز النهاية أو يصل إلى حد الطول. يصف Google Machine Learning Glossary هذه العملية خطوة بخطوة على أنها توليد ذاتي الانحدار.
تساعد آلية الانتباه الفاحص على التركيز على مناطق الصورة ذات الصلة أثناء اختيار كل كلمة. عند توليد "حافلة"، قد تؤكد على المركبة؛ وعند توليد "شارع"، قد تلتفت إلى الطريق المحيط. يوضح TensorFlow image captioning tutorial كيف تتناسب ميزات الصورة، وتقسيم الرموز، والانتباه المتبادل، وفاحص النص معاً.
يتطلب التدريب عموماً صوراً مقترنة بتعليق واحد أو أكثر مكتوب بواسطة بشر. تعليقات متعددة مفيدة لأن نفس الصورة يمكن وصفها بشكل صحيح بطرق مختلفة، مثل "طفل يلعب مع كلب" و"شخص شاب يلقي كرة لحيوان أليف".
الاختلافات عن مهام الرؤية ذات الصلة#
يتداخل التعليق على الصور مع عدة مهام للذكاء الاصطناعي ولكنه ينتج مخرجات مميزة:
- يخصص التصنيف الصوري تسمية واحدة أو أكثر للصورة بأكملها، مثل "شاطئ". يولد التعليق جملة قد تصف الكائنات، والأجراء، والخصائص، والسياق.
- يحدد اكتشاف الكائنات ويحدد مواقع الكائنات المحددة مسبقاً بمربعات التحديد. يمكن للتعليق ذكر تلك الكائنات ولكنه يصف أيضاً علاقاتها، مثل "راكبان دراجات يسيران بجانب سيارة".
- يستخرج التعرف البصري على الحروف الكتابة المرئية من اللوحات، أو المستندات، أو التغليف. يلخص التعليق المشهد بدلاً من نسخ كل النص.
- تستجيب الإجابة على الأسئلة المرئية لسؤال محدد حول صورة. ينشئ التعليق وصفاً عاماً دون الحاجة إلى سؤال.
- يوصل النص البديل غرض الصورة في سياق معين. يمكن للتعليق الآلي توفير مسودة، ولكنه ليس نصاً بدليلاً مناسباً تلقائياً لأن الصور الزخرفية، والوظائفية، والمعقدة تتطلب معاملة مختلفة بموجب W3C Images Tutorial.
تطبيقات العالم الحقيقي#
-
المحتوى الويب القابل للوصول: يمكن لمنصة النشر توليد مسودات أوصاف للصور الفوتوغرافية المحملة حديثاً. بالنسبة لصورة إخبارية، قد يحدد التعليق الأشخاص الرئيسيين، والإعداد، والإجراء قبل أن يتحقق محرر من دقتها وصلتها. لا تزال الرسوم البيانية المعقدة بحاجة إلى وصف طويل منظّم بدلاً من ملخص بصري عام.
-
مكتبات الوسائط القابلة للبحث: يمكن لبائع تجزئة أو شركة وسائل إعلام التعليق على مجموعات الصور الكبيرة وفهرسة النص المولّد. يمكن للمستخدمين بعد ذلك البحث عن عبارات مثل "حقيبة ظهر حمراء بجانب خيمة" حتى عندما لم يتم وضع علامة يدوية على الملفات أبداً. يمكن للتعليقات أن تكمل التضمينات البصرية والبيانات التعريفية، مما يحسن الاكتشاف عبر الكتالوجات الكبيرة.
التأصيل العملي مع Ultralytics YOLO#
يمكن لمولدات التعليق اختراع تفاصيل غير مدعومة، لا سيما في المشاهد المزدحمة أو غير المألوفة. أحد التصاميم العملية هو تأصيل التوليد بملاحظات منظمة من Ultralytics YOLO26. يستخرج YOLO prediction workflow الموثق التالي أسماء الكائنات المكتشفة التي يمكن لمكون لغة أدنى استخدامها كِسياق بصري:
from ultralytics import YOLO
# Detect objects that can ground a downstream caption generator
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detections into compact textual context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)لا ينتج هذا سير العمل التعليق النهائي. بدلاً من ذلك، يوفر تسميات كائنات يمكن التحقق منها والتي يمكن أن تقيد نموذج لغة. للمجالات المخصصة، يدعم Ultralytics Platform تعليق مجموعة بيانات السحابة، والتدريب، والنشر، والمراقبة لمكون الإدراك لسلسلة التعليق.
القيود والتقييم#
قد تحذف التعليقات الكائنات المهمة، أو تخلط بين العلاقات، أو تعيد إنتاج تحيز مجموعة البيانات، أو هلوسة تفاصيل غير مرئية. يمكن لدرجات الثقة أن تساعد في ترتيب أوصاف المرشح، كما هو موضح بواسطة Azure image description API، ولكن الجملة السلسة ليست بالضرورة واقعية.
لذلك يجب أن يفحص التقييم تغطية الكائنات، والتأصيل الواقعي، وسهولة القراءة، والتحيز، والفائدة للجمهور المستهدف. نظراً لأن العديد من التعليقات يمكن أن تكون صحيحة بنفس القدر، يجب على الفرق الجمع بين القياسات الآلية ومراجعة البشر، باتباع ممارسات مثل generative AI evaluation وNIST AI Risk Management Framework الأوسع. يظل موافقة البشر مهمة بشكل خاص لإمكانية الوصول، أو المحتوى الطبي، أو الحرج من حيث السلامة، أو المتاح للجمهور.






