Large Concept Models (LCMs)
تعلّم كيف تعالج نماذج المفاهيم الكبيرة (LCMs) المفاهيم الدلالية، وتقارنها بـ LLMs، وتدعم الذكاء الاصطناعي متعدد اللغات، والتخطيط طويل الأمد، والرؤية الحاسوبية.
نماذج المفاهيم الكبيرة (LCMs) هي نماذج للذكاء الاصطناعي تعالج المعلومات وتولّدها بوصفها وحدات دلالية أعلى مستوى، أو «مفاهيم»، بدلًا من التنبؤ برمز نصي واحد في كل مرة. في نموذج LCM نموذجي، قد يمثّل المفهوم معنى جملة أو ملفوظ أو حدث أو إجراء في صورة متجه رقمي. ويمكن لهذا المنظور القائم على مستوى المفهوم أن يساعد النموذج على تنظيم التسلسلات الطويلة، ونقل المعنى بين اللغات، والاستدلال على الأفكار دون ربط كل خطوة داخلية بصياغة محددة.
كيفية عمل نماذج المفاهيم الكبيرة#
يقسّم نموذج اللغة الكبير التقليدي النص إلى رموز، مثل الكلمات أو الكلمات الفرعية أو علامات الترقيم. ثم يتنبأ النموذج بالرمز التالي بشكل متكرر. ويوضّح دليل تقسيم الرموز في TensorFlow كيفية تقسيم النص إلى هذه الوحدات الصغيرة.
ينقل LCM خطوة النمذجة الرئيسية إلى مستوى أعلى:
- يحوّل المُرمِّز جملة أو وحدة أخرى ذات معنى إلى تضمين—وهو تمثيل رقمي كثيف لمعناها.
- يفحص النموذج تسلسلًا من تضمينات المفاهيم ويتنبأ بتمثيل المفهوم التالي.
- يحوّل فكّ التشفير التمثيل المتنبأ به إلى لغة طبيعية أو كلام أو صيغة إخراج أخرى.
في هذا التصميم، ينبغي أن تشغل الجمل ذات المعاني المتشابهة مناطق متقاربة من الفضاء الكامن للنموذج. وتشرح نظرة Google العامة على التضمينات كيفية التقاط هذه الفضاءات المتجهية للعلاقات، بينما يغطي دليلها حول قياس التشابه بين التضمينات أساليب مثل التشابه الجيبي.
الجملة وكيل عملي للمفهوم، وليست تعريفًا شاملًا. فقد تحتوي الجملة الواحدة على عدة أفكار، بينما قد يمتد مفهوم مهم عبر عدة جمل.
مقارنة LCMs بالنماذج ذات الصلة#
تختلف LCMs أساسًا في دقة بنية تنبؤاتها الداخلية وبنيتها.
- LCMs مقابل نماذج اللغة الكبيرة: تتنبأ LLMs عادةً بالرموز مباشرةً. أما LCMs فتتنبأ بتمثيلات دلالية أعلى مستوى، وتعتمد على مُرمِّزات ومفكِّكات تشفير منفصلة لربط هذه التمثيلات باللغة.
- LCMs مقابل نماذج الرؤية واللغة: تربط VLMs بين المعلومات المرئية واللغوية. وقد يقبل LCM تضمينات مفاهيم مرئية، لكن التنبؤ على مستوى المفهوم لا يجعل النموذج متعدد الوسائط بطبيعته.
- LCMs مقابل نماذج عنق زجاجة المفاهيم: تستخدم نماذج عنق زجاجة المفاهيم سمات صريحة، غالبًا ما تكون معنونة بواسطة البشر، مثل «له أجنحة». أما مفاهيم LCM فهي عمومًا متجهات متعلَّمة، وقد لا تتطابق بوضوح مع سمات مُسمّاة.
- LCMs مقابل نماذج الاتساق الكامن: يستخدم كلاهما الاختصار LCM، لكن نماذج الاتساق الكامن تسرّع عمليات الانتشار التوليدي. ولا صلة لها بنماذج المفاهيم الكبيرة.
يمكن لـ LCMs مع ذلك استخدام بنية Transformer وآليات الانتباه؛ ويتمثل التغيير الرئيسي في ماهية العناصر التي تمثلها السلسلة. وتصف وثائق Transformer في PyTorch البنية العامة لمعالجة التسلسلات التي يمكنها العمل على أنواع مختلفة من التمثيلات.
التطبيقات الواقعية#
التلخيص متعدد اللغات: يمكن لنظام دعم عالمي ترميز تقارير مكتوبة بالإسبانية واليابانية والإنجليزية في فضاء دلالي مشترك، وتنظيم أفكارها الرئيسية، وإنشاء ملخص باللغة الإنجليزية. ويمكن للتمثيلات متعددة اللغات المشتركة أن تضع المعاني المتكافئة متقاربة حتى عندما تختلف صياغتها السطحية، كما يوضّح شرح Meta لـ فضاءات تضمين الجمل متعددة اللغات. وقد يقلل ذلك الاعتماد على ترجمة كل خطوة وسيطة من خطوات الاستدلال.
التخطيط والتوليد طويلَا الصيغة: بدلًا من صياغة تقرير كلمةً تلو الأخرى، يمكن لـ LCM أن ينمذج أولًا تسلسلًا مثل المشكلة والدليل والتحليل والتوصية. ثم يُفك تشفير كل مفهوم متنبأ به إلى جملة واحدة أو عدة جمل. ويشبه ذلك تخطيط مخطط تفصيلي قبل الكتابة، وقد يحسّن الاتساق في تلخيص المستندات أو المحادثات، وهي مهام موصوفة في إرشادات Microsoft لتلخيص النصوص والمحادثات.
ربط نماذج المفاهيم بالرؤية الحاسوبية#
يمكن لنظام قائم على المفاهيم أن يجمع بين الاستدلال بأسلوب LCM واكتشاف الكائنات. ويحدّد نموذج الرؤية عناصر المشهد ذات المعنى، ثم يستدل نموذج لاحق على هذه العناصر بوصفها جزءًا من تسلسل أكبر.
from ultralytics import YOLO
# Load a pretrained visual detector
model = YOLO("yolo26n.pt")
# Extract visual information from an image
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detected classes into simple visual concepts
class_ids = result.boxes.cls.int().tolist()
visual_concepts = sorted({result.names[index] for index in class_ids})
print(visual_concepts)ينتج سير العمل هذا باستخدام YOLO26 تسميات مثل «حافلة» و«شخص». ولا يحوّل ذلك YOLO إلى LCM؛ بل يوضح كيف يمكن لـ الرؤية الحاسوبية توفير أدلة مرئية منظّمة لنظام استدلال على مستوى المفهوم. ويمكن للفرق استخدام Ultralytics Platform لوَسْم مجموعات البيانات المرئية، وتدريب النماذج، ونشرها، ومراقبة مكونات الإدراك هذه.
الفوائد والقيود والتقييم#
قد تكون التسلسلات على مستوى المفهوم أقصر من تسلسلات الرموز، وتدعم نقل المعرفة بين اللغات، وتفصل التخطيط الدلالي عن الصياغة السطحية. غير أن ضغط جملة في متجه واحد قد يؤدي إلى فقدان الأسماء أو الأرقام أو النفي أو التفاصيل المكانية أو القيود الدقيقة. وقد تنتج أخطاء فك التشفير لغةً سليمة لا تتطابق بدقة مع المفهوم المتنبأ به.
لذلك ينبغي أن يختبر التقييم العملي الجودة الدلالية ودقة المخرجات النهائية معًا. وينبغي للفرق قياس الاتساق متعدد اللغات، والحفاظ على الحقائق، والاتساق في السياقات الطويلة، وزمن الاستجابة، والسلوك عند المدخلات الملتبسة. كما ينبغي لعمليات النشر عالية التأثير أن تتبع عملية حوكمة منظّمة مثل إطار NIST لإدارة مخاطر الذكاء الاصطناعي، مع مراجعة بشرية ومراقبة ملائمتين للتطبيق.









