Vector Database
اكتشف كيف تدير قواعد البيانات المتجهية التضمينات عالية الأبعاد للاسترجاع الدلالي. تعرّف على كيفية تشغيل تطبيقات الذكاء الاصطناعي باستخدام Ultralytics YOLO26 والبحث عن التشابه.
قاعدة بيانات المتجهات هي نظام تخزين متخصص مصمم لإدارة بيانات المتجهات عالية الأبعاد وفهرستها والاستعلام عنها، وغالبًا ما يُشار إليها باسم التضمينات. وعلى خلاف قاعدة البيانات العلائقية التقليدية، التي تنظم البيانات المهيكلة في صفوف وأعمدة لمطابقة الكلمات المفتاحية بدقة، تُحسَّن قاعدة بيانات المتجهات للاسترجاع الدلالي. وهي تمكّن الأنظمة الذكية من العثور على نقاط بيانات متشابهة من الناحية المفاهيمية بدلًا من أن تكون متطابقة. وتُعد هذه الإمكانية أساسية للبنية التحتية الحديثة لـالذكاء الاصطناعي (AI)، إذ تتيح للتطبيقات معالجة البيانات غير المهيكلة—مثل الصور والصوت والفيديو والنص—وفهمها من خلال تحليل العلاقات الرياضية بينها. وتعمل قواعد البيانات هذه بمثابة ذاكرة طويلة الأمد للوكلاء الأذكياء، فتيسّر مهامًا مثل البحث المرئي والتوصيات المخصصة.
كيفية عمل قواعد بيانات المتجهات#
تتمحور وظيفة قاعدة بيانات المتجهات حول مفهوم فضاء المتجهات، حيث تُعيَّن عناصر البيانات على هيئة نقاط في نظام إحداثيات متعدد الأبعاد. وتبدأ العملية بـاستخراج السمات، إذ يحوّل نموذج التعلم العميق (DL) المدخلات الأولية إلى متجهات رقمية.
-
الاستيعاب: تعالج شبكة عصبية البيانات، مثل YOLO26 المتطور، لإنشاء التضمينات. وتضغط هذه المتجهات المعنى الدلالي للمدخل في قائمة كثيفة من أعداد الفاصلة العائمة.
-
الفهرسة: لضمان انخفاض زمن استجابة الاستدلال أثناء الاسترجاع، تنظم قاعدة البيانات هذه المتجهات باستخدام خوارزميات متخصصة. وتتيح تقنيات مثل العالم الصغير القابل للملاحة هرميًا (HNSW) أو فهرس الملفات المعكوسة (IVF) للنظام التنقل بكفاءة بين مليارات المتجهات من دون فحص كل إدخال على حدة.
-
الاستعلام: عندما يرسل المستخدم استعلام بحث (مثل صورة لنمط حذاء محدد)، يحوّل النظام الاستعلام إلى متجه ويحسب قربه من المتجهات المخزنة باستخدام مقاييس مسافة مثل التشابه الجيبي أو المسافة الإقليدية.
-
الاسترجاع: تُعيد قاعدة البيانات «أقرب الجيران»، الذين يمثلون النتائج الأكثر صلة بالسياق.
يوضح مقطع Python التالي كيفية إنشاء التضمينات باستخدام نموذج ultralytics قياسي، وهي الخطوة الأساسية السابقة لملء قاعدة بيانات المتجهات.
from ultralytics import YOLO
# Load a pre-trained YOLO26 classification model
model = YOLO("yolo26n-cls.pt")
# Generate feature embeddings for an image file
# The 'embed' method creates the vector representation needed for the database
results = model.embed("https://ultralytics.com/images/bus.jpg")
# Output the shape of the resulting embedding vector
print(f"Embedding vector shape: {results[0].shape}")التطبيقات الواقعية#
تُعد قواعد بيانات المتجهات المحرك وراء العديد من تطبيقات الرؤية الحاسوبية (CV) ومعالجة اللغة الطبيعية (NLP) المتقدمة المستخدمة حاليًا في بيئات المؤسسات.
- التوليد المعزز بالاسترجاع (RAG): في عصر الذكاء الاصطناعي التوليدي، تتيح قواعد بيانات المتجهات لـالنماذج اللغوية الكبيرة (LLMs) الوصول إلى مكتبة واسعة من البيانات الخاصة والمحدّثة. ومن خلال استرجاع المستندات ذات الصلة استنادًا إلى المعنى الدلالي لموجه المستخدم، يقلل النظام من الهلوسات في LLMs ويقدم استجابات واقعية واعية بالسياق.
- محركات التوصية المرئية: في الذكاء الاصطناعي في قطاع التجزئة، تستخدم المنصات قواعد بيانات المتجهات لتشغيل ميزات «تسوّق الأنماط المشابهة». فإذا شاهد المستخدم فستانًا صيفيًا محددًا، يستعلم النظام من قاعدة البيانات عن صور منتجات أخرى ذات تضمينات مرئية مشابهة—بمطابقة الأنماط والقصّات والألوان—مقدمًا تجربة مستخدم أفضل من التصفية البسيطة القائمة على الوسوم.
- اكتشاف الحالات الشاذة والتهديدات: تستفيد الأنظمة الأمنية من قواعد بيانات المتجهات في اكتشاف الحالات الشاذة. ومن خلال تخزين تضمينات السلوك «الطبيعي» أو الأفراد المصرح لهم، يستطيع النظام تحديد القيم الشاذة التي تقع خارج العنقود المتوقع في فضاء المتجهات فورًا، مما يعزز أمن البيانات ومراقبة المنشآت.
تمييز المفاهيم ذات الصلة#
لتنفيذ هذه الأنظمة بفاعلية، من المفيد التمييز بين قاعدة بيانات المتجهات والتقنيات ذات الصلة في منظومة عمليات التعلم الآلي (MLOps).
- قاعدة بيانات المتجهات مقابل البحث بالمتجهات: البحث بالمتجهات هو الإجراء أو العملية الخوارزمية للعثور على المتجهات المتشابهة («كيفية» التنفيذ). أما قاعدة بيانات المتجهات فهي البنية التحتية المتينة المصممة لتخزين البيانات وإدارة الفهرس وتنفيذ عمليات البحث هذه على نطاق واسع («مكان» التنفيذ).
- قاعدة بيانات المتجهات مقابل مخزن السمات: مخزن السمات هو مستودع مركزي لإدارة السمات المستخدمة في تدريب النماذج والاستدلال، بما يضمن الاتساق. وعلى الرغم من تعامله مع بيانات السمات، فإنه ليس مُحسّنًا أساسًا لاستعلامات الاسترجاع القائمة على التشابه التي تميز قاعدة بيانات المتجهات.
- قاعدة بيانات المتجهات مقابل بحيرة البيانات: تخزن بحيرة البيانات كميات هائلة من البيانات الأولية بتنسيقها الأصلي. أما قاعدة بيانات المتجهات فتخزن التمثيلات الرياضية المعالجة (التضمينات) لتلك البيانات، مع تحسينها خصيصًا من أجل البحث عن التشابه.
التكامل مع سير عمل الذكاء الاصطناعي الحديث#
غالبًا ما يتضمن تنفيذ قاعدة بيانات المتجهات خط أنابيب تعمل فيه نماذج مثل YOLO26 الفعّال كمحرك للتضمين. وتعالج هذه النماذج البيانات المرئية على الحافة أو في السحابة، ثم تُرسل المتجهات الناتجة إلى حلول مثل Pinecone أو Milvus أو Qdrant.
بالنسبة إلى الفرق التي تسعى إلى تبسيط دورة الحياة بأكملها—بدءًا من تنسيق البيانات والتوسيم التلقائي وصولًا إلى تدريب النماذج ونشرها—توفر منصة Ultralytics بيئة شاملة. ومن خلال دمج تدريب النماذج مع استراتيجيات النشر الفعّالة، يستطيع المطورون ضمان دقة التضمينات التي تغذي قواعد بيانات المتجهات، مما يؤدي إلى نتائج بحث أعلى جودة ووكلاء ذكاء اصطناعي أكثر ذكاءً.









