Hybrid Search
استكشف كيف يدمج البحث الهجين بين مطابقة الكلمات الرئيسية والذكاء الاصطناعي الدلالي. تعلم بناء خطوط أنابيب بحث مدركة للسياق باستخدام بيانات وصفية من Ultralytics YOLO26.
من خلال الجمع بين دقة مطابقة الكلمات الدلالية التقليدية والفهم السياقي للذكاء الاصطناعي الحديث، تسترجع منهجية البحث هذه المعلومات وترتبها عبر الاستفادة من تمثيلات البيانات المتفرقة والكثيفة على حد سواء. وفي الوقت الذي يعتمد فيه أي محرك بحث قياسي تماماً على مطابقات الكلمات الدلالية الدقيقة (المعروفة باسم البحث المعجمي) وتعتمد محركات البحث المتجهية حصرياً على التشابه الدلالي، يدمج محرك البحث الهجين هذين النهجين لتقديم نتائج عالية الدقة وواعية بالسياق.
كيف يعمل#
ينفذ خط استرجاع البحث الهجين النموذجي طريقتي استرجاع متميزتين في وقت واحد، ويدمج مخرجاتهما في تصنيف واحد مُحسَّن:
- البحث المعجمي (المتفرق): يستهدي بخوارزميات مثل BM25 لتقييم مطابقات الكلمات الدلالية الدقيقة استناداً إلى تكرار المصطلحات. ويُعد هذا أمراً بالغ الأهمية لاسترداد كيانات أو مختصرات أو وحدات تخزين منتجات أو مصطلحات تخصصية معينة قد يواجه النمذجة الدلالية البحتة صعوبة في تحديدها.
- البحث الدلالي (الكثيف): يُنشئ مصفوفات عالية الأبعاد من الأرقام باستخدام نماذج الذكاء الاصطناعي لفهم المعنى الأعمق والسياق الخاص بأي استعلام. ويتيح ذلك للنظام العثور على نتائج ذات صلة حتى إذا كانت الكلمات الدقيقة غائبة عن استعلام البحث.
بمجرد أن تسترجع كلتا الطريقتين نتائجهما المرشحة، تقوم خوارزمية الدمج -والأكثر شيوعاً هي دمج الترتيب التبادلي (RRF)- بدمج القوائم. تحسب RRF درجات جديدة بناءً على ترتيب كل عنصر في مجموعتي النتائج المتفرقة والكثيفة على التوالي. وهذا يضمن أن المستندات التي تحتل مراتب متقدمة في أحد البحثين أو كليهما تطفو إلى القمة، مما يحقق التوازن بين التطابقات السياقية الواسعة ودقة الكلمات الدلالية الدقيقة.
تطبيقات الذكاء الاصطناعي والتعلم الآلي في العالم الحقيقي#
تعتمد بنيات الذكاء الاصطناعي الحديثة بشكل كبير على هذه التقنية للتغلب على قيود استخدام طريقة استرجاع واحدة في بيئات الإنتاج.
- الاسترجاع المعزز بالإنتاج الهجين (Hybrid RAG): في أنظمة المعرفة المؤسسية، يُعد تزويد نموذج اللغة الكبير (LLM) بالسياق الأكثر صلة أمراً بالغ الأهمية لمنع الهلوسات. يضمن إعداد الاسترجاع المعزز بالإنتاج الهجين (Hybrid RAG) أن يسترجع النموذج مستندات تطابق القيود التقنية الدقيقة مع جلب الفقرات ذات الصلة دلالياً أيضاً.
- التجارة الإلكترونية واكتشاف المنتجات المرئية: يستخدم تجار التجزئة البحث الهجين لتشغيل كتالوجات المنتجات. قد يبحث المستخدم عن "حذاء جري أحمر". يطابق المحرك المعجمي الكلمات الدلالية الدقيقة للعلامة التجارية أو الفئة، بينما يستخدم نموذج رؤية الذكاء الاصطناعي تضمينات الصور لإبراز عناصر متشابهة بصرياً.
اليوم، تدعمเกือบ كل قاعدة بيانات متجهة رئيسية -بما في ذلك Pinecone وQdrant وOpenSearch وPostgreSQL عبر pgvector- البحث الهجين بشكل أصلي. يتيح هذا للمطورين فهرسة الكلمات الدلالية المتفرقة والمتجهات الكثيفة بكفاءة في بنية تحتية واحدة.
توليد البيانات الوصفية للبحث الهجين#
في خطوط تفاعلات رؤية الحاسوب، يمكنك استخراج كلمات دلالية ذات مغزى من الصور لبناء المكون المتفرق للفهرس الهجين. باستخدام Ultralytics YOLO26، يمكنك إجراء اكتشاف الكائنات تلقائياً على صورة واستخدام أسماء الفئات تلك كـ وسوم بيانات وصفية. يمكن بعد ذلك إقران وسوم الكلمات الدلالية هذه بتضمينات المتجهات الكثيفة للصورة من أجل فهرسة شاملة.
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 object detection model
model = YOLO("yolo26n.pt")
# Run inference to detect objects in an image
results = model("store_aisle.jpg")
# Extract predicted class names to be indexed as keyword metadata (sparse data)
keywords = [model.names[int(box.cls)] for box in results[0].boxes]
print("Sparse keywords for lexical search:", keywords)من خلال إثراء تضمينات الصور الكثيفة بكلمات دلالية متفرقة دقيقة ومولدة بالذكاء الاصطناعي، يمكن للمطورين الاستفادة من منصة Ultralytics وقواعد البيانات المتجهة المتوافقة مع البحث الهجين لبناء محركات بحث متعددة الوسائط قوية تفهم تماماً كلاً من الوسوم النصية الصريحة والسياق المرئي الضمني لبياناتهم.






