Prompt Compression
استكشف كيف يعمل ضغط المطالبات على تحسين كفاءة الذكاء الاصطناعي. تعلم تقليل استخدام الرموز في نماذج اللغات الكبيرة، وخفض التكاليف، وتعزيز سرعة الاستدلال باستخدام Ultralytics YOLO26 اليوم.
ضغط الموجهات هو تقنية تحسين متقدمة مصممة لتقليل طول وتعقيد النص المدخل المقدم إلى Large Language Models (LLMs) وmulti-modal models. من خلال إزالة الكلمات الزائدة، والسياق غير المرتيط، وكلمات التوقف خوارزمياً مع الحفاظ على المعنى الدلالي الأساسي، يتيح ضغط الموجهات لنظم الذكاء الاصطناعي معالجة المعلومات بكفاءة أكبر. تعد هذه الطريقة بالغة الأهمية بشكل متزايد لتقليل التكاليف الحسابية، وتقليل inference latency، ومنع النماذج من تجاوز الحد الأقصى context window الخاص بها.
كيف يعمل ضغط المطالبة#
على مستوى البنية، غالباً ما يستفيد ضغط الموجهات من نماذج أصغر ومتخصصة أو خوارزميات نظرية المعلومات لتقييم أهمية كل token في موجه معين. تحدد تقنيات مثل token merging and entropy-based pruning الرموز التي تساهم بشكل طفيف في المعنى العام وتزيلها. يضمن ذلك احتواء الإدخال النهائي على المعلومات الأكثر كثافة فقط.
تسلط الأبحاث الحديثة الصادرة عن جهات موثوقة الضوء على أن الموجهات المضغوطة للغاية يمكنها الحفاظ على الأداء في مهام الاستدلال المعقدة مع تقليل استهلاك الرموز بشكل كبير. بالنسبة للمطورين الذين يدمجون الذكاء الاصطناعي في تطبيقات قابلة للتوسع، يعد الالتزام بـ prompt optimization guidelines by OpenAI والاستفادة من أطر الضغط ممارسة قياسية فضلى للنشر الفعال.
تطبيقات العالم الحقيقي#
يوفر ضغط المطالبة قيمة فورية في السيناريوهات التي تتطلب معالجة سريعة للبيانات النصية أو المرئية المكثفة:
- Retrieval-Augmented Generation (RAG): في تطبيقات البحث المؤسسية، غالباً ما تسترجع خطوط أنابيب RAG عشرات المستندات الطويلة للإجابة على استعلام مستخدم واحد. تعمل خوارزميات ضغط الموجهات على تقليص هذه المستندات المسترجعة، وتلخيصها في ملخصات واقعية موجزة قبل إرسالها إلى نموذج التوليد. يمنع هذا تدفق الرموز الزائد ويسرع real-time inference.
- Autonomous AI Agents: يجب على الوكلاء وchatbots الحفاظ على ذاكرة طويلة الأجل لتفاعلات المستخدمين. بدلاً من تمرير سجل المحادثة بالكامل في كل استعلام جديد، تلخص تقنيات الضغط عمليات الحوار القديمة، مما يضمن بقاء الوكيل مدركاً للسياق دون تحمل تكاليف حسابية أسبية.
ضغط المطالبة مقابل التقنيات ذات الصلة#
لبناء خطوط أنابيب قوية لـ machine learning operations (MLOps)، من المهم التمييز بين ضغط الموجهات والمفاهيم ذات الصلة:
- مقابل Prompt Caching: يقوم التخزين المؤقت بتخزين الحالات الحسابية الداخلية للنص الذي تم معالجته مسبقاً لتجنب إعادة حسابها. من ناحية أخرى، يعمل الضغط على تعديل وتقصير نص الإدخال نفسه بنشاط قبل حدوث أي معالجة.
- مقابل Prompt Engineering: هندسة الموجهات هي الحرفة التي تقودها بشر لتصميم تعليمات فعالة. الضغط هو تقليل آلي وخوارزمي لتلك التعليمات.
- مقابل Prompt Enrichment: يعمل الإثراء على توسيع الموجه عن طريق إضافة سياق خارجي، بينما يقلله الضغط. غالباً ما يتم استخدامهما معاً: قد يقوم النظام بإثراء الموجه بنتائج قاعدة البيانات ثم ضغط الحمولة النهائية قبل الاستدلال.
التنفيذ في الرؤية الحاسوبية#
في Computer Vision (CV)، تُطبق مبادئ ضغط الموجهات عند استخدام النماذج ذات المفردات المفتوحة التي تقبل استعلامات النصوص لتحديد الكائنات. الحفاظ على أوصاف الفئات موجزة يضمن تشفيراً نصياً أسرع ويقلل من الحمل الزائد للذاكرة.
بالنسبة لبيئات الإنتاج ذات الفئات الثابتة حيث تكون السرعة أمراً بالغ الأهمية، ينتقل المطورون عادةً من النماذج المدفوعة بالنصوص إلى نماذج ذات بنية ثابتة ومحسنة للغاية مثل Ultralytics YOLO26. يمكنك إدارة مجموعات البيانات بكفاءة وتدريب هذه النماذج المتطورة باستخدام Ultralytics Platform.
from ultralytics import YOLO
# Load an open-vocabulary YOLO-World model
model = YOLO("yolov8s-world.pt")
# Principle of prompt compression: Use concise, distilled class names
# instead of lengthy, complex descriptions for faster text encoding
compressed_prompts = ["helmet", "vest", "forklift"]
model.set_classes(compressed_prompts)
# Run inference with the optimized class list
results = model.predict("https://ultralytics.com/images/bus.jpg")
results[0].show()





