Prompt Caching
اكتشف كيف تحسّن آلية التخزين المؤقت للمطالبات الذكاء الاصطناعي التوليدي عبر تقليل زمن الاستجابة والتكاليف. تعلّم دورها في نماذج اللغة الكبيرة (LLMs) والرؤية الحاسوبية في الوقت الفعلي باستخدام Ultralytics YOLO26.
التخزين المؤقت للمطالبة هو استراتيجية تحسين متقدمة تُستخدم أساسًا في الذكاء الاصطناعي التوليدي لتقليل التكاليف بدرجة كبيرة وتحسين أوقات الاستجابة أثناء الاستدلال. في مجال نماذج اللغة الكبيرة (LLMs)، تتطلب معالجة النص تحويل المدخلات إلى تسلسلات رقمية تُعرف باسم الرموز. وغالبًا ما يظل جزء كبير من بيانات الإدخال — مثل تعليمات نظام مفصلة أو مستند قانوني طويل أو قاعدة شيفرة — ثابتًا عبر العديد من استعلامات المستخدم المختلفة. وبدلًا من إعادة معالجة هذه الأقسام غير المتغيرة مع كل طلب جديد، يخزّن التخزين المؤقت للمطالبة الحالات الرياضية المحسوبة مسبقًا (والتي تُسمى غالبًا ذاكرة التخزين المؤقت للمفتاح والقيمة) في الذاكرة. ويتيح ذلك لـ محرك الاستدلال تجاوز الحسابات المتكررة، مع تركيز القدرة الحاسوبية فقط على الأجزاء الجديدة والديناميكية من مطالبة المستخدم.
الآليات والفوائد#
تعتمد الآليات الأساسية للتخزين المؤقت للمطالبة على بنية Transformer، التي تعالج البيانات بالتسلسل. ومن خلال تحديد البادئة المتكررة للمطالبة، يستطيع النظام تحميل حالات آلية الانتباه المقابلة مباشرةً من الذاكرة عالية السرعة.
- زمن وصول أقل: يخفض التخزين المؤقت زمن وصول الاستدلال بدرجة كبيرة، ولا سيما زمن الوصول إلى الرمز الأول (TTFT). ويضمن ذلك أن تبدو التطبيقات الآنية، مثل روبوتات المحادثة التفاعلية، فوريةً للمستخدم.
- كفاءة التكلفة: نظرًا إلى أن موفري الحوسبة السحابية غالبًا ما يفرضون الرسوم استنادًا إلى مدة الحوسبة أو معالجة الرموز، فإن تجاوز المعالجة المكثفة للسياق الثابت يؤدي إلى وفورات كبيرة.
- زيادة معدل الإنتاجية: من خلال تحرير موارد GPU، تستطيع الخوادم معالجة حجم أكبر من الطلبات المتزامنة، مما يجعل البنية التحتية الكاملة لـ خدمة النماذج أكثر قابلية للتوسع.
التطبيقات الواقعية#
يُحدث التخزين المؤقت للمطالبات تحولًا في الصناعات التي تعتمد على سياقات بيانات كبيرة.
-
مساعدو البرمجة: في تطوير البرمجيات، تستخدم أدوات مثل GitHub Copilot كميات هائلة من السياق المستمد من الملفات المفتوحة لدى المستخدم وبنية المستودع. ومن خلال التخزين المؤقت لـ تضمينات قاعدة الشيفرة، يستطيع النموذج تقديم اقتراحات إكمال الشيفرة في الوقت الفعلي من دون إعادة تحليل بنية ملفات المشروع بأكملها مع كل ضغطة مفتاح.
-
التحليل القانوني والطبي: غالبًا ما يستعلم المتخصصون من وكلاء الذكاء الاصطناعي بشأن مستندات ثابتة ضخمة، مثل أرشيفات السوابق القضائية أو سجلات التاريخ المرضي. وباستخدام التوليد المعزز بالاسترجاع (RAG)، يسترجع النظام الأجزاء ذات الصلة من النص. ويضمن التخزين المؤقت للمطالبة عدم الحاجة إلى إعادة حساب السياق الأساسي لهذه المستندات المسترجعة عند طرح أسئلة متابعة، مما يبسط سير عمل الإجابة عن الأسئلة.
أهميتها في الرؤية الحاسوبية#
مع ارتباط مفهوم التخزين المؤقت تقليديًا بالنصوص، فإنه يُعد مهمًا في الرؤية الحاسوبية (CV) متعددة الوسائط. وتتيح نماذج مثل YOLO-World للمستخدمين اكتشاف الكائنات باستخدام مطالبات نصية ذات مفردات مفتوحة. وعندما يحدد المستخدم قائمة من الفئات (مثل: "person, backpack, car")، يحسب النموذج تضمينات نصية لهذه الفئات. ويمنع التخزين المؤقت لهذه التضمينات النموذج من إعادة ترميز المطالبات النصية لكل إطار فيديو على حدة، مما يتيح الاستدلال في الوقت الفعلي عالي السرعة.
التمييز بين المصطلحات ذات الصلة#
- مقارنةً بـ هندسة المطالبات: تتضمن هندسة المطالبات الجهد البشري لتصميم إدخال نصي أمثل لتوجيه النموذج. أما التخزين المؤقت للمطالبات فهو تحسين حسابي في الواجهة الخلفية يخزّن معالجة الآلة لذلك النص.
- مقارنةً بـ ضبط المطالبات: يُعد ضبط المطالبات تقنيةً من تقنيات التعلم بالنقل تحدّث أوزان النموذج المحددة (المطالبات المرنة) لتكييف النموذج مع مهمة معينة. ولا يغير التخزين المؤقت معلمات النموذج؛ بل يحفظ حالات التنشيط فقط أثناء وقت التشغيل.
مثال على الشيفرة: تخزين التضمينات النصية مؤقتًا في الرؤية الحاسوبية#
يوضح مقتطف Python التالي مفهوم "التخزين المؤقت" لمطالبة في سياق الرؤية الحاسوبية باستخدام الحزمة ultralytics. ومن خلال تعيين الفئات مرة واحدة في نموذج YOLO-World، تُحسب التضمينات النصية وتُخزّن (وتُحفظ)، مما يتيح للنموذج إجراء تنبؤات بكفاءة على صور متعددة من دون إعادة معالجة الوصف النصي.
from ultralytics import YOLOWorld
# Load a YOLO-World model capable of open-vocabulary detection
model = YOLOWorld("yolov8s-world.pt")
# "Cache" the prompt: Define classes once.
# The model computes and stores text embeddings for these specific terms.
model.set_classes(["helmet", "reflective vest", "gloves"])
# Run inference repeatedly. The text prompt is not re-computed for each call.
# This mimics the efficiency gains of prompt caching in LLMs.
results_1 = model.predict("construction_site_1.jpg")
results_2 = model.predict("construction_site_2.jpg")لإدارة مجموعات البيانات ونشر هذه النماذج المحسّنة، توفر منصة Ultralytics بيئةً شاملةً لإضافة التعليقات التوضيحية إلى البيانات، وتدريب نماذج متقدمة مثل YOLO26، ومراقبة أداء النشر عبر أجهزة الذكاء الاصطناعي الطرفي المتنوعة.









