PagedAttention
تعلّم كيف تحسّن PagedAttention إدارة ذاكرة LLM وكفاءة ذاكرة KV المؤقتة. واستكشف تأثيرها في معدل النقل وكيف تقارن بأداء Ultralytics YOLO26.
PagedAttention هي خوارزمية عالية الكفاءة لإدارة الذاكرة، صُممت لتحسين سرعة الاستدلال ومعدل نقل البيانات في نماذج اللغة الكبيرة (LLMs). واستنادًا إلى مفاهيم الذاكرة الافتراضية وتقسيم الصفحات في أنظمة التشغيل التقليدية، تعالج هذه التقنية الاستهلاك الهائل للذاكرة المرتبط بذاكرة التخزين المؤقت للمفتاح والقيمة (التي يُشار إليها غالبًا باسم ذاكرة KV المؤقتة) أثناء توليد النصوص. ومن خلال تقسيم كتل الذاكرة المتصلة المطلوبة لذاكرة التخزين المؤقت إلى «صفحات» أصغر وغير متجاورة، تقضي PagedAttention بفعالية على تجزئة الذاكرة الداخلية والخارجية. ويسمح ذلك لخوادم الذكاء الاصطناعي بتجميع عدد أكبر بكثير من الطلبات في الوقت نفسه، مما يزيد الاستفادة من GPU إلى أقصى حد.
PagedAttention مقارنةً بـ Flash Attention#
على الرغم من أن كلتا التقنيتين تحسّنان أداء الشبكات العصبية، فإنهما تستهدفان عنقَي زجاجة مختلفين. تُعد Flash Attention تحسينًا على مستوى الحوسبة، إذ تسرّع آلية الانتباه نفسها من خلال تقليل عمليات القراءة والكتابة البطيئة من الذاكرة عبر تسلسل هرمي للذاكرة في GPU. في المقابل، تُعد PagedAttention استراتيجية لتخصيص الذاكرة. وتركّز حصريًا على كيفية تنظيم ذاكرة نافذة السياق وتخزينها، مما يتيح التوسع الديناميكي دون تخصيص كتل ذاكرة كبيرة ومهدرة مسبقًا.
التطبيقات الواقعية#
لقد غيّرت كفاءة الذاكرة التي أتاحتها PagedAttention طريقة نشر النماذج التوليدية واسعة النطاق في بيئات الإنتاج.
-
تقديم واجهات API ذات معدل نقل عالٍ: تستخدم أنظمة الإنتاج التي تقدم نماذج مماثلة لـ GPT-4 تقنية PagedAttention عبر أطر عمل مثل vLLM. ومن خلال مشاركة كتل الذاكرة بين طلبات المستخدمين المختلفة، يستطيع مزودو الخدمة تقديم الخدمة لما يصل إلى أربعة أضعاف عدد المستخدمين على الأجهزة نفسها، مما يخفض بدرجة كبيرة تكلفة تشغيل خدمات الذكاء الاصطناعي السحابية.
-
استراتيجيات فك ترميز معقدة: عندما يولّد نموذج الذكاء الاصطناعي عدة استجابات محتملة في آن واحد، كما في البحث بالحزمة أو أخذ العينات المتوازي، تتيح PagedAttention لهذه التسلسلات المتوازية مشاركة صفحات الذاكرة الأساسية نفسها بأمان. ويمنع ذلك النظام من تكرار الذاكرة الزائدة، مما يجعل مهام الاستدلال المعقدة أسرع بكثير.
كفاءة الذاكرة في الرؤية الحاسوبية#
على الرغم من استخدام PagedAttention أساسًا في معالجة اللغة الطبيعية، فإن المبدأ الأساسي المتمثل في التحسين الصارم للذاكرة لا يقل أهمية في الرؤية الحاسوبية (CV). وعند نشر النماذج على أجهزة طرفية محدودة الموارد، يُعد تجنب تضخم الذاكرة أمرًا ضروريًا. ويحقق Ultralytics YOLO26 كفاءة الاستدلال في الوقت الفعلي بصورة أصلية، متجاوزًا الحاجة إلى إدارة ذاكرة تخزين مؤقتة ثقيلة من خلال استخدام بنية شاملة خالية من NMS.
بالنسبة إلى المطورين الذين يرغبون في التعامل بسلاسة مع متطلبات الذاكرة والتصدير الخاصة بخطوط أنابيب اكتشاف الكائنات، توفر منصة Ultralytics أدوات نشر مؤتمتة تُجهّز حزم النماذج لتنفيذ أمثل على الأجهزة.
مثال على التعليمات البرمجية#
تعمل PagedAttention خلف الكواليس في أطر تقديم الخدمة، إذ تستبدل وظائف الانتباه القياسية بنوى Cuda محسّنة. فيما يلي مثال مفاهيمي يوضح كيفية تعريف الانتباه القياسي في PyTorch، حيث تعترض الأنظمة مثل vLLM هذا التعريف تلقائيًا وتحسّنه باستخدام تقسيم الصفحات أثناء نشر النموذج.
import torch
import torch.nn.functional as F
# Simulated Key, Query, and Value tensors for a standard attention block
batch_size, num_heads, sequence_length, head_dim = 1, 8, 1024, 64
query = torch.randn(batch_size, num_heads, sequence_length, head_dim)
key = torch.randn(batch_size, num_heads, sequence_length, head_dim)
value = torch.randn(batch_size, num_heads, sequence_length, head_dim)
# Standard attention computation (often replaced by PagedAttention kernels in production LLM servers)
attention_output = F.scaled_dot_product_attention(query, key, value)
print(f"Computed attention shape: {attention_output.shape}")ومن خلال الاستفادة من استراتيجيات تخصيص الذاكرة المتقدمة، تواصل صناعة الذكاء الاصطناعي دفع حدود ما هو ممكن، بما يضمن إمكانية توسيع نطاق النماذج الأساسية الضخمة والوصول إليها بكفاءة في جميع أنحاء العالم.









