Chunked Prefill
تعمل عملية الملء المسبق المُجزّأة على تحسين زمن استجابة استدلال نماذج اللغة الكبيرة (LLMs) ومعدل الإنتاجية عبر تقسيم المطالبات الطويلة إلى أجزاء من الرموز المميّزة، لتوفير خدمة أكثر سلاسة تحت أحمال العمل المتزامنة.
التهيئة المسبقة المُجزّأة هي تقنية لجدولة الاستدلال تقسّم موجّه إدخال طويلًا إلى مجموعات أصغر من الرموز بدلًا من معالجة الموجّه بأكمله في عملية واحدة متواصلة. ويمكن لمحرك الاستدلال أن يتناوب بين هذه الأجزاء وتوليد الرموز لطلبات أخرى، مما يمنع موجّهًا طويلًا واحدًا من الاستئثار بوحدة GPU. وتكون النتيجة عادةً زمن استجابة أكثر سلاسة في ظل أحمال العمل المتزامنة، واستفادة أفضل من العتاد، وخدمة أكثر قابلية للتنبؤ لتطبيقات نماذج اللغة الكبيرة التفاعلية.
كيفية عمل التهيئة المسبقة المُجزّأة#
يمر استدلال Transformer الانحداري الذاتي بمرحلتين رئيسيتين:
- التهيئة المسبقة (Prefill): يعالج النموذج جميع رموز الإدخال، ويحسب حالات الانتباه الخاصة بها، ويملأ ذاكرة التخزين المؤقت KV. وتقيّم التهيئة المسبقة عددًا كبيرًا من الرموز بالتوازي، وتكون عادةً محدودة بقدرة الحوسبة.
- فك الترميز (Decode): يولّد النموذج المخرجات رمزًا واحدًا في كل مرة مع قراءة الحالات المخزنة مؤقتًا سابقًا. وغالبًا ما يكون فك الترميز محدودًا بعرض نطاق الذاكرة بدلًا من القدرة الحسابية الخام.
من دون التجزئة، قد يشغل طلب مكوّن من 20,000 رمز خطوةَ استدلال لمدة أطول بكثير من طلب قصير. وقد تتعرض عمليات التوليد النشطة عندئذٍ إلى توقفات، مما يزيد زمن الاستجابة بين الرموز حتى لو كانت موجّهاتها الخاصة صغيرة.
مع التهيئة المسبقة المُجزّأة، يخصص المجدول ميزانية رموز لكل تكرار. ويجدول أولًا عمليات فك الترميز النشطة، ثم يستخدم الميزانية المتبقية لجزء واحد أو أكثر من الموجّه. وإذا لم يتسع الموجّه، تنتظر رموزه المتبقية حتى تكرار لاحق. ويصف دليل تحسين vLLM الحالي هذا النهج بأنه وسيلة للجمع بين أعمال التهيئة المسبقة كثيفة الحوسبة وفك الترميز كثيف استخدام الذاكرة.
تغيّر التجزئة توقيت معالجة رموز الموجّه، لا ترتيبها أو معناها. ويمدّد كل جزء مكتمل حالة الانتباه المخزنة مؤقتًا للطلب حتى يصبح الموجّه بأكمله جاهزًا ويمكن بدء فك الترميز.
أهمية التهيئة المسبقة المُجزّأة#
تعالج التهيئة المسبقة المُجزّأة أهداف الأداء المتنافسة في خدمة النماذج في بيئات الإنتاج:
- زمن الاستجابة بين الرموز: تساعد أولوية طلبات فك الترميز الحالية على استمرار الاستجابات المتدفقة من دون توقفات طويلة.
- الزمن حتى الرمز الأول: تُنهي الأجزاء الكبيرة موجّهًا جديدًا بسرعة أكبر، في حين قد تؤخر الأجزاء الصغيرة جدًا أول رمز مولّد منه.
- معدل النقل: يمكن أن يؤدي الجمع بين أعمال التهيئة المسبقة وفك الترميز إلى استخدام حوسبة GPU وعرض نطاق الذاكرة بكفاءة أكبر.
- الإنصاف: تقل احتمالية أن تحجب الموجّهات الطويلة عددًا كبيرًا من الطلبات التفاعلية القصيرة.
وعليه، فإن إعداد الجزء أو ميزانية الرموز يمثل مفاضلة. وتعرض تهيئة مجدول vLLM عناصر تحكم في حدود الرموز المجمّعة، والتهيئة المسبقة الجزئية، والعتبات الخاصة بالموجّهات الطويلة. وتفضّل الميزانيات الأصغر عمومًا فك الترميز سريع الاستجابة، بينما تفضّل الميزانيات الأكبر استيعاب الموجّه بسرعة أكبر.
لا تقضي التجزئة على كل عنق زجاجة. فما زالت السياقات الطويلة تستهلك ذاكرة التخزين المؤقت، وقد يؤدي القبول المفرط إلى ضغط على ذاكرة التخزين المؤقت، أو إيقاف الطلبات مؤقتًا، أو تكرار العمل. وينبغي للمشغلين قياس زمن استجابة الاستدلال الوسيط وذيول التوزيع، والزمن حتى الرمز الأول، وزمن الاستجابة بين الرموز، ومعدل النقل، واستخدام ذاكرة GPU في ظل توزيعات موجّه واقعية.
مفاهيم الاستدلال ذات الصلة#
ترتبط التهيئة المسبقة المُجزّأة ارتباطًا وثيقًا بعدة تحسينات، لكنها تخدم غرضًا متميزًا:
- التجميع المستمر: يضيف الطلبات ويزيلها ديناميكيًا أثناء التوليد. وتكمّله التهيئة المسبقة المُجزّأة بجعل معالجة الموجّهات الطويلة قابلة للجدولة عند حدود مستوى الرمز.
- التخزين المؤقت للموجّه: يعيد استخدام الحالات المحسوبة سابقًا لبادئة موجّه متكررة. أما التهيئة المسبقة المُجزّأة فتجدول حوسبة جديدة؛ ولا تتجاوز تلك الحوسبة.
- إدارة ذاكرة التخزين المؤقت KV المُقسّمة إلى صفحات: تنظّم حالات الانتباه المخزنة مؤقتًا في كتل ذاكرة. ويتضمن استعراض TensorRT-LLM من NVIDIA التخزين المؤقت المُقسّم إلى صفحات والتجميع أثناء التنفيذ إلى جانب تحسينات معالجة الموجّهات.
- التجميع الديناميكي: يجمع الطلبات المنفصلة في مجموعات، كما هو موضح في دليل التجميع الديناميكي لـ NVIDIA Triton. ولا يقسّم بالضرورة موجّهًا طويلًا فرديًا إلى عمليات تهيئة مسبقة جزئية.
- فصل التهيئة المسبقة وفك الترميز: يشغّل المرحلتين على عمال منفصلين. ويوضح دليل نشر التهيئة المسبقة وفك الترميز من NVIDIA كيف يمكن بدلًا من ذلك توسيع نطاق المرحلتين بشكل مستقل.
على الرغم من أن سير عمل نشر Ultralytics YOLO26 على Triton يدعم استدلال الرؤية الحاسوبية القابلًا للتوسّع والتجميع التلقائي، فإن اكتشاف الكائنات القياسي باستخدام YOLO لا يتضمن مرحلة تهيئة مسبقة نصية انحدارية ذاتيًا. وتنطبق التهيئة المسبقة المُجزّأة أساسًا على نماذج اللغة التوليدية والنماذج متعددة الوسائط.
التطبيقات الواقعية#
-
مساعدو المستندات: قد يتلقى مساعد معزّز بالاسترجاع تقريرًا طويلًا في الوقت نفسه الذي يخدم فيه مستخدمين يطرحون أسئلة قصيرة. ويتيح تقسيم التهيئة المسبقة للتقرير استمرار المحادثات الجارية في فك الترميز بدلًا من تجمّدها حتى تتم معالجة السياق بأكمله.
-
تحليل الفيديو متعدد الوسائط: قد يتلقى نموذج الرؤية واللغة سمات الصور، وأوصاف الكائنات، وتعليمات نصية طويلة. ويمكن لخط أنابيب الرؤية أن ينتج الاكتشافات أولًا باستخدام تنبؤ Ultralytics YOLO، ثم يرسل السياق المرئي المنظم إلى النموذج التوليدي. وتساعد التهيئة المسبقة المُجزّأة على جدولة الرموز المرئية والنصية الناتجة إلى جانب الطلبات الأخرى. ويوضح سير عمل الترميز والتهيئة المسبقة وفك الترميز متعدد الوسائط من NVIDIA سبب قدرة الإدارة المستقلة لهذه المراحل على تحسين قابلية التوسّع.
إرشادات عملية للنشر#
فعّل التهيئة المسبقة المُجزّأة فقط من خلال محرك خدمة يدعم البنية المستهدفة رسميًا. فعلى سبيل المثال، يوثّق تهيئة الواجهة الخلفية لـ TensorRT-LLM عناصر التحكم في السياق المُجزّأ لعمليات النشر المدعومة.
أجرِ اختبارات معيارية باستخدام تزامن واقعي، وأطوال إدخال واقعية، وأطوال إخراج واقعية، بدلًا من الاعتماد على طلب واحد. ابدأ بميزانية الرموز التي يوصي بها وقت التشغيل، ثم اضبطها مع مراقبة الزمن حتى الرمز الأول وزمن الاستجابة بين الرموز. وأخيرًا، اختبر أحمال عمل مختلطة تتضمن موجّهات طويلة جدًا وأخرى قصيرة جدًا؛ ففي هذه الحالة تظهر القيمة التشغيلية الأوضح للتهيئة المسبقة المُجزّأة.









