Ring Attention
استكشف كيف توسّع آلية الانتباه الحلقي نماذج Transformer إلى أطوال تسلسلات لا نهائية. تعلّم كيف تعزز هذه التقنية نماذج اللغة الكبيرة وTransformers البصرية لمهام البيانات الضخمة.
الانتباه الحلقي هو تقنية متقدمة في تعلُّم الآلة (ML) صُمِّمت لتوسيع نافذة السياق لبُنى Transformer إلى أطوال تسلسلات شبه لا نهائية. ومن خلال توزيع عملية حساب الانتباه المعقدة على مجموعة من وحدات GPU المتصلة بطوبولوجيا حلقية، تعمل التقنية بفاعلية على تداخل الاتصال مع الحساب. ويتيح هذا الاختراق المعماري لـنماذج اللغة الكبيرة (LLMs) ومحوّلات الرؤية (ViT) معالجة مدخلات ضخمة—مثل كتب كاملة أو ساعات من الفيديو المتواصل—تتجاوز بكثير سعة ذاكرة أي جهاز واحد.
تجاوز حاجز نافذة السياق#
في آليات الانتباه الذاتي القياسية، يزداد استهلاك الذاكرة تربيعيًا مع طول تسلسل الإدخال. ويشكّل ذلك عنق زجاجة حادًا لنماذج التعلُّم العميق (DL) التي تحاول تحليل البيانات طويلة الصيغة. ولمعرفة المزيد حول كيفية تعامل مجتمع الذكاء الاصطناعي مع هذا التحدي، يمكنك الاطلاع على أعمال Berkeley AI Research بشأن نماذج السياق الطويل.
يحلّ الانتباه الحلقي عنق الزجاجة التربيعي هذا من خلال تقسيم الاستعلامات والمفاتيح والقيم إلى كتل أصغر. تحسب كل وحدة GPU في الشبكة الموزعة كتلةً، ثم تمرّر المفاتيح والقيم إلى الجهاز المجاور لها في الحلقة. ويستمر هذا النقل الدوري حتى تُحسب آلية الانتباه كاملةً. ويتيح استخدام أدوات مثل حزمة الاتصال الموزع في PyTorch للمطورين بناء مسارات تدريب متقدمة متعددة الأجهزة.
الانتباه الحلقي مقابل الانتباه الوميضي#
على الرغم من أن كلتا التقنيتين تحسّنان استخدام الذاكرة، فإنهما تعملان على مستويين مختلفين. إذ إن الانتباه الوميضي خوارزمية تراعي العتاد، وتقلّل من عمليات قراءة الذاكرة وكتابتها المكلفة داخل SRAM لوحدة GPU واحدة. أما الانتباه الحلقي فهو خوارزمية موزعة تركز على توسيع نطاق الحساب عبر عدة وحدات GPU. وفي مسارات عمل الذكاء الاصطناعي التوليدي المتقدمة، غالبًا ما تُدمج هاتان التقنيتان لتحقيق كفاءة عتادية محلية وقابلية توسع هائلة عبر أجهزة متعددة، كما هو موضح في البحث الأصلي حول الانتباه الحلقي على arXiv.
التطبيقات الواقعية#
تتيح القدرة على معالجة ملايين الرموز في الوقت نفسه إمكانات قوية في الذكاء الاصطناعي الحديث:
-
تحليل شامل للوثائق وقواعد الشيفرة: يتيح الانتباه الحلقي للنماذج استيعاب ملايين الأسطر من الشيفرة أو مجموعات قانونية معقدة ضمن مطالبة واحدة. ويؤدي ذلك إلى تحسين كبير للأنظمة التي تعتمد على التوليد المعزَّز بالاسترجاع (RAG)، إذ يتيح لها تركيب السياق دون اقتطاع المعلومات الحيوية. ويُعد هذا المفهوم أساسًا لنماذج السياق الضخمة مثل بنية Gemini من Google.
-
فهم الفيديو الممتد: في الرؤية الحاسوبية (CV)، تتطلب معالجة تسلسلات الفيديو عالية الدقة عادةً تصغيرًا حادًا لأخذ العينات. ويتيح الانتباه الحلقي للنماذج تحليل تدفقات فيديو غير مضغوطة تمتد لساعات. ويعزز ذلك التعرّف على الأفعال وتتبّع الأجسام المستمر في أنظمة الأمن والقيادة الذاتية، مع الحفاظ على الوعي الزمني عبر فترات طويلة.
معالجة تسلسلات الرؤية#
بينما تتعامل نماذج الانتباه الموزع الضخمة مع سياقات لا نهائية، تتطلب التطبيقات العملية التي تضع الحافة أولًا بُنى محسّنة بدرجة عالية. وبالنسبة إلى الاستدلال في الوقت الحقيقي ومعالجة التسلسلات البصرية، يوفّر Ultralytics YOLO26 أداءً رائدًا في المجال دون النفقات الحسابية الهائلة للمحوّلات القائمة بالكامل على الانتباه.
from ultralytics import YOLO
# Load the recommended YOLO26 model for high-speed object tracking
model = YOLO("yolo26n.pt")
# Perform robust multi-object tracking on a long video sequence
results = model.track(source="long_surveillance_feed.mp4", stream=True)
# Iterate through the stream to process temporal tracking data
for frame_result in results:
print(f"Tracked {len(frame_result.boxes)} objects in current frame.")عند بناء حلول اكتشاف الأجسام وتجزئة الصور المعقدة وتوسيع نطاقها، تُعد إدارة تنسيق العتاد أمرًا بالغ الأهمية. وتبسّط منصة Ultralytics هذه العملية بالكامل، إذ توفر أدوات لـالتدريب السحابي السلس، ووسم مجموعات البيانات تلقائيًا، ونشر النماذج بنقرة واحدة عبر بيئات عتادية متعددة. ويضمن الاستفادة من هذه المنصات انتقال تقنيات التوسّع المتقدمة بسلاسة من مرحلة البحث إلى مسارات ذكاء اصطناعي قابلة للتوسع وجاهزة للإنتاج.









