Token Merging (ToMe)
تعرّف على كيفية تحسين دمج الرموز (ToMe) لنماذج Transformer وViT. اكتشف كيفية تقليل FLOPs وتسريع الاستدلال في الوقت الفعلي وزيادة سرعة الذكاء الاصطناعي التوليدي.
دمج الرموز (ToMe) هو أسلوب متطور صُمم لتحسين أداء وكفاءة بنيات Transformer من خلال تقليل عدد الرموز التي تتم معالجتها أثناء التمريرات الأمامية. طُوّر ToMe في الأصل لتسريع نماذج المحوّل الرؤيوي (ViT)، ويعمل عبر تحديد الرموز المتكررة داخل الشبكة ودمجها بطريقة منهجية، من دون الحاجة إلى تدريب إضافي. ونظرًا إلى أن التعقيد الحسابي لآلية الانتباه الذاتي يتوسع تربيعيًا مع عدد الرموز، فإن دمج الرموز المتشابهة يقلل بصورة كبيرة إجمالي عمليات الفاصلة العائمة (FLOPs)، ما يتيح استدلالًا أسرع في الوقت الفعلي بدرجة ملحوظة.
فهم عملية دمج الرموز#
يختلف ToMe اختلافًا جوهريًا عن تجزئة الرموز، وهي خطوة المعالجة المسبقة الأولية التي تُقسَّم فيها صورة أو نص إلى رموز فردية. وبينما تنشئ تجزئة الرموز العناصر المنفصلة، يعمل دمج الرموز كآلية أخذ عينات منخفضة ديناميكية أثناء التنفيذ الأمامي للنموذج.
تستخدم الخوارزمية عادةً المطابقة الثنائية لتقييم تشابه الرموز، وغالبًا ما تحسب التشابه الجيبي بين مفاتيح الرموز في طبقات الانتباه. وتُدمج الرموز التي تشترك في معلومات بصرية أو دلالية شديدة التشابه معًا، غالبًا عبر حساب متوسط ميزاتها. ويضمن ذلك الحفاظ على المعلومات المكانية أو السياقية الأساسية مع إسقاط الحمولة الحسابية غير الضرورية، ما يتيح لأطر عمل مثل PyTorch معالجة نماذج الرؤية المعقدة بسرعة أكبر بكثير.
التطبيقات العملية لدمج الرموز#
أصبح دمج الرموز استراتيجية تحسين بالغة الأهمية لنشر البنى الثقيلة القائمة على الانتباه في البيئات ذات الموارد الحسابية المحدودة.
-
الذكاء الاصطناعي التوليدي وتوليد الصور: في نماذج الانتشار الشائعة لتحويل النص إلى صورة، يُستخدم ToMe كثيرًا لتسريع توليد الصور. ومن خلال دمج الرموز الخاصة بالخلفية أو منخفضة التفاصيل، تتطلب عملية التوليد عددًا أقل من الخطوات، ما يوفر قدرًا هائلًا من موارد GPU ويقلل زمن الاستجابة للمستخدمين النهائيين الذين يعتمدون على النماذج التوليدية. ويمكنك معرفة المزيد عن عمليات الانتشار في الأبحاث التأسيسية على arXiv.
-
عمليات نشر الذكاء الاصطناعي الطرفي: يُعد نشر نماذج ضخمة مثل نموذج تقسيم أي شيء (SAM) على الأجهزة المحمولة أمرًا صعبًا للغاية بسبب قيود الذاكرة. ويساعد ToMe على تقليص البصمة الذاكرية ديناميكيًا، ما يتيح تنفيذ مهام تجزئة الصور المعقدة على الأجهزة الطرفية. وفي السيناريوهات التي تكون فيها السرعة الخالصة أمرًا بالغ الأهمية، غالبًا ما يتحول المهندسون إلى بنيات محسّنة أصليًا وخالية من الانتباه، مثل Ultralytics YOLO26، لتحقيق استدلال طرفي أسرع من البداية إلى النهاية.
مثال بلغة Python: حساب تشابه الرموز#
رغم أن دمج ToMe في بنية كاملة يتطلب تعديل كتل الانتباه، فإن المفهوم الأساسي يعتمد على العثور على الرموز المتشابهة. يوضح مقتطف PyTorch البرمجي التالي كيفية حساب التشابه الجيبي بين مجموعة من الرموز لتحديد الرموز المرشحة للدمج.
import torch
import torch.nn.functional as F
# Simulate a batch of 4 image patches (tokens) with 64-dimensional features
tokens = torch.randn(1, 4, 64)
# Normalize the tokens to easily compute cosine similarity via dot product
normalized_tokens = F.normalize(tokens, p=2, dim=-1)
# Compute the similarity matrix between all tokens (1 x 4 x 4)
similarity_matrix = torch.matmul(normalized_tokens, normalized_tokens.transpose(1, 2))
# Tokens with high similarity scores (close to 1.0) off the diagonal
# are prime candidates for Token Merging.
print("Similarity Matrix:", similarity_matrix)تتطلب مسارات عمل تعلّم الآلة الحديثة موازنة دقيقة بين الدقة والسرعة. وسواء كنت تستخدم دمج الرموز لتحسين ViT مخصص أو تعتمد على كفاءات YOLO26 المتطورة، فإن إدارة مسارات العمل المعقدة هذه تصبح أبسط بكثير بفضل منصة Ultralytics. توفر المنصة منظومة سهلة الاستخدام للتعليق الآلي على البيانات، والتدريب السحابي السلس، ونشر النماذج بصورة موثوقة عبر بيئات متنوعة من أجهزة الحوسبة الطرفية. وتعتمد المؤسسات التي توسّع مبادراتها في الرؤية الحاسوبية على هذه الأدوات لدفع النماذج المتطورة إلى بيئات الإنتاج بموثوقية وكفاءة.






