Tokenization
استكشف كيف يحول الترميز (tokenization) النصوص الخام والصور إلى بيانات جاهزة للذكاء الاصطناعي. تعلم أساليب معالجة اللغات الطبيعية والرؤية الحاسوبية التي تستخدمها نماذج مثل Ultralytics YOLO26.
الترميز هو العملية الخوارزمية لتقسيم تدفق البيانات الخام — مثل النص أو الصور أو الصوت — إلى وحدات أصغر قابلة للإدارة تسمى الرموز (Tokens). تعمل هذه العملية التحويلية كجسر حيوي في خط أنابيب data preprocessing، حيث تحول المدخلات غير المنظمة إلى تنسيق رقمي يمكن أن تفسره أنظمة artificial intelligence (AI). لا تستطيع أجهزة الكمبيوتر بطبيعتها فهم اللغة البشرية أو المشاهد المرئية؛ فهي تتطلب تمثيلات رقمية لإجراء الحسابات. من خلال تقسيم البيانات إلى رموز، يمكن للمهندسين تمكين neural networks من تعيين هذه الوحدات إلى embeddings — وهي تمثيلات متجهة تلتقط المعنى الدلالي. بدون هذه الخطوة الأساسية، ستكون نماذج machine learning عاجزة عن تحديد الأنماط أو تعلم السياق أو معالجة datasets الضخمة المطلوبة للتدريب الحديث.
الترميز مقابل الرمز#
على الرغم من أن المصطلحات تُسمع غالباً معاً في مناقشات deep learning، فمن المفيد التمييز بين الطريقة والنتيجة لفهم سير العمل.
- Tokenization هو العملية (الفعل). يشير إلى مجموعة محددة من القواعد أو الخوارزميات المستخدمة لتقسيم البيانات. بالنسبة للنص، قد يتضمن ذلك استخدام مكتبات مثل NLTK أو spaCy لتحديد المكان الذي تنتهي فيه وحدة ويبدأ فيه أخرى.
- Token هو الناتج (الاسم). وهو الوحدات الفردية التي يتم إنشاؤها بواسطة العملية، مثل كلمة واحدة، أو كلمة فرعية، أو حرف، أو جزء من بكسلات.
الطرق عبر المجالات المختلفة#
تختلف استراتيجية الترميز بشكل كبير اعتماداً على نمط البيانات، مما يؤثر على كيفية إدراك foundation model للعالم.
ترميز النصوص في معالجة اللغات الطبيعية#
في Natural Language Processing (NLP)، الهدف هو تجزئة النص مع الحفاظ على المعنى. اعتمدت الطرق المبكرة على تقنيات بسيطة مثل فصل الكلمات بالمسافات أو إزالة stop words. ومع ذلك، تستخدم Large Language Models (LLMs) الحديثة خوارزميات كلمات فرعية أكثر تطوراً، مثل Byte Pair Encoding (BPE) أو WordPiece. تقوم هذه الخوارزميات دمج الأزواج الأكثر تكراراً من الحروف تكراراً، مما يتيح للنموذج التعامل مع الكلمات النادرة عن طريق تقسيمها إلى مكونات فرعية مألوفة (على سبيل المثال، تصبح "smartphones" عبارة عن "smart" + "phones"). يوازن هذا النهج بين حجم المفردات والقدرة على تمثيل اللغة المعقدة.
الترميز المرئي في الرؤية الحاسوبية#
تقليدياً، كانت نماذج computer vision (CV) مثل الشبكات العصبية الالتفافية CNNs تعالج البكسلات باستخدام النوافذ المنزلقة. أدى إدخال Vision Transformer (ViT) إلى تغيير هذا النموذج من خلال تطبيق الترميز على الصور. يتم تقطيع الصورة إلى رقع ذات حجم ثابت (على سبيل المثال، 16x16 بكسل)، والتي يتم بعد ذلك تسطيحها وإسقاطها خطياً. تتيح هذه "الرموز المرئية" للنموذج استخدام آليات self-attention لتعلم العلاقات العالمية عبر الصورة، على غرار كيفية معالجة Transformer للجملة.
تطبيقات العالم الحقيقي#
الترميز هو المحرك الصامت وراء العديد من تطبيقات الذكاء الاصطناعي المستخدمة في بيئات الإنتاج اليوم.
-
اكتشاف الكائنات مفتوحة المفردات: تستخدم الهندسة المعمارية المتقدمة مثل YOLO-World نهج multi-modal model. عندما يقوم المستخدم بإدخال موجه مثل "شخص يرتدي قبعة حمراء"، يقوم النظام بترميز هذا النص وتعيينه إلى نفس مساحة الميزات مثل البيانات المرئية. يتيح ذلك zero-shot learning، مما يسمح للنموذج باكتشاف الكائنات التي لم يتم تدريبه عليها صراحةً من خلال مطابقة رموز النص مع الميزات المرئية.
-
الفن والتصميم التوليدي: في توليد text-to-image، يتم ترميز موجهات المستخدم لتوجيه عملية الانتشار. يستخدم النموذج هذه الرموز لتكييف التوليد، مما يضمن توافق الصورة الناتجة مع المفاهيم الدلالية (مثل "غروب الشمس"، "الشاطئ") المستخرجة خلال مرحلة الترميز.
مثال Python: الاكتشاف القائم على الرموز#
يوضح المثال التالي كيف تستخدم حزمة ultralytics ترميز النصوص ضمناً داخل سير عمل YOLO-World. من خلال تحديد فئات مخصصة، يقوم النموذج بترميز هذه السلاسل للبحث عن كائنات محددة ديناميكياً.
from ultralytics import YOLO
# Load a pre-trained YOLO-World model capable of text-based detection
model = YOLO("yolov8s-world.pt")
# Define custom classes; these are tokenized internally to guide the model
# The model will look for visual features matching these text tokens
model.set_classes(["backpack", "bus"])
# Run prediction on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results (only detects the tokenized classes defined above)
results[0].show()التأثير على أداء النموذج#
يؤثر اختيار استراتيجية الترميز بشكل مباشر على accuracy والكفاءة الحسابية. يمكن أن تؤدي غير الفعالة للترميز إلى أخطاء "خارج المفردات" في معالجة اللغات الطبيعية أو فقدان التفاصيل الدقيقة في تحليل الصور. توفر الأطر مثل PyTorch وTensorFlow أدوات مرنة لتحسين هذه الخطوة. مع تطور الهياكل المعمارية — مثل YOLO26 المتطور — تضمن معالجة البيانات بكفاءة إمكانية تشغيل النماذج real-time inference على أجهزة متنوعة، من وحدات معالجة الرسومات السحابية القوية إلى أجهزة الحافة. غالباً ما تعتمد الفرق التي تدير سير عمل البيانات المعقدة هذه على Ultralytics Platform تبسيط تعليقات مجموعات البيانات، model training، والنشر.






