Tokenization
Tokenleştirmenin ham metin ve görüntüleri yapay zekâya hazır verilere nasıl dönüştürdüğünü keşfet. Ultralytics YOLO26 gibi modellerin kullandığı NLP ve bilgisayarlı görü yöntemlerini öğren.
Tokenizasyon, metin, görüntü veya ses gibi ham veri akışını token adı verilen daha küçük ve yönetilebilir birimlere ayıran algoritmik süreçtir. Bu dönüşüm, veri ön işleme işlem hattında kritik bir köprü görevi görerek yapılandırılmamış girdiyi yapay zekâ (AI) sistemlerinin yorumlayabileceği sayısal bir biçime dönüştürür. Bilgisayarlar insan dilini veya görsel sahneleri kendiliğinden anlayamaz; hesaplama yapabilmek için sayısal gösterimlere ihtiyaç duyar. Verileri tokenlara bölümlere ayırarak mühendisler, sinir ağlarının bu birimleri anlamsal anlamı yakalayan vektör gösterimleri olan gömme vektörleriyle eşleştirmesini sağlar. Bu temel adım olmadan makine öğrenimi modelleri, modern eğitim için gereken geniş veri kümelerindeki örüntüleri belirleyemez, bağlamı öğrenemez veya bu veri kümelerini işleyemez.
Tokenizasyon ve Token#
Terimler derin öğrenme tartışmalarında sıklıkla birlikte duyulsa da iş akışını anlamak için yöntemi sonuçtan ayırmak yararlıdır.
- Tokenizasyon süreçtir (fiil). Verileri bölmek için kullanılan belirli kural veya algoritma kümesini ifade eder. Metin için bu işlem, bir birimin nerede bitip diğerinin nerede başladığını belirlemek üzere NLTK veya spaCy gibi kitaplıkların kullanılmasını içerebilir.
- Token çıktıdır (isim). Süreç tarafından oluşturulan tek bir kelime, alt kelime, karakter veya piksel parçası gibi bağımsız birimdir.
Farklı Alanlardaki Yöntemler#
Tokenizasyon stratejisi, verinin modalitesine bağlı olarak önemli ölçüde değişir ve bir temel modelin dünyayı nasıl algıladığını etkiler.
NLP'de Metin Tokenizasyonu#
Doğal Dil İşleme (NLP) alanında amaç, anlamı koruyarak metni bölümlere ayırmaktır. İlk yöntemler, kelimeleri boşluklarla ayırmak veya etkisiz kelimeleri kaldırmak gibi basit tekniklere dayanıyordu. Ancak modern Büyük Dil Modelleri (LLMs), Bayt Çifti Kodlama (BPE) veya WordPiece gibi daha gelişmiş alt kelime algoritmalarını kullanır. Bu algoritmalar, en sık görülen karakter çiftlerini yinelemeli olarak birleştirerek modelin nadir kelimeleri tanıdık alt bileşenlere ayırıp işlemesini sağlar (ör. "smartphones" kelimesi "smart" + "phones" hâline gelir). Bu yaklaşım, kelime dağarcığının boyutuyla karmaşık dili temsil etme becerisi arasında denge kurar.
Bilgisayarlı Görüde Görsel Tokenizasyon#
Geleneksel olarak bilgisayarlı görü (CV) modelleri, CNN'ler gibi, pikselleri kayan pencereler kullanarak işlerdi. Vision Transformer (ViT) modelinin ortaya çıkışı, görüntülere tokenizasyon uygulayarak bu paradigmayı değiştirdi. Görüntü, sabit boyutlu parçalara (ör. 16x16 piksel) ayrılır; ardından bu parçalar düzleştirilir ve doğrusal olarak yansıtılır. Bu "görsel tokenlar", modelin görüntü genelindeki ilişkileri öğrenmek için öz-dikkat mekanizmalarından yararlanmasını sağlar; bu süreç, bir Transformer modelinin cümleyi işlemesine benzer.
Gerçek Dünya Uygulamaları#
Tokenizasyon, günümüzde üretim ortamlarında kullanılan birçok AI uygulamasının arkasındaki görünmez motordur.
-
Açık Kelime Dağarcıklı Nesne Algılama: YOLO-World gibi gelişmiş mimariler çok modlu model yaklaşımını kullanır. Kullanıcı "kırmızı şapka takan kişi" gibi bir istem girdiğinde sistem bu metni tokenlara ayırır ve görsel verilerle aynı özellik uzayına eşler. Bu, sıfır atışlı öğrenmeyi mümkün kılar; model, metin tokenlarını görsel özelliklerle eşleştirerek açıkça üzerinde eğitim almadığı nesneleri algılayabilir.
-
Üretken Sanat ve Tasarım: Metinden görüntüye üretimde, difüzyon sürecini yönlendirmek için kullanıcı istemleri tokenlara ayrılır. Model, üretimi koşullandırmak için bu tokenları kullanır ve elde edilen görüntünün tokenizasyon aşamasında çıkarılan anlamsal kavramlarla (ör. "gün batımı", "plaj") uyumlu olmasını sağlar.
Python Örneği: Token Tabanlı Algılama#
Aşağıdaki örnek, ultralytics paketinin YOLO-World iş akışı içinde metin tokenizasyonunu örtük olarak nasıl kullandığını gösterir. Özel sınıflar tanımlandığında model, belirli nesneleri dinamik olarak aramak için bu dizeleri tokenlara ayırır.
from ultralytics import YOLO
# Load a pre-trained YOLO-World model capable of text-based detection
model = YOLO("yolov8s-world.pt")
# Define custom classes; these are tokenized internally to guide the model
# The model will look for visual features matching these text tokens
model.set_classes(["backpack", "bus"])
# Run prediction on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results (only detects the tokenized classes defined above)
results[0].show()Model Performansına Etkisi#
Tokenizasyon stratejisinin seçimi, doğruluğu ve hesaplama verimliliğini doğrudan etkiler. Verimsiz tokenizasyon, NLP'de "kelime dağarcığı dışı" hatalara veya görüntü analizinde ince ayrıntıların kaybolmasına yol açabilir. PyTorch ve TensorFlow gibi çerçeveler bu adımı optimize etmek için esnek araçlar sağlar. Mimariler, son teknoloji YOLO26 gibi gelişmelerle evrilirken verimli veri işleme, modellerin güçlü bulut GPU'larından uç cihazlara kadar farklı donanımlarda gerçek zamanlı çıkarım çalıştırabilmesini sağlar. Bu karmaşık veri iş akışlarını yöneten ekipler, veri kümesi açıklamasını, model eğitimini ve dağıtımı kolaylaştırmak için genellikle Ultralytics Platform kullanır.









