Diffusion Language Models
Difüzyon dil modellerinin yinelemeli gürültü giderme yoluyla metni nasıl oluşturduğunu ve düzenlediğini, transformer yapıları, uygulamaları, faydaları ve sınırlamaları hakkındaki içgörülerle birlikte öğren.
Difüzyon dil modelleri, her bir token'ı katı bir şekilde soldan sağa üretmek yerine, yinelemeli gürültü giderme (denoising) yoluyla metin üreten veya düzenleyen üretken modellerdir. Maskelenmiş, değiştirilmiş veya belirsiz token'lar içeren bozulmuş bir dizilimle başlarlar ve metin tutarlı hale gelene kadar birden fazla konumu defalarca iyileştirirler. Bu yaklaşım, dil modelleme ve difüzyon modelleri fikirlerini birleştirerek geleneksel sonraki token üretimine bir alternatif sunar.
Link to this sectionDifüzyon Dil Modelleri Nasıl Çalışır?#
Metin öncelikle tokenizasyon aracılığıyla kelimelere, alt kelimelere, karakterlere veya diğer ayrık birimlere bölünür. Eğitim sırasında ileri yönlü bir bozulma süreci, token dizilerindeki bilgileri kademeli olarak kaldırır. Uygulamaya bağlı olarak token'lar maske sembolleriyle, örneklenmiş alternatiflerle veya gömmeler (embeddings) adı verilen gürültülü sürekli temsillerle değiştirilebilir.
Model ters süreci öğrenir: bozulmuş dizilerin daha temiz versiyonlarını tahmin etmek. Çıkarım (inference) zamanında, büyük ölçüde maskelenmiş veya gürültülü bir blokla başlar ve birkaç iyileştirme adımı gerçekleştirir. Erken adımlar geniş anlamı ve yapıyı kurarken, sonraki adımlar kelime dağarcığını, dilbilgisini, biçimlendirmeyi ve yerel tutarlılığı düzeltir.
Birçok difüzyon dil modeli, diziyi işlemek için bir transformer kullanır. Transformer'lar bu görev için çok uygundur çünkü dikkat mekanizmaları (attention mechanism) her token'ı çevreleyen bağlamla ilişkilendirebilir. PyTorch Transformer belgeleri, bu alttaki mimarinin yararlı bir genel bakışını sunar.
Sabit bir boşluk doldurma (fill-in-the-blank) sisteminden farklı olarak difüzyon üretimi, tahminleri defalarca yeniden değerlendirebilir. Bir adım sırasında seçilen bir token kalıcı olmak zorunda değildir; dizinin geri kalanı daha iyi bir bağlam sağladığında sonraki yinelemeler bunu revize edebilir. Google DeepMind'ın metin difüzyonuna genel bakışı, bu blok düzeyindeki yinelemeli üretim modelini örneklemektedir.
Link to this sectionDifüzyon Modelleri ve İlgili Kavramlar#
Birbirleriyle yakından ilişkili çeşitli terimler farklı hedefleri veya mimarileri tanımlar:
- Otoregresif büyük dil modelleri, her tahmin önceki çıktıya koşullandırılmış olarak token'ları sırayla üretir. Bu nedensel süreç, TensorFlow'un otoregresif metin üretimi eğitiminde gösterilmektedir. Difüzyon modelleri ise her iyileştirme adımında birçok konumu güncelleyebilir.
- Maskelenmiş dil modelleri, her iki taraftaki bağlamı kullanarak bilerek gizlenmiş token'ları tahmin eder. Keras maskelenmiş dil modelleme örneği bu eğitim amacını göstermektedir. Difüzyon dil modelleri bu fikri, çok sayıda bozulma seviyesi ve gürültü giderme yinelemesi içeren eksiksiz bir üretim sürecine genişletir.
- Stable Diffusion büyük bir dil modeli değil, bir görüntü üretim sistemidir. Stability AI'ın Stable Diffusion görüntü hizmetleri görsel içerik üretip düzenlerken, difüzyon dil modelleri metin token'ları veya bunların temsilleri üzerinde çalışır.
- Difüzyon Transformer'ları, genellikle görüntü veya video üretimi için difüzyon sistemleri içinde transformer'ların kullanımını tanımlar. Bir difüzyon dil modeli, yalnızca yapay sinir ağı mimarisiyle değil, metin üretme hedefiyle tanımlanır.
Link to this sectionGerçek Dünya Uygulamaları#
Somut uygulamalardan biri belge ve kod düzenlemedir. İmlecin sonuna metin eklemek yerine, bir difüzyon dil modeli tüm taslağı veya seçilen bir aralığı iyileştirebilir. Örneğin, blok genelinde değişken adlarını, içe aktarmaları (imports) ve yorumları revize ederken eksik bir işlevi yeniden oluşturabilir. Hem önceki hem de sonraki bağlamı kullanabilme yeteneği, bir konumdaki düzeltmeler başka bir konumu etkilediğinde değerlidir.
İkinci bir uygulama çok modlu analitiktir. Bir görüş sistemi bir görüntüden olgusal bilgi çıkarabilir, ardından bir difüzyon dil modeli bu gözlemlere dayanan bir raporu, altyazıyı veya yanıtı yinelemeli olarak oluşturabilir. Örneğin, nesne tespiti bileşeni dil bileşeni bir olay özeti taslağı hazırlamadan önce bir trafik sahnesindeki araçları ve insanları tanımlayabilir.
Aşağıdaki iş akışı, sonraki dil üretimi için yapılandırılmış görsel bağlam oluşturmak üzere Ultralytics YOLO26 kullanır:
from ultralytics import YOLO
# Run object detection on a sample image
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
# Convert detections into compact language-model context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})
visual_context = ", ".join(object_names)
print(visual_context)YOLO tahmin iş akışı yapılandırılmış çıktılar döndürürken, Results.summary() yöntemi algılamaları bir dil boru hattına (pipeline) aktarılması daha kolay olan sözlüklere dönüştürür. Bu ayrım, dil modeli yinelemeli kompozisyonu ele alırken görüş modelinin temellendirilmiş gözlemler sağlamasına olanak tanır.
Link to this sectionFaydalar, Sınırlamalar ve Pratik Rehberlik#
Difüzyon dil modelleri paralel olarak birden fazla token önerebilir, önceki seçimleri revize edebilir ve iç doldurmayı (infilling) veya kısıtlı düzenlemeyi doğal olarak destekleyebilir. Bununla birlikte, paralel tahmin daha düşük uçtan uca gecikme süresini garanti etmez: üretim hala çok sayıda gürültü giderme adımı gerektirir ve hız, dizi uzunluğuna, model boyutuna, donanıma ve örnekleme stratejisine bağlıdır.
Metin ayrıca ayrıktır, bu da kademeli bozulmayı sürekli görüntü pikseline gürültü eklemekten daha az doğal hale getirir. Yanlış yapılandırılmış sistemler tekrarlar üretebilir, gerekli ayrıntıları atlayabilir, doğru metni gereksiz yere değiştirebilir veya çıktı uzunluğunu belirlemekte zorlanabilir.
Ekipler temsilci komut istemlerinde (prompts) görev doğruluğunu, olgusallığı, düzenleme kararlılığını, gecikmeyi ve kaynak kullanımını değerlendirmelidir. Üretken yapay zeka değerlendirmesi hakkında Google Cloud kılavuzu, dil kalitesi bağlama bağlı olduğundan otomatik metriklerin insan değerlendirmesiyle birleştirilmesini önerir. Etkisi yüksek dağıtımlar ayrıca NIST AI Risk Yönetimi Çerçevesi gibi yapılandırılmış bir süreci takip etmelidir.
Görsel uygulamalar için Ultralytics Platform veri kümesi etiketlemeyi, model eğitimini, dağıtımı ve izlemeyi destekleyerek ekiplerin aşağı akış difüzyon tabanlı dil iş akışlarını temellendirebilecek algılama bileşenini oluşturmasına yardımcı olur.






