Diffusion Models
Difüzyon modellerinin yüksek doğruluklu veriler oluşturmak için üretici yapay zekâyı nasıl kullandığını keşfet. Ultralytics YOLO26 eğitimini gerçekçi sentetik verilerle nasıl geliştireceğini bugün öğren.
Difüzyon modelleri, kademeli bir gürültü ekleme sürecini tersine çevirerek yeni veri örnekleri oluşturmayı öğrenen bir üretken yapay zekâ algoritmaları sınıfıdır. Verilerden etiketleri tahmin eden nesne algılama veya sınıflandırma gibi görevlerde kullanılan geleneksel ayrıştırıcı modellerin aksine difüzyon modelleri, gerçek dünya verilerinin istatistiksel özelliklerini yakından taklit eden, özellikle görüntü, ses ve video olmak üzere yüksek kaliteli içerikler üretmeye odaklanır. Eğitim kararlılıkları ve çeşitli çıktılar üretebilme yetenekleri sayesinde, Üretici Çekişmeli Ağlar (GANs) gibi önceki liderleri geride bırakarak yüksek çözünürlüklü görüntü sentezi için hızla son teknoloji çözüm hâline gelmişlerdir.
Difüzyon Modelleri Nasıl Çalışır#
Bir difüzyon modelinin temel mekanizması denge dışı termodinamiğe dayanır. Eğitim süreci iki farklı aşamadan oluşur: ileri süreç (difüzyon) ve ters süreç (gürültü giderme).
- İleri Süreç: Bu aşamada, bir dizi zaman adımı boyunca küçük miktarlarda Gauss gürültüsü eklenerek bir eğitim görüntüsünün yapısı sistematik olarak bozulur. Süreç devam ettikçe karmaşık veriler (örneğin bir kedi fotoğrafı) kademeli olarak saf, yapılandırılmamış rastgele gürültüye dönüşür.
- Ters Süreç: Sinir ağının amacı bu bozulmayı nasıl tersine çevireceğini öğrenmektir. Model, rastgele gürültüden başlayarak her adımda eklenen gürültüyü tahmin eder ve bunu çıkarır. Model, gürültüyü yinelemeli olarak kaldırarak tutarlı, yüksek kaliteli bir görüntü ortaya çıkana kadar rastgele sinyali "gürültüden arındırır".
Bu yinelemeli iyileştirme, ince ayrıntılar ve doku üzerinde olağanüstü bir kontrol sağlar ve tek adımlı üretim yöntemlerine kıyasla önemli bir avantaj sunar.
Gerçek Dünya Uygulamaları#
Difüzyon modelleri, akademik araştırmaların ötesine geçerek çeşitli sektörlerde pratik, üretim ortamına hazır araçlar hâline gelmiştir.
- Sentetik Veri Üretimi: Bilgisayarlı görü mühendisleri için en değerli uygulamalardan biri, eğitim veri kümelerini zenginleştirmek üzere sentetik veri oluşturmaktır. Bir veri kümesinde çeşitlilik eksikse (örneğin karlı koşullardaki araba görüntüleri yoksa), difüzyon modeli gerçekçi varyasyonlar üretebilir. Bu, öngörülemeyen ortamlarda kullanıma alındığında YOLO26 gibi görü modellerinin sağlamlığını artırmaya yardımcı olur.
- Görüntü İç boyama ve Düzenleme: Difüzyon modelleri, kullanıcıların bir görüntünün belirli bölgelerini değiştirmesine olanak tanıyan gelişmiş düzenleme araçlarına güç verir. İç boyama olarak bilinen bu teknik, çevredeki bağlama dayanarak istenmeyen nesneleri kaldırabilir veya bir fotoğrafın eksik kısımlarını doldurabilir. Mimarlar ve tasarımcılar, manuel 3B işleme gerektirmeden ürünlerde veya ortamlarda yapılacak değişiklikleri görselleştirmek ve hızlı prototip oluşturmak için bu tekniği kullanır.
Temel Terimleri Ayırt Etme#
Difüzyon modellerini diğer üretken mimarilerden ayırt etmek faydalıdır:
- Difüzyon Modelleri ve GANs Karşılaştırması: GANs iki rekabet hâlindeki ağ (üretici ve ayrıştırıcı) kullanır ve hızlı örneklemeleriyle bilinir; ancak modelin sınırlı çeşitlilikte çıktı ürettiği "mod çökmesi" sorunundan sıklıkla mustariptir. Difüzyon modelleri genellikle eğitim sırasında daha kararlıdır ve veri dağılımını daha kapsamlı biçimde kapsar; ancak çıkarım sırasında daha yavaş olabilirler.
- Difüzyon Modelleri ve VAEs Karşılaştırması: Varyasyonel Otokodlayıcılar (VAEs) verileri gizli bir uzaya sıkıştırır ve ardından yeniden oluşturur. VAEs hızlı olsa da ürettikleri görüntüler, difüzyon süreçlerinin oluşturduğu net ayrıntılara kıyasla bazen bulanık görünebilir.
Pratik Uygulama#
Bir difüzyon modelini sıfırdan eğitmek önemli miktarda hesaplama gücü gerektirse de mühendisler, önceden eğitilmiş modellerden yararlanabilir veya bunları verimli algılayıcılarla birlikte iş akışlarına entegre edebilir. Örneğin bir veri kümesi için arka plan varyasyonları üretmek üzere difüzyon modeli kullanabilir, ardından bu zenginleştirilmiş veriler üzerinde bir algılama modeline açıklama eklemek ve modeli eğitmek için Ultralytics Platformu kullanabilirsin.
Aşağıda, bu sistemlerin eğitiminin temelini oluşturan basit bir ileri difüzyon adımını (gürültü ekleme) simüle etmek için torch kullanan kavramsal bir örnek yer alıyor.
import torch
def add_noise(image_tensor, noise_level=0.1):
"""Simulates a single step of the forward diffusion process by adding Gaussian noise."""
# Generate Gaussian noise with the same shape as the input image
noise = torch.randn_like(image_tensor) * noise_level
# Add noise to the original image
noisy_image = image_tensor + noise
# Clamp values to ensure they remain valid image data (e.g., 0.0 to 1.0)
return torch.clamp(noisy_image, 0.0, 1.0)
# Create a dummy image tensor (3 channels, 64x64 pixels)
dummy_image = torch.rand(1, 3, 64, 64)
noisy_result = add_noise(dummy_image)
print(f"Original shape: {dummy_image.shape}, Noisy shape: {noisy_result.shape}")Geleceğe Yönelik Çalışmalar#
Alan, hesaplama maliyetlerini azaltmak için piksel uzayı yerine sıkıştırılmış bir gizli uzayda çalışan gizli difüzyon modellerine (LDMs) doğru hızla gelişiyor. Bu verimlilik, güçlü üretken modellerin tüketici donanımlarında çalıştırılmasını mümkün kılıyor. Araştırmalar devam ettikçe üretken girdiler ile ayrıştırıcı görevler arasında daha sıkı bir entegrasyon bekliyoruz; örneğin otonom araçların güvenliğini doğrulamak için difüzyon tarafından üretilen senaryoları kullanmak veya nadir patolojileri simüle ederek tıbbi görüntü analizini iyileştirmek gibi.









