FP4
FP4 nicelemesinin yapay zekâ modellerini nasıl sıkıştırdığını, bellek kullanımını nasıl azalttığını ve çıkarımı nasıl hızlandırdığını öğren. NVFP4, MXFP4, FP8, INT4 ve FP16 biçimlerini karşılaştır.
FP4, model kuantizasyonu aracılığıyla yapay zekâ modellerini sıkıştırmak ve hızlandırmak için kullanılan 4 bitlik kayan nokta biçimleri ailesidir. Genellikle her değeri bir işaret biti, iki üs biti ve E2M1 olarak adlandırılan bir mantis bitiyle temsil eder. FP16 ile karşılaştırıldığında FP4, bellek trafiğini ve depolama gereksinimini büyük ölçüde azaltarak desteklenen GPU'ların büyük modelleri daha hızlı işlemesine yardımcı olabilir. NVIDIA'nın NVFP4 düşük hassasiyetli biçimi, Blackwell nesli donanımlar için tasarlanmış öne çıkan bir uygulamadır. (developer.nvidia.com)
FP4 Nasıl Çalışır?#
Yalnızca 16 olası bit deseni olduğundan, standart FP4 sinir ağlarında bulunan geniş değer aralığını doğru şekilde temsil edemez. Bu nedenle modern uygulamalar tensörleri küçük bloklara böler ve her blok için ortak bir ölçek değeri depolar. Örneğin NVIDIA'nın NVFP4 kuantizasyon şeması, 16 E2M1 değerinden oluşan bloklar kullanırken açık OCP Microscaling Formats spesifikasyonu, mikro ölçekleme meta verileriyle MXFP4'ü tanımlar.
Hesaplama sırasında bir çıkarım motoru, daha yüksek hassasiyetli değerleri kuantize eder, desteklenen matris işlemlerini FP4 ile gerçekleştirir ve gerektiğinde sonuçları daha yüksek hassasiyette döndürür. Mevcut TorchAO NVFP4 çıkarım desteği, ağırlıklar ve aktivasyonlar için dinamik aktivasyon kuantizasyonu ve çift ölçekleme kullanır. (docs.nvidia.com)
FP4'ün İlgili Biçimlerle Karşılaştırılması#
- FP16 veya yarı hassasiyet: Çok daha geniş bir sayısal aralık sunar ve genellikle dağıtımı daha kolaydır, ancak değer başına dört kat daha fazla bit kullanır.
- FP8: Genellikle FP4'e kıyasla daha iyi doğruluk ve eğitim kararlılığı sağlar, ancak yaklaşık iki kat daha fazla depolama alanı gerektirir.
- BF16: Geniş üs aralığı taşma riskini azalttığı için genellikle eğitimde kullanılır. 2025 tarihli FP4 All the Way çalışması, dikkatle ölçeklendirilmiş FP4 eğitiminin BF16 performansına yaklaşabileceğini gösterdi.
- INT4: Kayan noktalı üsler yerine tamsayı düzeylerini kullanır. FP4, farklı büyüklüklerdeki değerleri daha doğal bir şekilde temsil edebilirken INT4, yalnızca ağırlıkların sıkıştırılmasında iyi sonuç verebilir.
- NVFP4 ile MXFP4 karşılaştırması: NVFP4 daha küçük bloklar ve daha yüksek hassasiyetli ölçekler kullanır; bu da genellikle makul bir meta veri maliyeti karşılığında doğruluğu artırır.
FP4, bununla ilgisi olmayan bir AMD FP4 işlemci soketini de ifade edebilir. Yapay zekâ alanında FP4, eski dizüstü bilgisayar CPU paketini değil, dört bitlik kayan nokta aritmetiğini ifade eder.
Gerçek Dünya Uygulamaları#
-
Üretken görüntü çıkarımı: NVIDIA, RTX 50 Serisi GPU'larda FP4 görüntü üretimini göstererek üretken yapay zekâ uygulamalarında kullanılan difüzyon iş yüklerinin bellek kullanımını azalttı ve hızını artırdı.
-
Büyük model eğitimi ve sunumu: Blackwell sistemleri, büyük dil modeli aktarım hızını artırmak için MLPerf eğitiminde NVFP4 kullandı. FP4, gerçek zamanlı çıkarım gerektiren gelecekteki, bellek bant genişliğiyle sınırlı bilgisayarlı görü sistemlerine de benzer şekilde fayda sağlayabilir. (developer.nvidia.com)
FP4'ü Etkili Kullanma#
Temmuz 2026 itibarıyla donanım hızlandırmalı FP4 matris işlemleri NVIDIA Blackwell veya daha yeni GPU'lar gerektirir; H100, Hopper tabanlıdır ve yerel FP4 hızlandırması sağlamaz. Geliştiriciler, TensorRT donanım destek matrisi üzerinden uyumluluğu doğrulamalı, dönüştürme sonrasında doğruluğu değerlendirmeli ve eğitim sonrası kuantizasyon aşırı bozulmaya neden olduğunda TorchAO QAT iş akışını kullanarak kuantizasyona duyarlı eğitimi değerlendirmelidir. (docs.nvidia.com)
Ultralytics şu anda YOLO26 için üretime hazır FP16 ve INT8 dışa aktarma desteği sunuyor. Bu benzer iş akışı, optimize edilmiş bir TensorRT motoru oluşturur:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
engine = model.export(format="engine", quantize=16)
results = YOLO(engine).predict("https://ultralytics.com/images/bus.jpg")Ultralytics TensorRT entegrasyonu, desteklenen hassasiyet seçeneklerini açıklar; YOLO kıyaslama modu ise doğruluk ve gecikmeyi karşılaştırmaya yardımcı olur. Deneysel FP4 dağıtımı için TensorRT-RTX hassasiyet en iyi uygulamalarını ve Micro-Rotated GPTQ gibi biçime özgü teknikleri izleyin; çünkü FP4, iyi optimize edilmiş bir INT4 veya FP8 iş akışından otomatik olarak daha doğru ya da daha hızlı değildir.






