FP4
Apprends comment la quantification FP4 compresse les modèles d'IA, réduit l'utilisation de la mémoire et accélère l'inférence. Compare les formats NVFP4, MXFP4, FP8, INT4 et FP16.
FP4 est une famille de formats à virgule flottante 4 bits utilisés pour compresser et accélérer les modèles d'IA via la quantification de modèles. Il représente généralement chaque valeur avec un bit de signe, deux bits d'exposant et un bit de mantisse, appelé E2M1. Comparé au FP16, le FP4 peut considérablement réduire le trafic mémoire et le stockage, aidant les GPU pris en charge à traiter de grands modèles plus rapidement. Le format basse précision NVFP4 de NVIDIA est une implémentation importante conçue pour le matériel de génération Blackwell. (developer.nvidia.com)
Link to this sectionComment fonctionne FP4#
Avec seulement 16 motifs de bits possibles, le FP4 simple ne peut pas représenter avec précision la large gamme de valeurs présentes dans les réseaux neuronaux. Les implémentations modernes divisent donc les tenseurs en petits blocs et stockent une échelle partagée pour chaque bloc. Le schéma de quantification NVFP4 de NVIDIA, par exemple, utilise des blocs de 16 valeurs E2M1, tandis que la spécification ouverte OCP Microscaling Formats définit le MXFP4 avec des métadonnées de micro-mise à l'échelle.
Pendant le calcul, un moteur d'inférence quantifie les valeurs de plus haute précision, effectue les opérations matricielles prises en charge en FP4 et renvoie les résultats dans une précision plus élevée si nécessaire. Le support d'inférence TorchAO NVFP4 actuel utilise la quantification dynamique d'activation et une double mise à l'échelle pour les poids et les activations. (docs.nvidia.com)
Link to this sectionComparaison du FP4 avec les formats associés#
- FP16 ou demi-précision : Offre une plage numérique beaucoup plus large et est généralement plus facile à déployer, mais utilise quatre fois plus de bits par valeur.
- FP8 : Fournit généralement une meilleure précision et une meilleure stabilité d'entraînement que le FP4, tout en nécessitant environ deux fois plus de stockage.
- BF16 : Couramment utilisé pour l'entraînement car sa large plage d'exposants réduit le risque de dépassement de capacité. L'étude de 2025 FP4 All the Way a montré qu'un entraînement FP4 soigneusement mis à l'échelle peut approcher les performances du BF16.
- INT4 : Utilise des niveaux entiers plutôt que des exposants à virgule flottante. Le FP4 peut représenter des valeurs sur différentes magnitudes plus naturellement, tandis que l'INT4 peut bien fonctionner pour la compression réservée aux poids.
- NVFP4 contre MXFP4 : Le NVFP4 utilise des blocs plus petits et des échelles de plus haute précision, améliorant généralement la précision à un coût modeste en métadonnées.
FP4 peut également faire référence à un socket de processeur AMD FP4 sans rapport. En IA, FP4 signifie arithmétique à virgule flottante 4 bits, et non l'ancien package CPU pour ordinateur portable.
Link to this sectionApplications concrètes#
-
Inférence d'image générative : NVIDIA a démontré la génération d'images FP4 sur les GPU RTX série 50, réduisant l'utilisation de la mémoire et accélérant les charges de travail de diffusion utilisées dans l'IA générative.
-
Entraînement et service de grands modèles : Les systèmes Blackwell ont utilisé le NVFP4 dans l'entraînement MLPerf pour améliorer le débit des grands modèles de langage. Le FP4 peut de même bénéficier aux futurs systèmes de vision par ordinateur limités par la mémoire qui nécessitent une inférence en temps réel. (developer.nvidia.com)
Link to this sectionUtiliser efficacement le FP4#
En juillet 2026, les opérations matricielles FP4 accélérées par le matériel nécessitent des GPU NVIDIA Blackwell ou plus récents ; le H100 est basé sur Hopper et ne fournit pas d'accélération FP4 native. Tu dois confirmer la compatibilité via la matrice de support matériel TensorRT, valider la précision après conversion et envisager un entraînement conscient de la quantification en utilisant le workflow QAT TorchAO lorsque la quantification post-entraînement provoque une dégradation excessive. (docs.nvidia.com)
Ultralytics fournit actuellement une exportation FP16 et INT8 prête pour la production pour YOLO26. Ce workflow comparable crée un moteur TensorRT optimisé :
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
engine = model.export(format="engine", quantize=16)
results = YOLO(engine).predict("https://ultralytics.com/images/bus.jpg")L'intégration Ultralytics TensorRT explique les options de précision prises en charge, tandis que le mode benchmark YOLO aide à comparer la précision et la latence. Pour un déploiement FP4 expérimental, suis les meilleures pratiques de précision TensorRT-RTX et les techniques spécifiques au format telles que Micro-Rotated GPTQ, car le FP4 n'est pas automatiquement plus précis ou plus rapide qu'un workflow INT4 ou FP8 bien optimisé.






