FP4
Aprende cómo la cuantización FP4 comprime los modelos de IA, reduce el uso de memoria y acelera la inferencia. Compara los formatos NVFP4, MXFP4, FP8, INT4 y FP16.
FP4 es una familia de formatos de coma flotante de 4 bits que se utilizan para comprimir y acelerar modelos de IA mediante la cuantización de modelos. Normalmente representa cada valor con un bit de signo, dos bits de exponente y un bit de mantisa, lo que se denomina E2M1. En comparación con FP16, FP4 puede reducir considerablemente el tráfico de memoria y el almacenamiento, lo que ayuda a las GPU compatibles a procesar modelos grandes más rápidamente. El formato de baja precisión NVFP4 de NVIDIA es una implementación destacada diseñada para hardware de la generación Blackwell. (developer.nvidia.com)
Cómo funciona FP4#
Con solo 16 patrones de bits posibles, el FP4 básico no puede representar con precisión el amplio rango de valores que se encuentran en las redes neuronales. Por eso, las implementaciones modernas dividen los tensores en bloques pequeños y almacenan una escala compartida para cada bloque. El esquema de cuantización NVFP4 de NVIDIA, por ejemplo, utiliza bloques de 16 valores E2M1, mientras que la especificación OCP Microscaling Formats abierta define MXFP4 con metadatos de microescalado.
Durante el cálculo, un motor de inferencia cuantiza los valores de mayor precisión, realiza las operaciones matriciales compatibles en FP4 y devuelve los resultados con una precisión mayor cuando es necesario. La compatibilidad actual de TorchAO con la inferencia NVFP4 utiliza cuantización dinámica de activaciones y doble escalado para los pesos y las activaciones. (docs.nvidia.com)
FP4 en comparación con formatos relacionados#
- FP16 o precisión media: Ofrece un rango numérico mucho más amplio y, por lo general, es más fácil de implementar, pero utiliza cuatro veces más bits por valor.
- FP8: Normalmente proporciona más precisión y estabilidad durante el entrenamiento que FP4, aunque requiere aproximadamente el doble de almacenamiento.
- BF16: Se utiliza habitualmente para el entrenamiento porque su amplio rango de exponentes reduce el riesgo de desbordamiento. El estudio de 2025 FP4 hasta el final mostró que un entrenamiento en FP4 cuidadosamente escalado puede acercarse al rendimiento de BF16.
- INT4: Utiliza niveles enteros en lugar de exponentes de coma flotante. FP4 puede representar valores de distintos órdenes de magnitud de forma más natural, mientras que INT4 puede funcionar bien para la compresión exclusiva de pesos.
- NVFP4 frente a MXFP4: NVFP4 utiliza bloques más pequeños y escalas de mayor precisión, lo que normalmente mejora la precisión con un coste moderado en metadatos.
FP4 también puede hacer referencia a un zócalo de procesador AMD FP4 no relacionado. En IA, FP4 significa aritmética de coma flotante de cuatro bits, no el antiguo encapsulado de CPU para portátiles.
Aplicaciones en el mundo real#
-
Inferencia de imágenes generativas: NVIDIA mostró la generación de imágenes en FP4 en GPU de la serie RTX 50, reduciendo el uso de memoria y acelerando las cargas de trabajo de difusión utilizadas en la IA generativa.
-
Entrenamiento y servicio de modelos grandes: Los sistemas Blackwell han utilizado NVFP4 en el entrenamiento de MLPerf para mejorar el rendimiento de modelos de lenguaje grandes. FP4 también puede beneficiar a futuros sistemas de visión artificial limitados por la memoria que requieran inferencia en tiempo real. (developer.nvidia.com)
Uso eficaz de FP4#
En julio de 2026, las operaciones matriciales FP4 aceleradas por hardware requieren GPU NVIDIA Blackwell o posteriores; la H100 se basa en Hopper y no proporciona aceleración FP4 nativa. Confirma la compatibilidad mediante la matriz de compatibilidad de hardware de TensorRT, valida la precisión después de la conversión y considera el entrenamiento consciente de la cuantización mediante el flujo de trabajo QAT de TorchAO cuando la cuantización posterior al entrenamiento provoque una degradación excesiva. (docs.nvidia.com)
Actualmente, Ultralytics proporciona exportación de FP16 e INT8 lista para producción para YOLO26. Este flujo de trabajo comparable crea un motor TensorRT optimizado:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
engine = model.export(format="engine", quantize=16)
results = YOLO(engine).predict("https://ultralytics.com/images/bus.jpg")La integración de TensorRT de Ultralytics explica las opciones de precisión compatibles, mientras que el modo de evaluación comparativa de YOLO ayuda a comparar la precisión y la latencia. Para una implementación experimental de FP4, sigue las prácticas recomendadas de precisión de TensorRT-RTX y técnicas específicas del formato, como Micro-Rotated GPTQ, ya que FP4 no es automáticamente más preciso ni más rápido que un flujo de trabajo INT4 o FP8 bien optimizado.






