FP4
Aprende como a quantização FP4 comprime modelos de IA, reduz a utilização de memória e acelera a inferência. Compara os formatos NVFP4, MXFP4, FP8, INT4 e FP16.
FP4 é uma família de formatos de ponto flutuante de 4 bits usada para comprimir e acelerar modelos de IA por meio da quantização de modelos. Normalmente, representa cada valor com um bit de sinal, dois bits de expoente e um bit de mantissa, o que é chamado de E2M1. Em comparação com FP16, FP4 pode reduzir significativamente o tráfego de memória e o armazenamento, ajudando GPUs compatíveis a processar modelos grandes mais rapidamente. O formato de baixa precisão NVFP4 da NVIDIA é uma implementação de destaque projetada para hardware da geração Blackwell. (developer.nvidia.com)
Como o FP4 funciona#
Com apenas 16 padrões de bits possíveis, o FP4 simples não consegue representar com precisão a ampla faixa de valores encontrada nas redes neurais. Por isso, as implementações modernas dividem os tensores em pequenos blocos e armazenam uma escala compartilhada para cada bloco. O esquema de quantização NVFP4 da NVIDIA, por exemplo, usa blocos de 16 valores E2M1, enquanto a especificação OCP Microscaling Formats aberta define o MXFP4 com metadados de microscaling.
Durante a computação, um motor de inferência quantiza valores de maior precisão, executa operações matriciais compatíveis em FP4 e retorna os resultados em uma precisão maior quando necessário. O suporte atual à inferência NVFP4 no TorchAO usa quantização dinâmica das ativações e escala dupla para pesos e ativações. (docs.nvidia.com)
Comparação do FP4 com formatos relacionados#
- FP16 ou meia precisão: Oferece uma faixa numérica muito mais ampla e, em geral, é mais fácil de implantar, mas usa quatro vezes mais bits por valor.
- FP8: Normalmente oferece melhor precisão e estabilidade de treinamento do que FP4, embora exija aproximadamente o dobro de armazenamento.
- BF16: É comumente usado para treinamento porque sua ampla faixa de expoentes reduz o risco de overflow. O estudo FP4 All the Way, de 2025, mostrou que o treinamento em FP4 cuidadosamente escalado pode se aproximar do desempenho do BF16.
- INT4: Usa níveis inteiros em vez de expoentes de ponto flutuante. O FP4 pode representar valores de diferentes magnitudes de forma mais natural, enquanto o INT4 pode funcionar bem para compressão apenas dos pesos.
- NVFP4 versus MXFP4: O NVFP4 usa blocos menores e escalas de maior precisão, normalmente melhorando a precisão a um custo moderado de metadados.
FP4 também pode se referir a um socket de processador AMD FP4 não relacionado. Em IA, FP4 significa aritmética de ponto flutuante de quatro bits, não o antigo encapsulamento de CPU para laptops.
Aplicações no mundo real#
-
Inferência de imagens generativas: A NVIDIA demonstrou geração de imagens em FP4 em GPUs da série RTX 50, reduzindo o uso de memória e acelerando cargas de trabalho de difusão usadas em IA generativa.
-
Treinamento e disponibilização de modelos grandes: Os sistemas Blackwell usaram NVFP4 no treinamento do MLPerf para melhorar o throughput de modelos de linguagem grandes. O FP4 também pode beneficiar futuros sistemas de visão computacional limitados pela memória que exigem inferência em tempo real. (developer.nvidia.com)
Usando FP4 de forma eficaz#
Em julho de 2026, as operações matriciais em FP4 aceleradas por hardware exigem GPUs NVIDIA Blackwell ou mais recentes; a H100 é baseada em Hopper e não oferece aceleração nativa de FP4. Os desenvolvedores devem confirmar a compatibilidade por meio da matriz de suporte de hardware do TensorRT, validar a precisão após a conversão e considerar o treinamento consciente da quantização usando o fluxo de trabalho QAT do TorchAO quando a quantização pós-treinamento causar degradação excessiva. (docs.nvidia.com)
Atualmente, a Ultralytics oferece exportação pronta para produção em FP16 e INT8 para o YOLO26. Este fluxo de trabalho comparável cria um mecanismo TensorRT otimizado:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
engine = model.export(format="engine", quantize=16)
results = YOLO(engine).predict("https://ultralytics.com/images/bus.jpg")A integração do TensorRT da Ultralytics explica as opções de precisão compatíveis, enquanto o modo de benchmark do YOLO ajuda a comparar precisão e latência. Para a implantação experimental de FP4, siga as práticas recomendadas de precisão do TensorRT-RTX e técnicas específicas do formato, como Micro-Rotated GPTQ, pois o FP4 não é automaticamente mais preciso ou mais rápido do que um fluxo de trabalho INT4 ou FP8 bem otimizado.






