FP4
Aprende como a quantização FP4 comprime modelos de IA, reduz o uso de memória e acelera a inferência. Compara os formatos NVFP4, MXFP4, FP8, INT4 e FP16.
FP4 é uma família de formatos de ponto flutuante de 4 bits usados para comprimir e acelerar modelos de IA através da quantização de modelos. Ele tipicamente representa cada valor com um bit de sinal, dois bits de expoente e um bit de mantissa, chamado E2M1. Comparado ao FP16, o FP4 pode reduzir significativamente o tráfego de memória e o armazenamento, ajudando GPUs compatíveis a processar modelos grandes mais rapidamente. O formato de baixa precisão NVFP4 da NVIDIA é uma implementação proeminente projetada para hardware da geração Blackwell. (developer.nvidia.com)
Link to this sectionComo o FP4 Funciona#
Com apenas 16 padrões de bits possíveis, o FP4 simples não consegue representar com precisão a ampla gama de valores encontrados em redes neurais. Implementações modernas, portanto, dividem tensores em pequenos blocos e armazenam uma escala compartilhada para cada bloco. O esquema de quantização NVFP4 da NVIDIA, por exemplo, utiliza blocos de 16 valores E2M1, enquanto a especificação aberta OCP Microscaling Formats define o MXFP4 com metadados de microescala.
Durante a computação, um mecanismo de inferência quantiza valores de maior precisão, executa operações de matriz suportadas em FP4 e retorna resultados em uma precisão maior quando necessário. O suporte atual de inferência NVFP4 no TorchAO usa quantização dinâmica de ativação e escala dupla para pesos e ativações. (docs.nvidia.com)
Link to this sectionComparação do FP4 com Formatos Relacionados#
- FP16 ou meia precisão: Oferece um intervalo numérico muito mais amplo e é geralmente mais fácil de implementar, mas usa quatro vezes mais bits por valor.
- FP8: Geralmente oferece melhor precisão e estabilidade de treinamento do que o FP4, embora exija aproximadamente o dobro do armazenamento.
- BF16: Comumente usado para treinamento porque seu amplo intervalo de expoentes reduz o risco de overflow. O estudo FP4 All the Way de 2025 mostrou que o treinamento em FP4 cuidadosamente escalado pode se aproximar do desempenho do BF16.
- INT4: Usa níveis inteiros em vez de expoentes de ponto flutuante. O FP4 pode representar valores em diferentes magnitudes de forma mais natural, enquanto o INT4 pode funcionar bem para compressão apenas de pesos.
- NVFP4 versus MXFP4: O NVFP4 usa blocos menores e escalas de maior precisão, melhorando tipicamente a precisão a um custo modesto de metadados.
FP4 também pode se referir a um soquete de processador AMD FP4 não relacionado. Em IA, FP4 significa aritmética de ponto flutuante de quatro bits, não o pacote de CPU de laptop mais antigo.
Link to this sectionAplicações no Mundo Real#
-
Inferência de imagem generativa: A NVIDIA demonstrou a geração de imagens em FP4 em GPUs RTX Série 50, reduzindo o uso de memória e acelerando cargas de trabalho de difusão usadas em IA generativa.
-
Treinamento e serviço de modelos grandes: Sistemas Blackwell usaram NVFP4 no treinamento MLPerf para melhorar o throughput de modelos de linguagem grandes. O FP4 pode beneficiar de forma semelhante futuros sistemas de visão computacional limitados pela memória que exigem inferência em tempo real. (developer.nvidia.com)
Link to this sectionUsando FP4 de Forma Eficaz#
Desde julho de 2026, as operações de matriz FP4 aceleradas por hardware exigem GPUs NVIDIA Blackwell ou mais recentes; a H100 é baseada em Hopper e não oferece aceleração nativa de FP4. Desenvolvedores devem confirmar a compatibilidade através da matriz de suporte de hardware do TensorRT, validar a precisão após a conversão e considerar o treinamento consciente de quantização usando o fluxo de trabalho QAT do TorchAO quando a quantização pós-treinamento causar degradação excessiva. (docs.nvidia.com)
A Ultralytics fornece atualmente exportação pronta para produção em FP16 e INT8 para o YOLO26. Este fluxo de trabalho comparável cria um engine TensorRT otimizado:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
engine = model.export(format="engine", quantize=16)
results = YOLO(engine).predict("https://ultralytics.com/images/bus.jpg")A integração do TensorRT com Ultralytics explica as opções de precisão suportadas, enquanto o modo de benchmark YOLO ajuda a comparar precisão e latência. Para implementação experimental de FP4, siga as melhores práticas de precisão TensorRT-RTX e técnicas específicas de formato como Micro-Rotated GPTQ, já que o FP4 não é automaticamente mais preciso ou mais rápido do que um fluxo de trabalho INT4 ou FP8 bem otimizado.






