FP4
Узнай, как квантование FP4 сжимает модели ИИ, сокращает использование памяти и ускоряет инференс. Сравни форматы NVFP4, MXFP4, FP8, INT4 и FP16.
FP4 — это семейство 4-битных форматов с плавающей запятой, используемых для сжатия и ускорения моделей ИИ с помощью квантования моделей. Обычно оно представляет каждое значение одним битом знака, двумя битами экспоненты и одним битом мантиссы, что называется E2M1. По сравнению с FP16, формат FP4 позволяет значительно сократить объем передаваемых данных в памяти и объем хранилища, помогая поддерживаемым GPU быстрее обрабатывать большие модели. Формат низкой точности NVFP4 от NVIDIA является заметной реализацией, разработанной для оборудования поколения Blackwell. (developer.nvidia.com)
Link to this sectionКак работает FP4#
Имея всего 16 возможных битовых комбинаций, обычный FP4 не может точно отобразить широкий диапазон значений, встречающихся в нейронных сетях. Поэтому современные реализации разбивают тензоры на небольшие блоки и сохраняют общий масштаб (scale) для каждого блока. Например, схема квантования NVFP4 от NVIDIA использует блоки из 16 значений E2M1, в то время как открытая спецификация OCP Microscaling Formats определяет MXFP4 с метаданными микромасштабирования.
Во время вычислений механизм вывода квантует значения с более высокой точностью, выполняет поддерживаемые матричные операции в FP4 и при необходимости возвращает результаты с более высокой точностью. Текущая поддержка вывода TorchAO NVFP4 использует динамическое квантование активаций и двойное масштабирование для весов и активаций. (docs.nvidia.com)
Link to this sectionFP4 в сравнении с похожими форматами#
- FP16 или половинная точность: Предлагает гораздо более широкий числовой диапазон и, как правило, проще в развертывании, но использует в четыре раза больше бит на значение.
- FP8: Обычно обеспечивает лучшую точность и стабильность обучения, чем FP4, при этом требует примерно вдвое больше места для хранения.
- BF16: Часто используется для обучения, поскольку его большой диапазон экспоненты снижает риск переполнения. Исследование 2025 года FP4 All the Way показало, что при тщательном масштабировании обучение в FP4 может приближаться к производительности BF16.
- INT4: Использует целочисленные уровни вместо экспонент с плавающей запятой. FP4 может более естественно представлять значения в разных диапазонах величин, тогда как INT4 может хорошо подходить для сжатия только весов.
- NVFP4 против MXFP4: NVFP4 использует меньшие блоки и весы более высокой точности, что обычно повышает точность при небольших затратах на метаданные.
FP4 также может относиться к не связанному с этим процессорному сокету AMD FP4. В ИИ FP4 означает 4-битную арифметику с плавающей запятой, а не старый тип корпуса процессора для ноутбуков.
Link to this sectionРеальные приложения#
-
Генеративный вывод изображений: NVIDIA продемонстрировала генерацию изображений в FP4 на GPU серии RTX 50, сократив использование памяти и ускорив рабочие нагрузки диффузионных моделей, используемые в генеративном ИИ.
-
Обучение и обслуживание больших моделей: Системы Blackwell использовали NVFP4 в обучении MLPerf, чтобы повысить пропускную способность больших языковых моделей. FP4 может аналогичным образом принести пользу будущим системам компьютерного зрения, ограниченным пропускной способностью памяти, для которых требуется вывод в реальном времени. (developer.nvidia.com)
Link to this sectionЭффективное использование FP4#
По состоянию на июль 2026 года для аппаратно-ускоренных матричных операций FP4 требуются GPU NVIDIA Blackwell или новее; модель H100 основана на архитектуре Hopper и не обеспечивает нативного ускорения FP4. Разработчикам следует подтвердить совместимость с помощью матрицы аппаратной поддержки TensorRT, проверить точность после конвертации и рассмотреть возможность квантования с учетом обучения с использованием рабочего процесса QAT TorchAO, если квантование после обучения вызывает чрезмерную деградацию. (docs.nvidia.com)
В настоящее время Ultralytics обеспечивает готовый к эксплуатации экспорт в FP16 и INT8 для YOLO26. Этот сопоставимый рабочий процесс создает оптимизированный движок TensorRT:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
engine = model.export(format="engine", quantize=16)
results = YOLO(engine).predict("https://ultralytics.com/images/bus.jpg")В интеграции Ultralytics с TensorRT объясняются поддерживаемые варианты точности, а режим бенчмарка YOLO помогает сравнить точность и задержку. Для экспериментального развертывания FP4 следуй лучшим практикам точности TensorRT-RTX и специфическим для формата методам, таким как Micro-Rotated GPTQ, поскольку FP4 не является автоматически более точным или быстрым, чем хорошо оптимизированный рабочий процесс INT4 или FP8.






