Sicherheit für Unternehmen: ISO 27001 + SOC 2 Type I-konform.
Zurück zum Ultralytics Glossar

FP8

Erfahre, was FP8 ist, wie E4M3 und E5M2 funktionieren und wie Skalierung, Hardwareunterstützung und Mixed Precision das KI-Training und die Inferenz verbessern.

FP8 oder 8-bit floating point ist ein numerisches Format mit niedriger Präzision, das jeden Wert in acht Bits speichert. KI-Systeme verwenden FP8, um den Speicherverkehr zu reduzieren und Matrixmultiplikationen, Faltungen und andere rechenintensive Operationen auf kompatibler Hardware zu beschleunigen. Verglichen mit FP16 oder FP32 stellt es weniger unterschiedliche Werte dar, weshalb erfolgreiche FP8-Workflows schnelle Berechnungen mit niedriger Präzision mit Skalierung und selektiven Operationen höherer Präzision kombinieren, um die Modellqualität zu erhalten.

Link to this sectionWie FP8 Zahlen darstellt#

Ein Gleitkommawert enthält ein Vorzeichen, einen Exponenten, der den Bereich steuert, und eine Mantisse, die das Detail steuert. FP8 kommt häufig in zwei Formaten vor, die in den PyTorch floating-point data types dokumentiert sind:

  • E4M3: Ein Vorzeichenbit, vier Exponentenbits und drei Mantissenbits. Es bietet mehr numerische Details, aber einen engeren Bereich.
  • E5M2: Ein Vorzeichenbit, fünf Exponentenbits und zwei Mantissenbits. Es deckt einen größeren Bereich ab, rundet Werte jedoch aggressiver ab.

E4M3 ist oft für Gewichte und Aktivierungen geeignet, während E5M2 Gradienten mit großen Wertebereichen besser aufnehmen kann. Genaue Varianten unterscheiden sich je nach Plattform, wie in der AMD low-precision floating-point documentation gezeigt wird, weshalb ein FP8-Modell nicht automatisch zwischen jedem Beschleuniger und jeder Laufzeit portabel ist.

Da acht Bits den ursprünglichen Bereich und die Details eines Tensors nicht vollständig darstellen können, multiplizieren Frameworks Werte vor der Konvertierung normalerweise mit einem Skalierungsfaktor. NVIDIA’s FP8 scaling primer beschreibt Strategien wie die verzögerte Skalierung (delayed scaling), die zukünftige Skalierungen aus zuvor beobachteten Maximalwerten ableitet. Skalierung begrenzt Überlauf, Unterlauf und Sättigung, ohne dass jede Operation in höherer Präzision ausgeführt werden muss.

Link to this sectionFP8 im Vergleich zu verwandten Formaten#

FP8 nimmt unter gängigen KI-Datentypen eine Mittelstellung ein:

  • FP16 oder half precision: Verwendet doppelt so viele Bits, bietet eine höhere numerische Detailgenauigkeit und ein im Allgemeinen einfachereres Training. FP8 kann Speicher und Bandbreite weiter reduzieren, erfordert jedoch eine sorgfältigere Skalierung.
  • BF16: Behält einen großen Exponentenbereich bei und bietet gleichzeitig weniger fraktionale Details als FP16. Es wird oft als Begleiter höherer Präzision beim FP8-Training verwendet.
  • INT8: Repräsentiert ganze Zahlen anstelle von Gleitkommawerten. Die INT8-model quantization stützt sich normalerweise auf Skalierungen, um reale Werte auf feste ganzzahlige Stufen abzubilden, während FP8 einen Exponenten für natürlich ungleichmäßige Abstände beibehält.
  • FP4: Verwendet nur vier Bits und kann eine stärkere Komprimierung ermöglichen, aber sein extrem begrenzter Bereich und seine Granularität erschweren normalerweise die Erhaltung der Genauigkeit.

FP8 ist häufig Teil eines mixed-precision-Workflows und nicht der Datentyp für jeden Tensor. Akkumulation, Normalisierung, Optimiererstatus oder sensitive Schichten können in BF16, FP16 oder FP32 verbleiben. Außerdem unterscheidet sich die numerische Präzision von der precision evaluation metric, die misst, wie viele positive Modellvorhersagen korrekt sind.

Link to this sectionPraxisanwendungen#

Zwei praktische Anwendungen veranschaulichen, warum FP8 wichtig ist:

  1. Training großer Modelle: Das Transformer-Training führt wiederholt große Matrixmultiplikationen durch. Ein FP8-fähiges Framework kann berechtigte Gewichte und Aktivierungen nach FP8 konvertieren und gleichzeitig eine höhere Präzision beibehalten, wo dies für die Stabilität erforderlich ist. Dies senkt den Bandbreitenbedarf und kann den Trainingsdurchsatz erhöhen. Der TorchAO quantized-training workflow enthält tensorbasierte und zeilenbasierte Skalierungsoptionen, die maximale Geschwindigkeit gegen eine bessere Handhabung von Ausreißern abwägen.

  2. Vision-Inferenz mit hohem Durchsatz: Ein Rechenzentrum führt möglicherweise Objekterkennungen über Hunderte von Video-Streams aus dem Einzelhandel, Verkehr oder der Fertigung durch. FP8-fähige Kernel können die von geeigneten Modellschichten benötigte Zeit und den Speicher reduzieren, was möglicherweise die inference latency verringert und die Kapazität gleichzeitiger Streams erhöht. Der TensorRT quantized-types guide erklärt, wie explizite Quantisierungs- und Dequantisierungsoperationen die FP8-Ausführung beschreiben.

Link to this sectionNumerische Risiken und Hardware-Unterstützung#

Eine schlechte Skalierung kann dazu führen, dass große Werte gesättigt werden und kleine Werte auf Null gerundet werden. Ausreißer sind besonders problematisch, wenn eine Skala einen gesamten Tensor abdeckt. Diese Effekte können Konfidenzwerte verschieben, das Training destabilisieren oder die Erkennungsgenauigkeit verringern, weshalb Entwickler das konvertierte Modell anhand seiner Baseline höherer Präzision validieren sollten.

Die native Hardware-Unterstützung ist ebenso wichtig. Die NVIDIA Hopper architecture führte die FP8 Tensor Core-Beschleunigung ein, während die ältere NVIDIA A100 GPU FP16, BF16 und INT8 unterstützt, jedoch keine native FP8-Berechnung. Die TensorRT hardware support matrix sollte daher vor der Auswahl einer Bereitstellungspräzision überprüft werden.

Link to this sectionDie Arbeit mit FP8 in der Praxis#

Dieses kleine PyTorch-Beispiel veranschaulicht die E4M3-Konvertierung und den Rundungsfehler, der entsteht, wenn FP8-Werte zu FP32 wiederhergestellt werden:

import torch

values = torch.tensor([0.1, 1.0, 3.14, 100.0], dtype=torch.float32)

# Convert to E4M3 FP8, then restore the values for comparison.
fp8_values = values.to(torch.float8_e4m3fn)
restored = fp8_values.to(torch.float32)
absolute_error = (restored - values).abs()

print(torch.stack((values, restored, absolute_error), dim=1))

Der dokumentierte Ultralytics TensorRT export workflow bietet FP16- und kalibrierte INT8-Optionen für Ultralytics YOLO anstelle eines einargumentigen FP8-Exports. Die FP8-Bereitstellung erfordert daher eine kompatible nachgelagerte Konvertierungs-Toolchain. Unabhängig davon, welche Präzision ausgewählt wird, verwende den Ultralytics benchmark mode auf der Ziel-GPU, um Latenz, Durchsatz, Speichernutzung und Aufgabengenauigkeit vor der Produktionsbereitstellung zu vergleichen.

Explore solutions

Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr
Real-time AI that works with your team

KI in der Robotik

Stärke intelligentere Maschinen mit Ultralytics YOLO Modellen. Vision AI in der Robotik treibt autonome Navigation, Wahrnehmung, Objektverfolgung und Echtzeitsteuerung voran.
Erfahre mehr
Real-time AI that works with your team

KI in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Paketkontrolle, Sortierung, Fahrzeugverfolgung und Echtzeit-Überwachung der Lagersicherheit.
Erfahre mehr
Real-time AI that works with your team

KI im Einzelhandel

Erfinde den Einzelhandel neu mit Ultralytics YOLO-Modellen. Vision AI fördert Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und intelligentere Kundeneinblicke.
Erfahre mehr
Real-time AI that works with your team

KI im Gesundheitswesen

Baue Gesundheitslösungen mit Ultralytics YOLO Modellen. Vision AI im Gesundheitswesen ermöglicht schnellere medizinische Bildgebung, intelligentere Diagnostik und Patientenüberwachung.
Erfahre mehr
Real-time AI that works with your team

KI in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI treibt Qualitätskontrolle, Fehlererkennung, PSA-Einhaltung und die Automatisierung von Montagelinien voran.
Erfahre mehr
Real-time AI that works with your operation

KI in der Automobilbranche

Nutze Computer Vision in der Automobilindustrie mit Ultralytics YOLO Modellen. Vision AI steigert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Erfahre mehr
Real-time AI tailored to your operation

KI in der Landwirtschaft

Bringe Vision AI mit Ultralytics YOLO Modellen in die smarte Landwirtschaft. Optimiere die Ernteüberwachung, Viehverfolgung und Präzisionslandwirtschaft für höhere, intelligentere Erträge.
Erfahre mehr

Lass uns gemeinsam die Zukunft der KI bauen!

Beginne deine Reise mit der Zukunft des maschinellen Lernens