FP4
تعرف على كيفية قيام تقنية FP4 quantization بضغط نماذج الذكاء الاصطناعي، وتقليل استخدام الذاكرة، وتسريع عملية الاستدلال. قارن بين صيغ NVFP4 وMXFP4 وFP8 وINT4 وFP16.
FP4 عبارة عن عائلة من تنسيقات الفاصلة العائمة ذات 4 بت تُستخدم لضغط وتسريع نماذج الذكاء الاصطناعي من خلال تكميم النماذج. وهي تمثل كل قيمة عادةً ببت إشارة واحد، وبتي أس، وبت كسر واحد، وتسمى E2M1. بالمقارنة مع FP16، يمكن لـ FP4 تقليل حركة مرور الذاكرة والتخزين بشكل كبير، مما يساعد وحدات معالجة الرسومات المدعومة على معالجة النماذج الكبيرة بشكل أسرع. يُعد تنسيق NVFP4 منخفض الدقة من NVIDIA تطبيقًا بارزًا مصممًا لأجهزة جيل Blackwell. (developer.nvidia.com)
Link to this sectionكيف يعمل FP4#
مع وجود 16 نمط بت محتمل فقط، لا يمكن لـ FP4 البسيط تمثيل النطاق الواسع من القيم الموجودة في الشبكات العصبية بدقة. لذلك، تقوم التطبيقات الحديثة بتقسيم الموترات إلى كتل صغيرة وتخزين مقياس مشترك لكل كتلة. على سبيل المثال، يستخدم مخطط تكميم NVFP4 الخاص بـ NVIDIA كتلًا من 16 قيمة E2M1، بينما تحدد مواصفات تنسيقات OCP Microscaling المفتوحة MXFP4 مع بيانات وصفية للقياس الدقيق.
أثناء الحساب، يقوم محرك الاستدلال بتكميم قيم ذات دقة أعلى، وإجراء عمليات المصفوفة المدعومة في FP4، وإرجاع النتائج بدقة أعلى عند الضرورة. يستخدم دعم استدلال TorchAO NVFP4 الحالي تكميم التنشيط الديناميكي والقياس المزدوج للأوزان والتنشيطات. (docs.nvidia.com)
Link to this sectionمقارنة FP4 بالتنسيقات ذات الصلة#
- FP16 أو الدقة النصفية: يوفر نطاقًا رقميًا أوسع بكثير ويكون أسهل في النشر بشكل عام، ولكنه يستخدم أربعة أضعاف عدد البتات لكل قيمة.
- FP8: يوفر عادةً دقة أفضل واستقرارًا في التدريب مقارنة بـ FP4، مع احتياجه لنحو ضعف مساحة التخزين تقريبًا.
- BF16: يُستخدم بشكل شائع للتدريب لأن نطاق الأس الكبير الخاص به يقلل من مخاطر التجاوز. أظهرت دراسة FP4 All the Way لعام 2025 أن تدريب FP4 مع القياس الدقيق يمكن أن يقترب من أداء BF16.
- INT4: يستخدم مستويات عددية صحيحة بدلاً من أسس الفاصلة العائمة. يمكن لـ FP4 تمثيل القيم عبر درجات مختلفة من الحجم بشكل طبيعي أكثر، بينما قد يعمل INT4 بشكل جيد لضغط الأوزان فقط.
- NVFP4 مقابل MXFP4: يستخدم NVFP4 كتلًا أصغر ومقاييس ذات دقة أعلى، مما يحسن الدقة عادةً بتكلفة متواضعة في البيانات الوصفية.
قد يشير FP4 أيضًا إلى مقبس معالج AMD FP4 غير ذي صلة. في الذكاء الاصطناعي، يعني FP4 حساب الفاصلة العائمة بأربعة بت، وليس حزمة وحدة المعالجة المركزية القديمة لأجهزة الكمبيوتر المحمول.
Link to this sectionتطبيقات العالم الحقيقي#
-
استدلال الصور التوليدي: عرضت NVIDIA توليد صور FP4 على وحدات معالجة الرسومات RTX 50 Series، مما قلل من استخدام الذاكرة وسرّع أحمال عمل الانتشار المستخدمة في الذكاء الاصطناعي التوليدي.
-
تدريب وتقديم النماذج الكبيرة: استخدمت أنظمة Blackwell NVFP4 في تدريب MLPerf لتحسين إنتاجية النماذج اللغوية الكبيرة. يمكن لـ FP4 أن يفيد بشكل مشابه أنظمة الرؤية الحاسوبية المستقبلية المحدودة بالذاكرة والتي تتطلب استدلالًا في الوقت الفعلي. (developer.nvidia.com)
Link to this sectionاستخدام FP4 بفعالية#
اعتبارًا من يوليو 2026، تتطلب عمليات مصفوفة FP4 المسرعة بالأجهزة وحدات معالجة رسومات NVIDIA Blackwell أو أحدث؛ تعتمد H100 على بنية Hopper ولا توفر تسريع FP4 أصلي. يجب على المطورين تأكيد التوافق من خلال مصفوفة دعم أجهزة TensorRT، والتحقق من الدقة بعد التحويل، والنظر في التدريب الواعي بالتكميم باستخدام سير عمل TorchAO QAT عندما يتسبب تكميم ما بعد التدريب في تدهور مفرط. (docs.nvidia.com)
توفر Ultralytics حاليًا تصدير FP16 و INT8 جاهز للإنتاج لـ YOLO26. ينشئ سير العمل المماثل هذا محرك TensorRT مُحسّن:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
engine = model.export(format="engine", quantize=16)
results = YOLO(engine).predict("https://ultralytics.com/images/bus.jpg")يشرح تكامل Ultralytics مع TensorRT خيارات الدقة المدعومة، بينما يساعد وضع معيار YOLO في مقارنة الدقة وزمن الوصول. بالنسبة لنشر FP4 التجريبي، اتبع أفضل ممارسات دقة TensorRT-RTX والتقنيات الخاصة بالتنسيق مثل Micro-Rotated GPTQ، حيث إن FP4 ليس تلقائيًا أكثر دقة أو أسرع من سير عمل INT4 أو FP8 المُحسّن جيدًا.






