ما تقطير مجموعة البيانات؟ نظرة سريعة
تعلّموا كيف تسرّع عملية تقطير مجموعة البيانات تدريب النماذج وتقلّل تكاليف الحوسبة باستبدال مجموعات البيانات الكبيرة بمجموعة صغيرة ومحسّنة من العينات الاصطناعية.

قد يبدو تدريب النماذج الجزء الأكثر استهلاكًا للوقت في عمل عالم البيانات. لكن معظم وقتهم، وغالبًا ما يتراوح بين 60% و80%، يُنفق فعليًا على تجهيز البيانات: جمعها وتنظيفها وتنظيمها للنمذجة. ومع ازدياد حجم مجموعات البيانات، يزداد وقت التحضير أيضًا، ما يبطئ التجارب ويجعل التكرار أكثر صعوبة.
لمعالجة هذه المشكلة، أمضى الباحثون سنوات في البحث عن طرق لتبسيط التدريب. تهدف أساليب مثل البيانات الاصطناعية وضغط مجموعات البيانات وطرق التحسين الأفضل إلى تقليل تكلفة وتعقيد العمل مع مجموعات البيانات واسعة النطاق وتسريع سير عمل التعلم الآلي.
يثير هذا سؤالًا محوريًا: هل يمكننا تقليص مجموعة بيانات بشكل كبير مع تحقيق الأداء نفسه الذي يتحقق عند تدريب نموذج على البيانات الكاملة؟ يُعد تقطير مجموعة البيانات إجابة واعدة عن ذلك.
ينشئ هذا الأسلوب نسخة مدمجة من مجموعة بيانات تدريب كبيرة، مع الحفاظ على الأنماط الأساسية التي يحتاج النموذج إلى تعلمها بفاعلية. ويوفر مسارًا لتدريب أسرع، واحتياجات حسابية أقل، وتجارب أكثر كفاءة. ويمكنك التفكير فيه على أنه ورقة غش دراسية للنموذج، أي مجموعة صغيرة من أمثلة البيانات الاصطناعية المصممة لتعليم الأنماط الأساسية نفسها الموجودة في مجموعة البيانات الكاملة.
في هذه المقالة، سنستكشف كيفية عمل تقطير مجموعة البيانات وكيف يدعم التعلم الآلي والتعلم العميق القابلين للتوسع عبر تطبيقات العالم الحقيقي. لنبدأ!
فهم تقطير مجموعة البيانات#
تقطير مجموعة البيانات هو عملية تُكثَّف فيها مجموعة بيانات تدريب كبيرة إلى مجموعة بيانات أصغر بكثير، مع استمرار قدرتها على تعليم النموذج المعلومات نفسها تقريبًا التي تعلمها مجموعة البيانات الأصلية. ويشير كثير من الباحثين أيضًا إلى هذه العملية باسم تكثيف مجموعة البيانات، لأن الهدف هو التقاط الأنماط الأساسية التي تظهر عبر مجموعة البيانات الكاملة.
تختلف مجموعة البيانات المقطّرة عن البيانات الاصطناعية المولّدة عشوائيًا أو عن مجرد اختيار مجموعة فرعية أصغر من الصور الحقيقية. فهي ليست مجموعة بيانات زائفة عشوائية ولا نسخة مختصرة من الأصل.
بل تُحسَّن عمدًا لالتقاط أهم الأنماط. وخلال هذه العملية، تُعدَّل كل بكسلة وكل سمة وتُحسَّن بحيث تتعلم الشبكة العصبية المدرَّبة على البيانات المقطّرة تقريبًا كما لو كانت مدرَّبة على مجموعة البيانات بأكملها.
ظهرت هذه الفكرة للمرة الأولى في ورقة بحثية على arXiv عام 2018 ألّفها Tongzhou Wang وJun-Yan Zhu وAntonio Torralba وAlexei A. Efros. واستخدمت الاختبارات المبكرة مجموعات بيانات بسيطة مثل MNIST وCIFAR-10، ما سهّل إظهار أن بضع عينات مقطّرة يمكن أن تحل محل آلاف الصور الحقيقية.

الشكل 1. استخدام تقطير مجموعة البيانات لبيانات الصور (المصدر)
ومنذ ذلك الحين، دفعت الأعمال اللاحقة تقطير مجموعات البيانات إلى آفاق أبعد، بما في ذلك أساليب نُشرت في ICML وICLR جعلت التكثيف أكثر كفاءة وقابلية للتوسع.
أهمية تقطير مجموعة البيانات#
يحسّن تقطير مجموعة البيانات كفاءة التدريب ويجعل دورات التطوير أسرع. ومن خلال تقليل كمية البيانات التي يحتاج النموذج إلى التعلم منها، يقلل المتطلبات الحسابية.
ويفيد هذا خصوصًا في التعلم المستمر، حيث تُحدَّث النماذج بمرور الوقت، والبحث عن البنية العصبية، حيث تُختبر تصميمات عديدة للنماذج، والتدريب على الحافة، حيث تعمل النماذج على أجهزة صغيرة ذات ذاكرة وطاقة محدودتين. وبوجه عام، تجعل هذه المزايا تقطير مجموعة البيانات خيارًا ممتازًا للتهيئة السريعة، والضبط الدقيق السريع، وبناء النماذج الأولية المبكرة عبر العديد من عمليات التعلم الآلي.
نظرة عامة على كيفية عمل تقطير مجموعة البيانات#
ينشئ تقطير مجموعة البيانات عينات تدريب اصطناعية، أو مولّدة اصطناعيًا. وتساعد هذه العينات النموذج على التعلم بطريقة تشبه إلى حد كبير تدريبه على بيانات حقيقية. ويعمل ذلك من خلال تتبع ثلاثة عوامل رئيسية أثناء التدريب المعتاد.
أولًا، دالة الخسارة، وهي درجة خطأ النموذج التي توضح مدى خطأ تنبؤاته. ثانيًا، معلمات النموذج، وهي الأوزان الداخلية للشبكة التي تُحدَّث أثناء تعلمها.
ثالثًا، مسار التدريب، الذي يصف كيفية تغير الخطأ والأوزان خطوةً تلو الأخرى بمرور الوقت. ثم تُحسَّن العينات الاصطناعية بحيث ينخفض خطأ النموذج وتتحدّث أوزانه بالطريقة نفسها تقريبًا التي كانت ستتبعها عند استخدام مجموعة البيانات الكاملة.
نظرة خطوة بخطوة على تقطير مجموعة البيانات#
إليك نظرة أكثر تفصيلًا على كيفية عمل عملية تقطير مجموعة البيانات:
- الخطوة 1 - تهيئة البكسلات الاصطناعية: تبدأ العملية بـصور اصطناعية تعمل كمدخلات قابلة للتعلم. في البداية، تكون هذه الصور قليلة البنية وتشبه صفحات بيضاء. وبمرور الوقت، تُحسَّن لتصبح أمثلة غنية بالمعلومات.
- الخطوة 2 - التحسين بمطابقة التدرجات والانتشار العكسي: أثناء تدريب النموذج على هذه الصور الاصطناعية، ينتج تدرجات تشير إلى كيفية تغير كل بكسلة لمطابقة سلوك تدريب البيانات الحقيقية بصورة أفضل. والانتشار العكسي هو الأسلوب الذي تستخدمه الشبكة للتعلم من الأخطاء. إذ يرسل الخطأ إلى الخلف عبر النموذج لتحديد البكسلات والأوزان التي تسببت فيه، ثم يحدّثها قليلًا. وباستخدام هذه التدرجات، يضبط الانتشار العكسي الصور الاصطناعية خطوةً تلو الأخرى لتصبح أكثر إفادة للتدريب.
- الخطوة 3 - مطابقة السلوك عبر خطوات التدريب: تطابق الطريقة أيضًا مسارات التدريب، أي التغيرات المتتابعة التي يمر بها النموذج أثناء التعلم. ويضمن ذلك أن تقود مجموعة البيانات المقطّرة النموذج عبر مسار تعلم مشابه للمسار الذي كان سيتبعه باستخدام مجموعة البيانات الكاملة.
- الخطوة 4 - التحقق والتعميم: أخيرًا، تُقيَّم مجموعة البيانات المقطّرة على بيانات تحقق حقيقية لمعرفة مدى أداء النموذج المدرَّب على أمثلة جديدة. ويتحقق ذلك من أن البيانات الاصطناعية تعلّم أنماطًا واسعة وفعّالة، بدلًا من التسبب في حفظ النموذج لعينات محددة.

الشكل 2. نظرة على تقطير مجموعة البيانات (المصدر)
المنهجيات الرئيسية لتقطير مجموعة البيانات#
تستند جميع أساليب تقطير مجموعة البيانات إلى الفكرة الأساسية نفسها، حتى لو استخدمت خوارزميات مختلفة لتحقيقها. وتندرج معظم الأساليب ضمن ثلاث فئات: مطابقة الأداء، ومطابقة التوزيع، ومطابقة المعلمات.
لنلقِ نظرة الآن على كل منها ونرى كيفية عملها.
مطابقة الأداء#
تركّز مطابقة الأداء في تقطير مجموعة البيانات على إنشاء مجموعة تدريب صغيرة ومحسّنة تتيح للنموذج الوصول إلى دقة تكاد تماثل دقته عند تدريبه على مجموعة البيانات الأصلية الكاملة. وبدلًا من اختيار مجموعة فرعية عشوائية، تُحسَّن العينات المقطّرة بحيث ينتهي النموذج المدرَّب عليها إلى تنبؤات مشابهة، أو سلوك خسارة مشابه أثناء التدريب، أو دقة نهائية مشابهة للنموذج المدرَّب على مجموعة البيانات الأصلية.
يُعد التعلم الفوقي أسلوبًا شائعًا لتحسين هذه العملية. وتُحدَّث مجموعة البيانات المقطّرة عبر حلقات تدريب متكررة، ما يجعلها فعّالة في العديد من الحالات المحتملة.
خلال هذه الحلقات، تحاكي الطريقة كيفية تعلم نموذج طالب من العينات المقطّرة الحالية، وتتحقق من أداء ذلك الطالب على بيانات حقيقية، ثم تعدّل العينات المقطّرة لتصبح معلمين أفضل. وبمرور الوقت، تتعلم المجموعة المقطّرة دعم التعلم السريع والتعميم القوي، حتى عندما يبدأ نموذج الطالب بأوزان أولية مختلفة أو يستخدم بنية مختلفة. وهذا يجعل مجموعة البيانات المقطّرة أكثر موثوقية وغير مرتبطة بتشغيل تدريبي واحد.

الشكل 3. عملية التعلم الفوقي (المصدر)
تقنيات مطابقة التوزيع#
في المقابل، تولّد مطابقة التوزيع بيانات اصطناعية تطابق الأنماط الإحصائية لمجموعة البيانات الحقيقية. وبدلًا من التركيز على الدقة النهائية للنموذج فقط، يركّز هذا النهج على السمات الداخلية التي تولّدها الشبكة العصبية أثناء التعلم.
لنلقِ نظرة الآن على التقنيتين اللتين تقودان مطابقة التوزيع.
مطابقة التوزيع أحادية الطبقة#
تركّز مطابقة التوزيع أحادية الطبقة على طبقة واحدة من الشبكة العصبية، وتقارن السمات التي تنتجها للبيانات الحقيقية والاصطناعية. وتلتقط هذه السمات، التي تُسمى أيضًا التنشيطات، ما تعلمه النموذج عند تلك النقطة من الشبكة.
ومن خلال جعل البيانات الاصطناعية تنتج تنشيطات مشابهة، تشجع الطريقة مجموعة البيانات المقطّرة على عكس الأنماط المهمة نفسها الموجودة في مجموعة البيانات الأصلية. وعمليًا، تُحدَّث العينات الاصطناعية مرارًا حتى تتطابق التنشيطات في الطبقة المختارة بدرجة كبيرة مع تلك المستخرجة من الصور الحقيقية.
يُعد هذا النهج بسيطًا نسبيًا لأنه يحاذي مستوى تمثيل واحدًا فقط في كل مرة. ويمكن أن يعمل جيدًا خصوصًا على مجموعات البيانات الأصغر أو المهام التي لا تتطلب مطابقة تسلسلات هرمية عميقة ومتعددة المراحل للسمات. ومن خلال المحاذاة الواضحة لفضاء سمات واحد، توفر المطابقة أحادية الطبقة إشارة مستقرة وذات معنى للتعلم باستخدام مجموعة البيانات المقطّرة.
مطابقة التوزيع متعددة الطبقات#
تبني مطابقة التوزيع متعددة الطبقات على فكرة مقارنة البيانات الحقيقية والاصطناعية، ولكنها تجري ذلك عبر عدة طبقات من الشبكة العصبية بدلًا من طبقة واحدة. وتلتقط الطبقات المختلفة أنواعًا مختلفة من المعلومات، بدءًا من الحواف والأنسجة البسيطة في الطبقات المبكرة، وصولًا إلى الأشكال والأنماط الأكثر تعقيدًا في الطبقات الأعمق.
ومن خلال مطابقة السمات عبر هذه الطبقات، تُدفَع مجموعة البيانات المقطّرة إلى عكس ما يتعلمه النموذج على مستويات متعددة. وبما أن هذا النهج يحاذي السمات عبر الشبكة بأكملها، فإنه يساعد البيانات الاصطناعية على الحفاظ على إشارات أغنى يعتمد عليها النموذج للتمييز بين الفئات.
ويفيد هذا خصوصًا في رؤية الحاسوب، أي المهام التي تتعلم فيها النماذج فهم الصور ومقاطع الفيديو، لأن الأنماط المفيدة موزعة عبر طبقات كثيرة. وعندما تتطابق توزيعات السمات جيدًا عند أعماق متعددة، تعمل مجموعة البيانات المقطّرة كبديل أقوى وأكثر موثوقية لبيانات التدريب الأصلية.
أساليب مطابقة المعلمات#
تُعد مطابقة المعلمات فئة رئيسية أخرى في تقطير مجموعة البيانات. فبدلًا من مطابقة الدقة أو توزيعات السمات، تطابق هذه الطريقة كيفية تغير أوزان النموذج أثناء التدريب. ومن خلال جعل التدريب على مجموعة البيانات المقطّرة ينتج تحديثات معلمات مشابهة لتلك الناتجة عن التدريب على البيانات الحقيقية، يتبع النموذج مسار تعلم شبه مطابق.
سنستعرض بعد ذلك أسلوبي مطابقة المعلمات الرئيسيين.
المطابقة أحادية الخطوة#
تقارن المطابقة أحادية الخطوة ما يحدث لأوزان النموذج بعد خطوة تدريب واحدة فقط على البيانات الحقيقية. ثم تُضبط مجموعة البيانات المقطّرة بحيث ينتج النموذج المدرَّب عليها لخطوة واحدة تحديثًا مشابهًا جدًا للأوزان. وبما أنها تركّز على هذا التحديث الواحد فقط، فإن الطريقة مباشرة وسريعة التنفيذ.
يتمثل الجانب السلبي في أن خطوة واحدة لا تعكس عملية التعلم الكاملة، ولا سيما في المهام الأصعب التي يحتاج فيها النموذج إلى تحديثات كثيرة لبناء سمات أغنى. ولذلك، تميل المطابقة أحادية الخطوة إلى تحقيق أفضل أداء في المشكلات الأبسط أو مجموعات البيانات الأصغر التي يمكن التقاط الأنماط المفيدة فيها بسرعة.
مطابقة المعلمات متعددة الخطوات#
في المقابل، تنظر مطابقة المعلمات متعددة الخطوات إلى كيفية تغير أوزان النموذج عبر عدة خطوات تدريب، لا خطوة واحدة فقط. ويُعد هذا التسلسل من التحديثات مسار تدريب النموذج.
تُبنى مجموعة البيانات المقطّرة بحيث يتبع مسار النموذج، عند تدريبه على العينات الاصطناعية، المسار الذي كان سيتبعه على البيانات الحقيقية بدرجة كبيرة. ومن خلال مطابقة فترة أطول من التعلم، تلتقط المجموعة المقطّرة قدرًا أكبر من بنية عملية التدريب الأصلية.
وبما أنها تعكس كيفية تطور التعلم بمرور الوقت، تحقق المطابقة متعددة الخطوات عادةً أداءً أفضل في مجموعات البيانات الأكبر أو الأكثر تعقيدًا، حيث تحتاج النماذج إلى تحديثات كثيرة لالتقاط الأنماط المفيدة. لكنها تتطلب قدرًا أكبر من الحسابات لأنها تتتبع خطوات متعددة، وغالبًا ما تنتج مجموعات بيانات مقطّرة تعمم بصورة أفضل وتحقق أداءً أعلى من المطابقة أحادية الخطوة.
كيفية عمل توليد مجموعات البيانات الاصطناعية وتحسينها#
بعد فهم أفضل لأساليب التقطير الرئيسية، يمكننا الآن النظر في كيفية إنشاء البيانات الاصطناعية. ففي تقطير مجموعة البيانات، تُحسَّن العينات الاصطناعية لالتقاط أهم إشارة تعليمية، بحيث يمكن لمجموعة صغيرة أن تحل محل مجموعة بيانات أكبر بكثير.
سنرى بعد ذلك كيفية توليد هذه البيانات المقطّرة وتقييمها.
إنشاء الصور المقطّرة وتقييمها#
أثناء تقطير مجموعة البيانات، تُحدَّث البكسلات الاصطناعية عبر العديد من خطوات التدريب. وتتعلم الشبكة العصبية من الصور الاصطناعية الحالية وترسل تغذية راجعة قائمة على التدرجات، توضح كيفية تغير كل بكسلة لمطابقة الأنماط في مجموعة البيانات الحقيقية بصورة أفضل.
ينجح ذلك لأن العملية قابلة للاشتقاق (أي إن كل خطوة سلسة ولها تدرجات محددة جيدًا، بحيث تؤدي التغيرات الصغيرة في البكسلات إلى تغيرات يمكن التنبؤ بها في الخسارة)، ما يسمح للنموذج بضبط البيانات الاصطناعية بسلاسة أثناء الانحدار المتدرج.
ومع استمرار التحسين، تبدأ الصور الاصطناعية في تكوين بنية ذات معنى، بما في ذلك الأشكال والأنسجة التي يتعرف عليها النموذج. وغالبًا ما تُستخدم هذه الصور الاصطناعية المحسّنة في مهام تصنيف الصور لأنها تلتقط الإشارات المرئية الرئيسية التي يحتاج المصنّف إلى تعلمها.
تُقيَّم مجموعات البيانات المقطّرة بتدريب النماذج عليها ومقارنة النتائج بالنماذج المدرَّبة على بيانات حقيقية. ويقيس الباحثون دقة التحقق ويتحققون مما إذا كانت المجموعة الاصطناعية تحافظ على السمات التمييزية (الأنماط أو الإشارات التي يعتمد عليها النموذج للتمييز بين فئة وأخرى) اللازمة لفصل الفئات. كما يختبرون الاستقرار والتعميم عبر عمليات تشغيل أو إعدادات نماذج مختلفة للتأكد من أن البيانات المقطّرة لا تؤدي إلى فرط التخصيص.
تطبيقات تقطير البيانات في العالم الحقيقي#
سنلقي نظرة أكثر تفصيلًا على أمثلة توضح كيفية تسريع مجموعات البيانات المقطّرة للتدريب وتقليل تكاليف الحوسبة مع الحفاظ على أداء قوي، حتى عندما تكون البيانات محدودة أو متخصصة للغاية.
استخدام تقطير مجموعة البيانات في تطبيقات رؤية الحاسوب#
عندما يتعلق الأمر برؤية الحاسوب، يتمثل الهدف في تدريب النماذج على فهم البيانات المرئية مثل الصور ومقاطع الفيديو. وتتعلم هذه النماذج أنماطًا مثل الحواف والأنسجة والأشكال والكائنات، ثم تستخدمها في مهام مثل تصنيف الصور واكتشاف الكائنات والتجزئة. وبما أن مشكلات الرؤية غالبًا ما تتضمن اختلافات كبيرة في الإضاءة والخلفيات ووجهات النظر، تحتاج أنظمة رؤية الحاسوب عادةً إلى مجموعات بيانات كبيرة للتعميم جيدًا، ما يجعل التدريب مكلفًا وبطيئًا.

الشكل 4. مثال على تقطير مجموعة البيانات (المصدر)
في حالات استخدام تصنيف الصور مثل الفحوصات الطبية، ومراقبة الحياة البرية، واكتشاف عيوب المصانع، تواجه النماذج غالبًا مفاضلة صعبة بين الدقة وتكلفة التدريب. وتتضمن هذه المهام عادةً مجموعات بيانات ضخمة.
يمكن لتقطير مجموعة البيانات ضغط مجموعة التدريب الأصلية إلى عدد صغير من الصور الاصطناعية التي لا تزال تحتوي على أهم الإشارات المرئية للمصنّف. وعلى معايير كبيرة مثل ImageNet، أظهرت مجموعات مقطّرة تستخدم نحو 4.2% من الصور الأصلية قدرتها على الحفاظ على دقة تصنيف قوية. وهذا يعني أن بديلًا اصطناعيًا صغيرًا يمكن أن يحل محل ملايين العينات الحقيقية باستخدام قدر أقل بكثير من الحوسبة.
البحث عن البنية العصبية#
البحث عن البنية العصبية، أو NAS، هو أسلوب يستكشف تلقائيًا العديد من تصميمات الشبكات العصبية المحتملة للعثور على التصميم الأفضل لمهمة ما. وبما أن NAS يتطلب تدريب عدد كبير من النماذج المرشحة وتقييمها، فإن تشغيله على مجموعات البيانات الكاملة قد يكون بطيئًا وكثيفًا جدًا من الناحية الحسابية.
يساعد تقطير مجموعة البيانات من خلال إنشاء مجموعة تدريب اصطناعية صغيرة لا تزال تحتوي على إشارة التعلم الرئيسية للبيانات الأصلية، بحيث يمكن اختبار كل بنية مرشحة بسرعة أكبر بكثير. ويتيح ذلك لـNAS مقارنة التصميمات بكفاءة مع الحفاظ على موثوقية معقولة لترتيب البنى الجيدة مقابل السيئة، ما يقلل تكلفة البحث دون التضحية بجزء كبير من جودة النموذج النهائية.
التعلم المستمر والنشر على الحافة#
تحتاج أنظمة التعلم المستمر، أي النماذج التي تواصل التحديث عند وصول بيانات جديدة بدلًا من تدريبها مرة واحدة، إلى تحديثات سريعة وفعّالة من حيث الذاكرة. وتواجه الأجهزة الطرفية مثل الكاميرات والهواتف وأجهزة الاستشعار قيودًا مشابهة، إذ تمتلك ميزانيات محدودة للحوسبة والتخزين.
يساعد تقطير مجموعة البيانات في كلتا الحالتين من خلال ضغط مجموعة تدريب كبيرة إلى مجموعة اصطناعية صغيرة، بحيث تتمكن النماذج من التكيف أو إعادة التدريب باستخدام مجموعة إعادة تشغيل صغيرة بدلًا من مجموعة البيانات الكاملة. فعلى سبيل المثال، أظهر عمل حول التعلم الفوقي القائم على النواة أن 10 عينات مقطّرة فقط يمكنها تحقيق دقة تتجاوز 64% على CIFAR-10، وهو معيار قياسي لتصنيف الصور. وبما أن مجموعة إعادة التشغيل مدمجة جدًا، تصبح التحديثات أسرع بكثير وأكثر عملية، ولا سيما عندما تحتاج النماذج إلى التحديث باستمرار.
يمكن أن يعمل تقطير مجموعة البيانات أيضًا جنبًا إلى جنب مع تقطير المعرفة لنماذج اللغة الكبيرة. إذ يمكن لمجموعة بيانات مقطّرة صغيرة أن تحتفظ بأهم إشارات المهمة من نموذج المعلم، بحيث يمكن تدريب نموذج الطالب المضغوط أو تحديثه بكفاءة أكبر دون فقدان قدر كبير من الأداء. وبما أن هذه المجموعات صغيرة جدًا، فإنها مفيدة خصوصًا للاستخدام على الحافة أو على الجهاز، حيث تكون سعة التخزين والحوسبة محدودة، مع الحفاظ على دقة النموذج بعد التحديثات.
مزايا تقطير البيانات وعيوبه#
فيما يلي بعض فوائد استخدام تقطير مجموعة البيانات:
- ممتاز للتجارب السريعة. يمكنك اختبار بنيات أو دوال خسارة أو معلمات فائقة جديدة دون إعادة التدريب على مجموعة بيانات ضخمة في كل مرة.
- ميزة محتملة للخصوصية. قد تكون مشاركة العينات الاصطناعية المقطّرة أكثر أمانًا من مشاركة نقاط بيانات المستخدمين الحقيقية، لأن الأمثلة الخام لا تكون مكشوفة مباشرةً.
- غالبًا ما يتفوق على اختيار مجموعة فرعية بسيط. فبدلًا من اختيار الأمثلة فقط، يعمل التقطير على تحسينها لتكون غنية بالمعلومات إلى أقصى حد.
مع أن تقطير مجموعة البيانات يوفر مزايا عدة، فإليك بعض القيود التي ينبغي وضعها في الاعتبار:
- فرط التخصيص: غالبًا ما تعمل البيانات المقطّرة بأفضل صورة مع البنية المستخدمة أثناء التقطير، وقد تنتقل بصورة ضعيفة إلى نماذج مختلفة جدًا.
- حساسية للمعلمات الفائقة. قد تعتمد النتائج بدرجة كبيرة على عوامل مثل معدل التعلم أو التهيئة أو عدد خطوات التقطير.
- صعوبة أكبر في التوسع إلى التعقيد الواقعي. قد تفقد الأساليب التي تعمل جيدًا على المعايير دقتها عند تطبيقها على مجموعات بيانات كبيرة أو فوضوية أو عالية الدقة.
أهم النقاط المستخلصة#
يجعل تقطير مجموعة البيانات من الممكن لمجموعة صغيرة من العينات الاصطناعية أن تعلّم النموذج بفاعلية تكاد تماثل فاعلية مجموعة بيانات كاملة. وهذا يجعل التعلم الآلي أسرع وأكثر كفاءة وأسهل في التوسع. ومع نمو النماذج واحتياجها إلى مزيد من البيانات، توفر مجموعات البيانات المقطّرة طريقة عملية لتقليل تكاليف الحوسبة دون التضحية بالدقة.
انضم إلى مجتمعنا وتفقّد مستودعنا على GitHub لاكتشاف المزيد عن الذكاء الاصطناعي. وإذا كنت تتطلع إلى بناء مشروعك الخاص في مجال الذكاء الاصطناعي للرؤية، فتفقّد خيارات الترخيص لدينا. واستكشف المزيد حول تطبيقات مثل الذكاء الاصطناعي في الرعاية الصحية والذكاء الاصطناعي للرؤية في قطاع البيع بالتجزئة من خلال زيارة صفحات حلولنا.









