Tabular Foundation Models
تعرف على كيفية استخدام نماذج الأساس الجدولية للمعرفة المُدربة مسبقاً في مهام التصنيف والانحدار، مع سير العمل العملي، والتطبيقات، وإرشادات التقييم.
نماذج الأساس الجدولية هي نماذج تعلم ماشية مُدرَّبة مسبقاً مصممة لإجراء تنبؤات من بيانات منظمة مُرتبة في صفوف وأعمدة. وبدلاً من تعلم كل مهمة جديدة تماماً من الصفر، فإنها تعيد استخدام الأنماط المُكتسبة عبر العديد من مجموعات البيانات لتفسير جدول جديد وأمثلته المُصنفة والعلاقات بين ميزاته. وهي تُوسّع مفهوم نموذج أساس للأغراض العامة ليشمل مشاكل التعلُّم المُشرف عليه الشائعة مثل التصنيف والانحدار.
كيف تعمل نماذج الأساس الجدولية#
يتعلَّم النموذج الجدولي التقليدي فقط من مجموعة البيانات المُقدمة لمهمة واحدة. أما نموذج الأساس الجدولي، فيتم تدريبه مسبقاً أولاً عبر توزيع واسع من الجداول أو مشاكل البيانات المُولّدة. وهذا يعلّمه افتراضات قابلة لإعادة الاستخدام حول العلاقات، والتشويش، وتفاعلات الميزات، وحدود الفئات، والمعلومات المفقودة.
عند تزويده بمجموعة بيانات جديدة، يفحص النموذج صفوف التدريب، وقيمها المستهدفة، والصفوف التي تتطلب تنبؤات. يُنفّذ العديد من تطبيقات هذه الخطوة من خلال التعلم ضمن السياق: توفر السجلات المُصنفة السياق اللازم لحل المهمة الجديدة، وغالباً دون الحاجة إلى تحسين مطوّل للمعلمات الخاصة بالمهمة. وقد يقوم نموذج transformer بمعالجة الأعمدة والصفوف كعناصر سياقية، على الرغم من اختلاف البُنى.
تطرح الجداول تحديات لا تواجهها الصور والنصوص. يمكن أن تمثل الأعمدة قياسات مستمرة، أو فئات، أو تواريخ، أو تعدادات، أو معرفات، وغالباً ما يحمل ترتيبها القليل من المعنى. ويظل إعداد البيانات الجيد أمراً أساسياً. يوضح دليل سيكيليت-ليرن حول معالجة الأعمدة مختلطة الأنواع سبب احتياج أنواع الميزات المختلفة إلى معالجة مختلفة، بينما تشرح وثائق مكتبة pandas طرقاً متسقة لـتمثيل البيانات المفقودة. يمكن لنموذج الأساس أن يقلل من هندسة الميزات اليدوية، لكنه لا يستطيع تصحيح التسميات المضللة أو المتغيرات ضعيفة التحديد تلقائياً.
المفاهيم ذات الصلة والفروق الرئيسية#
-
التعلم الآلي الآلي: يبحث التعلم الآلي الآلي بين الخوارزميات، وخطوات المعالجة المسبقة، والمعلمات الفائقة لكل مجموعة بيانات. وبدلاً من ذلك، يجلب نموذج الأساس الجدولي معرفة قابلة لإعادة الاستخدام من التدريب المسبق وقد ينتج عنه تنبؤ مع القليل من البحث عن النماذج.
-
التعلم النقلي: يقوم التعلم النقلي عادةً بتكييف الأوزان المُدرَّبة مسبقاً من خلال الضبط الدقيق. ويمكن لنماذج الأساس الجدولية دعم الضبط الدقيق، ولكن العديد منها مصمم للاستدلال مباشرةً من أمثلة الجدول الجديد.
-
الأشجار المعززة بالتدرج: تظل تجمعات الأشجار خطوط أساس جدولية قوية وفعالة ويتم تدريبها بشكل منفصل لكل مهمة. قد تكون نماذج الأساس ملائمة بشكل خاص لمجموعات البيانات الصغيرة، أو التجارب السريعة، أو المهام المتكررة، ولكن يجب مقارنتها بنماذج الأشجار بدلاً من افتراض أنها تحل محلها.
تختلف نماذج الأساس الجدولية أيضاً عن نماذج اللغة المطبقة على نصوص قيم مفصولة بفواصل. فهي تعمل على الهيكل الإحصائي للميزات والأهداف بدلاً من التعامل مع كل صف كرسالة توجيهية اعتيادية بلغة طبيعية.
التطبيقات الواقعية#
-
تقييم المخاطر السريرية: قد يحتوي المستشفى على جدول صغير نسبياً يحتوي على عمر المريض، والقياسات المخبرية، والأعراض، وتاريخ العلاج، وتسمية النتيجة. يمكن لنموذج الأساس الجدولي تقدير المخاطر مثل إعادة القبول أو المضاعفات دون الحاجة إلى تشغيل تدريب شبكة عصبية كبيرة. ونظراً لأن الأخطاء قد تؤثر على قرارات الرعاية، يجب على الفرق تقييم الأداء عبر مجموعات المرضى والاحتفاظ بإشراف سريري مناسب. يمكن أن يكمل هذا التدفق العملي الرؤية الحاسوبية في الرعاية الصحية القائمة على الصور، حيث تصبح القياسات المستمدة من المسح أعمدة جدول إضافية.
-
تنبؤ جودة التصنيع: يمكن لنظام الفحص استخدام الرؤية الحاسوبية لاكتشاف العيوب المرئية مع تسجيل درجة حرارة الآلة، وسرعة الإنتاج، ودفعة المواد، والوردية، وقراءات المستشعرات. يمكن تحويل التنبؤات الصادرة عن نموذج Ultralytics YOLO26 —مثل عدد العيوب أو درجات الثقة— إلى ميزات منظمة ودمجها مع بيانات التشغيل. ويمكن لنموذج جدولي بعد ذلك التنبؤ ما إذا كانت الوحدة تحتاج إلى مراجعة أم أن العملية من المرجح أن تنحرف خارج نطاق التفاوت المسموح. يمكن للفرق إدارة تعصيب بيانات الرؤية، والتدريب، والنشر من خلال منصة Ultralytics.
سير العمل العملي والتقييم#
يكشف تطبيق معروف عن مصنف بأسلوب سيكيليت-ليرن من خلال تدفق عمل تصنيف TabPFN المُوثّق. بعد تثبيت tabpfn و scikit-learn وإكمال أي وصول مطلوب للنموذج في التشغيل الأول، يكون مثال التصنيف الثنائي البسيط هو:
from sklearn.datasets import load_breast_cancer
from sklearn.metrics import roc_auc_score
from sklearn.model_selection import train_test_split
from tabpfn import TabPFNClassifier
# Create separate training and test sets
features, targets = load_breast_cancer(return_X_y=True)
x_train, x_test, y_train, y_test = train_test_split(features, targets, test_size=0.2, random_state=42, stratify=targets)
# Fit from the labeled context and predict probabilities
model = TabPFNClassifier()
model.fit(x_train, y_train)
probabilities = model.predict_proba(x_test)[:, 1]
print(roc_auc_score(y_test, probabilities))يوضح هذا واجهة الملاءمة والتنبؤ المألوفة، لكن تقسيم اختبار واحد ليس دليلاً كافياً على الجاهزية للإنتاج. استخدم استراتيجيات التحقق المتبادل المناسب، واقِ من تسريب المعالجة المسبقة أو الأهداف، واختر مقاييس التقييم التي تتطابق مع تكلفة الأخطاء. عندما تعتمد القرارات على الاحتمالات المتنبأ بها، تحقق من معايرة الاحتمالات، وليس الدقة وحدها.
وأخيراً، افحص الأداء حسب المجموعات الفرعية، وقارن مقابل الخطوط الأساسية البسيطة، واختبر البيانات المُزاحة، ووثّق القيود. يوفر إطار عمل إدارة المخاطر للذكاء الاصطناعي من المعهد الوطني للمعايير والتقنية توجيهاً أوسع لتقييم جدير بالثقة، بينما يساعد مراقبة النماذج المستمرة في اكتشاف توزيعات الميزات المتغيرة وتراجع الأداء بعد النشر.









