Mechanistic Interpretability
استكشف القابلية للتفسير الميكانيكي في الذكاء الاصطناعي مع Ultralytics. تعلم كيفية إجراء هندسة عكسية للشبكات العصبية وتتبع الدوائر الخوارزمية في Ultralytics YOLO26.
التفسير الآلي هو مجال بحثي متقدم ضمن التعلم الآلي يركز على الهندسة العكسية للأعمال الداخلية للشبكات العصبية المدربة. بدلاً من التعامل مع النموذج كصندوق أسود، يسعى هذا النهج إلى فهم الدوائر الرياضية الدقيقة، والخلايا العصبية المحددة، والمسارات المتصلة التي تتسبب في إنتاج النموذج لخرج معين. ومن خلال تعيين هذه الهنى الداخلية في مفاهيم قابلة للفهم بشرياً، يمكن للمطورين فك شفرة كيف تعتمد أنظمة الذكاء الاصطناعي في معالجة المعلومات طبقة تلو الأخرى.
القابلية للتفسير الآلي مقابل الذكاء الاصطناعي القابل للتفسير (XAI)#
من الشائع الخلط بين التفسير الآلي والذكاء الاصطناعي القابل للتفسير (XAI) العام Explainable AI (XAI). وفي حين أن XAI هو مصطلح أوسع يضم أدوات مثل الخرائط الحرارية أو خرائط السطوع التي تبرز أين ينظر النموذج، فإن التفسير الآلي يهدف إلى الإجابة عن كيف ولماذا يحسب النموذج استجابته. على سبيل المثال، بينما قد يظهر نموذج اكتشاف الكائنات أن نموذجاً ما يركز على ملمس فروي لتحديد كلب، فإن التفسير الآلي يهدف إلى تحديد الخلايا العصبية المحددة "التي تكتشف الفرو" وتتبع اتصالاتها الخوارزمية بالتنبؤ النهائي.
تطبيقات العالم الحقيقي#
يعد فهم المنطق الداخلي الدقيق لـ الشبكات العصبية أمراً بالغ الأهمية لنشر ذكاء اصطناعي عالي المخاطر. إليك تطبيقين ملموسين:
- التدقيق من أجل سلامة ومواءمة الذكاء الاصطناعي: تستخدم منظمات مثل Anthropic وOpenAI التفسير الآلي لفحص النماذج اللغوية الكبيرة (LLMs) بحثاً عن التحيزات المخفية، أو السلوكيات الخادعة، أو عدم التوافق المحتمل مع القيم البشرية. من خلال استخراج ميزات مقروءة بشرياً باستخدام تقنيات مثل التشفير التلقائي المتفرق، يمكن للباحثين تعديل أو تعطيل المسارات الضارة جراحياً قبل النشر لضمان سلامة الذكاء الاصطناعي القوية.
- تصحيح التشخيصات الطبية: في المجالات الحرجة مثل الرعاية الصحية، يساعد التفسير الآلي الباحثين على التحقق من أن خوارزميات الرؤية الحاسوبية تعتمد على علامات بيولوجية حقيقية وليست على آثار (مثل العلامة المائية للمستشفى أو المسطرة في الصورة) عند التنبؤ بالأمراض. هذا التحقق الدقيق ضروري لـ الامتثال والثقة في الذكاء الاصطناعي الطبي.
استخراج الميزات من أجل القابلية للتفسير#
عند العمل مع بنيات الرؤية الحاسوبية، تتمثل الخطوة الأولى الشائعة في التفسير الآلي في استخراج التنشيطات الوسيطة. باستخدام أدوات مثل PyTorch forward hooks، يمكن للمطورين إلقاء نظرة خاطفة داخل الشبكة أثناء عملية التمرير الأمامي.
يوضح المقتطف التالي كيفية إرفاق خطاف (hook) بالطبقة الالتفافية الأولى لنموذج Ultralytics YOLO26 لفحص أبعاد خرائط الميزات الداخلية الناتجة أثناء الاستدلال.
from ultralytics import YOLO
# Load the Ultralytics YOLO26 nano model
model = YOLO("yolo26n.pt")
# Define a hook function to capture and inspect intermediate layer activations
def hook_fn(module, input, output):
print(f"Analyzed Layer: {module.__class__.__name__} | Activation Shape: {output.shape}")
# Attach the hook to the first layer of the model architecture
handle = model.model.model[0].register_forward_hook(hook_fn)
# Run a quick inference to trigger the hook and print the mechanistic features
results = model("https://ultralytics.com/images/bus.jpg")
handle.remove()من خلال تحليل هذه التنشيطات، يمكن لمهندسي تعلم الآلة إجراء تصور الميزات والبدء في تعيين سلوك الشبكة. لإدارة مجموعات البيانات واسعة النطاق اللازمة لتدريب هذه الأنظمة القابلة للتفسير، توفر أدوات مثل Ultralytics Platform خطوط أنابيب قوية من البداية إلى النهاية تبسط تدريب النموذج، والتسجيل، والمراقبة المستمرة. ومع تسارع الدفع نحو الشفافية في الذكاء الاصطناعي، سيظل التفسير الآلي تخصصاً أساسياً لبناء نماذج جديرة بالثقة وموثوقة.






