Mechanistic Interpretability
Khám phá Mechanistic Interpretability trong AI với Ultralytics. Tìm hiểu cách kỹ thuật đảo ngược các mạng thần kinh và truy vết các mạch thuật toán trong Ultralytics YOLO26.
Mechanistic Interpretability là một lĩnh vực nghiên cứu nâng cao trong machine learning tập trung vào việc đảo ngược kỹ thuật (reverse-engineering) hoạt động bên trong của các mạng neural đã được huấn luyện. Thay vì coi model như một hộp đen, cách tiếp cận này tìm cách hiểu rõ các mạch toán học chính xác, các neuron cụ thể và các đường dẫn kết nối khiến model tạo ra một đầu ra cụ thể. Bằng cách ánh xạ các cấu trúc bên trong này thành các khái niệm con người có thể hiểu được, các developer có thể giải mã cách các hệ thống artificial intelligence xử lý thông tin theo từng layer.
Mechanistic Interpretability so với Explainable AI (XAI)#
Thường rất dễ nhầm lẫn Mechanistic Interpretability với Explainable AI (XAI) nói chung. Mặc dù XAI là một thuật ngữ rộng hơn bao gồm các công cụ như bản đồ nhiệt (heatmap) hoặc bản đồ saliency làm nổi bật vị trí nơi model đang tập trung, Mechanistic Interpretability nhằm mục đích trả lời câu hỏi model tính toán phản hồi của mình như thế nào và tại sao. Ví dụ, trong khi XAI có thể cho thấy một model object detection tập trung vào kết cấu lông để nhận diện một con chó, Mechanistic Interpretability hướng đến việc xác định vị trí các neuron "phát hiện lông" cụ thể và truy tìm các kết nối thuật toán của chúng dẫn đến dự đoán cuối cùng.
Các ứng dụng trong thực tế#
Hiểu được logic nội bộ chính xác của neural networks là rất quan trọng để triển khai AI trong các1 ứng dụng có rủi ro cao. Dưới đây là hai ứng dụng cụ thể:
- Auditing for AI Safety and Alignment: Các tổ chức như Anthropic và OpenAI sử dụng Mechanistic Interpretability để kiểm tra các large language models (LLMs) nhằm phát hiện các thành kiến ẩn, hành vi lừa đảo hoặc sự lệch hướng tiềm ẩn với giá trị con người. Bằng cách trích xuất các đặc trưng mà con người có thể đọc được bằng các kỹ thuật như sparse autoencoders, các nhà nghiên cứu có thể chỉnh sửa hoặc vô hiệu hóa các đường dẫn độc hại trước khi triển khai để đảm bảo tính an toàn cho AI safety.
- Debugging Medical Diagnostics: Trong các lĩnh vực quan trọng như healthcare, Mechanistic Interpretability giúp các nhà nghiên cứu xác minh rằng các thuật toán computer vision đang dựa trên các dấu hiệu sinh học thực sự chứ không phải các artifact (như hình mờ của bệnh viện hoặc thước kẻ trong hình ảnh) khi dự đoán bệnh. Việc xác thực chi tiết này là thiết yếu để compliance and trust in medical AI.
Trích xuất tính năng để phục vụ khả năng diễn giải#
Khi làm việc với các kiến trúc computer vision, bước đầu tiên phổ biến trong Mechanistic Interpretability là trích xuất các kích hoạt trung gian (intermediate activations). Sử dụng các công cụ như PyTorch forward hooks, các developer có thể nhìn vào bên trong network trong một lần chạy chuyển tiếp (forward pass).
Đoạn mã mẫu sau đây minh họa cách gắn một hook vào layer tích chập đầu tiên của một model Ultralytics YOLO26 để kiểm tra kích thước của các feature map bên trong được tạo ra trong quá trình inference.
from ultralytics import YOLO
# Load the Ultralytics YOLO26 nano model
model = YOLO("yolo26n.pt")
# Define a hook function to capture and inspect intermediate layer activations
def hook_fn(module, input, output):
print(f"Analyzed Layer: {module.__class__.__name__} | Activation Shape: {output.shape}")
# Attach the hook to the first layer of the model architecture
handle = model.model.model[0].register_forward_hook(hook_fn)
# Run a quick inference to trigger the hook and print the mechanistic features
results = model("https://ultralytics.com/images/bus.jpg")
handle.remove()Bằng cách phân tích các kích hoạt này, các kỹ sư ML có thể thực hiện feature visualization và bắt đầu ánh xạ hành vi của network. Để quản lý các tập dữ liệu quy mô lớn cần thiết để huấn luyện các hệ thống có khả năng diễn giải này, các công cụ như Ultralytics Platform cung cấp các pipeline đầu-cuối mạnh mẽ giúp đơn giản hóa việc huấn luyện model, ghi log và giám sát liên tục. Khi xu hướng transparency in AI gia tăng, Mechanistic Interpretability sẽ vẫn là một nền tảng cơ bản để xây dựng các model đáng tin cậy.






