Adversarial Attacks
Khám phá cách các cuộc tấn công đối nghịch thao túng model machine learning. Tìm hiểu các chiến lược white-box và black-box, rủi ro đối với an toàn AI và cách phòng thủ bằng Ultralytics YOLO26.
Các cuộc tấn công đối nghịch là một nhóm kỹ thuật thao túng tinh vi được thiết kế để đánh lừa các model machine learning (ML) đưa ra dự đoán sai với độ tin cậy cao. Các cuộc tấn công này hoạt động bằng cách đưa vào dữ liệu đầu vào những nhiễu loạn nhỏ, thường không thể nhận thấy—chẳng hạn như hình ảnh, âm thanh hoặc văn bản. Mặc dù những thay đổi này trông vô hại hoặc ngẫu nhiên đối với người quan sát, chúng khai thác các lỗ hổng toán học cụ thể trong ranh giới quyết định của các mạng neural nhiều chiều. Khi các hệ thống Trí tuệ nhân tạo (AI) trở thành một phần không thể thiếu của cơ sở hạ tầng trọng yếu về an toàn, việc hiểu cách các lỗ hổng này hoạt động là điều thiết yếu để phát triển các giao thức an toàn AI và cơ chế phòng vệ mạnh mẽ.
Cách các cuộc tấn công đối nghịch hoạt động#
Trong một quy trình huấn luyện deep learning (DL) điển hình, model tối ưu hóa các trọng số để giảm thiểu lỗi trên tập dữ liệu huấn luyện. Tuy nhiên, về bản chất, các model này tạo ra những ánh xạ phức tạp trong không gian đa chiều. Một cuộc tấn công đối nghịch tính toán chính xác "hướng" trong không gian này cần thiết để đẩy một đầu vào vượt qua một ranh giới, làm thay đổi kết quả phân loại của model. Chẳng hạn, trong thị giác máy tính (CV), việc thay đổi các giá trị pixel của hình ảnh một con gấu trúc bằng một lượng "nhiễu" được tính toán có thể khiến hệ thống tự tin phân loại sai thành vượn, mặc dù hình ảnh vẫn trông hoàn toàn giống một con gấu trúc đối với mắt người.
Các chiến lược tấn công thường được phân loại theo mức độ truy cập mà kẻ tấn công có vào hệ thống mục tiêu:
- Tấn công hộp trắng: Kẻ tấn công có khả năng quan sát đầy đủ kiến trúc model, các gradient và trọng số model. Điều này cho phép họ tính toán bằng toán học nhiễu loạn hiệu quả nhất, thường sử dụng các kỹ thuật như Phương pháp dấu gradient nhanh (FGSM).
- Tấn công hộp đen: Kẻ tấn công không biết các tham số nội bộ của model và chỉ có thể quan sát đầu vào cùng đầu ra. Kẻ tấn công thường sử dụng một "model thay thế" để tạo ra các ví dụ đối nghịch có khả năng chuyển hiệu quả sang hệ thống mục tiêu, một đặc tính được gọi là khả năng chuyển giao.
Ứng dụng và rủi ro trong thế giới thực#
Mặc dù thường được thảo luận trong các nghiên cứu lý thuyết, các cuộc tấn công đối nghịch vẫn gây ra những rủi ro cụ thể đối với các hệ thống triển khai trong thế giới thực, đặc biệt là trong các hệ thống tự động và lĩnh vực an ninh.
- Xe tự hành: Xe tự lái phụ thuộc nhiều vào phát hiện đối tượng để diễn giải các biển báo giao thông. Nghiên cứu đã chứng minh rằng việc dán các miếng dán hoặc băng keo được thiết kế cẩn thận lên biển báo dừng có thể đánh lừa hệ thống thị giác của xe, khiến hệ thống nhận diện nó thành biển báo giới hạn tốc độ. Kiểu tấn công trong thế giới vật lý này có thể dẫn đến những lỗi nguy hiểm trong các ứng dụng AI trong ngành ô tô.
- Đối tượng né nhận diện khuôn mặt: Các hệ thống an ninh kiểm soát quyền truy cập dựa trên dữ liệu sinh trắc học có thể bị xâm phạm bởi các "patch" đối nghịch. Đây có thể là những họa tiết được in trên kính hoặc quần áo, làm gián đoạn quy trình trích xuất đặc trưng. Điều này cho phép một cá nhân không được cấp quyền hoàn toàn né tránh việc phát hiện hoặc giả mạo một người dùng cụ thể, qua đó vượt qua các hệ thống báo động an ninh.
Tạo các ví dụ đối nghịch bằng Python#
Để hiểu một số model có thể mong manh đến mức nào, sẽ rất hữu ích nếu quan sát việc một hình ảnh có thể bị làm nhiễu dễ dàng ra sao. Mặc dù suy luận tiêu chuẩn với các model như YOLO26 vẫn mạnh mẽ cho mục đích sử dụng chung, các nhà nghiên cứu thường mô phỏng các cuộc tấn công để cải thiện giám sát model và khả năng phòng vệ. Ví dụ mang tính khái niệm sau đây sử dụng PyTorch để minh họa cách gradient được dùng nhằm tính toán nhiễu loạn đối nghịch (nhiễu) cho một hình ảnh.
import torch.nn.functional as F
# Assume 'model' is a loaded PyTorch model and 'image' is a normalized tensor
# 'target_class' is the correct label index for the image
def generate_adversarial_noise(model, image, target_class, epsilon=0.01):
# Enable gradient calculation for the input image
image.requires_grad = True
# Forward pass: get prediction
output = model(image)
# Calculate loss based on the correct class
loss = F.nll_loss(output, target_class)
# Backward pass: calculate gradients of loss w.r.t input
model.zero_grad()
loss.backward()
# Create perturbation using the sign of the data gradient (FGSM)
# This pushes the image in the direction of maximizing error
perturbation = epsilon * image.grad.data.sign()
return perturbationCác khái niệm liên quan#
Điều quan trọng là phân biệt các cuộc tấn công đối nghịch với những dạng lỗi hoặc thao túng model khác:
- Đầu độc dữ liệu: Không giống các cuộc tấn công đối nghịch, vốn thao túng đầu vào trong quá trình suy luận (thời điểm kiểm thử), đầu độc dữ liệu liên quan đến việc làm hỏng chính dữ liệu huấn luyện trước khi model được xây dựng, từ đó cài cắm các backdoor hoặc thiên lệch ẩn.
- Chèn prompt: Kỹ thuật này dành riêng cho Các model ngôn ngữ lớn (LLMs) và các giao diện văn bản. Mặc dù tương tự về mặt khái niệm—đánh lừa model—kỹ thuật này dựa trên việc thao túng ngôn ngữ ngữ nghĩa thay vì làm nhiễu toán học dữ liệu pixel hoặc tín hiệu.
- Quá khớp: Đây là một lỗi huấn luyện trong đó model học nhiễu trong dữ liệu huấn luyện thay vì mẫu hình nền tảng. Các model bị quá khớp thường dễ bị tấn công đối nghịch hơn vì ranh giới quyết định của chúng quá phức tạp và mong manh.
Phát triển các biện pháp phòng vệ trước những cuộc tấn công này là một thành phần cốt lõi của MLOps hiện đại. Các kỹ thuật như huấn luyện đối nghịch—trong đó các ví dụ đã bị tấn công được thêm vào tập huấn luyện—giúp model trở nên chống chịu tốt hơn. Các nền tảng như Ultralytics Platform hỗ trợ các pipeline huấn luyện và validation nghiêm ngặt, cho phép các nhóm đánh giá độ mạnh mẽ của model trước khi triển khai lên các thiết bị biên.









