Data Augmentation
Khám phá cách data augmentation cải thiện độ robust của model và giảm overfitting. Tìm hiểu các kỹ thuật chính để nâng cao hiệu năng Ultralytics YOLO26 cho computer vision.
Tăng cường dữ liệu là một kỹ thuật quan trọng trong machine learning và thị giác máy tính, được sử dụng để tăng nhân tạo quy mô và tính đa dạng của tập dữ liệu huấn luyện bằng cách tạo ra các phiên bản đã chỉnh sửa từ dữ liệu hiện có. Thay vì thu thập và gắn nhãn hoàn toàn dữ liệu mới—một công việc có thể tốn nhiều thời gian và chi phí—kỹ thuật tăng cường áp dụng nhiều phép biến đổi khác nhau lên các mẫu ban đầu. Những thay đổi này giúp model machine learning học cách nhận diện các mẫu một cách mạnh mẽ hơn, đảm bảo chúng hoạt động tốt ngay cả khi gặp các biến thể trong môi trường thực tế. Bằng cách cho model tiếp xúc với nhiều kịch bản hơn trong quá trình huấn luyện, developer có thể giảm hiệu quả hiện tượng overfitting và cải thiện khả năng tổng quát hóa.
Mức độ liên quan trong AI hiện đại#
Trong lĩnh vực thị giác máy tính, model thường gặp khó khăn khi được cung cấp những hình ảnh hơi khác so với dữ liệu huấn luyện. Các biến thể về ánh sáng, hướng hoặc phông nền lộn xộn có thể khiến một model chưa được tiếp xúc với đủ sự đa dạng bị nhầm lẫn. Tăng cường dữ liệu giải quyết vấn đề này bằng cách mô phỏng các biến thể đó theo lập trình. Ví dụ, một hình ảnh con mèo có thể được xoay, lật hoặc làm mờ nhẹ để dạy model rằng đối tượng vẫn là một "con mèo" bất kể những thay đổi này.
Quy trình này đóng vai trò thiết yếu đối với thành công của các kiến trúc hiện đại như Ultralytics YOLO26, vốn dựa vào các tập dữ liệu phong phú và đa dạng để đạt độ chính xác cao trong những tác vụ như phát hiện đối tượng và phân đoạn hình ảnh. Bằng cách tổng hợp các mẫu huấn luyện mới, kỹ thuật tăng cường cho phép model học các đặc trưng bất biến—những đặc điểm không thay đổi dù đầu vào bị biến đổi.
Các kỹ thuật và phương pháp phổ biến#
Tăng cường dữ liệu bao gồm nhiều kỹ thuật biến đổi, từ các điều chỉnh hình học đơn giản đến những phương pháp sinh dữ liệu phức tạp:
- Biến đổi hình học: Bao gồm các thao tác như xoay, thay đổi tỷ lệ, lật, cắt xén và dịch chuyển (thay đổi vị trí) hình ảnh. Những thao tác này biểu thị các thay đổi về góc nhìn của camera hoặc vị trí của đối tượng.
- Điều chỉnh không gian màu: Việc thay đổi độ sáng, độ tương phản, độ bão hòa và sắc độ giúp model xử lý các điều kiện chiếu sáng hoặc cảm biến camera khác nhau.
- Bổ sung nhiễu: Việc thêm nhiễu ngẫu nhiên (chẳng hạn như nhiễu Gaussian) có thể giúp model chống chịu tốt hơn trước dữ liệu đầu vào bị nhiễu hạt hoặc có chất lượng thấp.
- Trộn hình ảnh: Các kỹ thuật như MixUp hoặc Mosaic (phổ biến trong quá trình huấn luyện YOLO) kết hợp nhiều hình ảnh thành một mẫu huấn luyện duy nhất, buộc model học ngữ cảnh và mối quan hệ giữa các đối tượng hiệu quả hơn.
- Phương pháp sinh dữ liệu: Các phương pháp nâng cao sử dụng Generative AI hoặc model khuếch tán để tạo ra các mẫu huấn luyện tổng hợp hoàn toàn mới, mô phỏng các đặc điểm của tập dữ liệu ban đầu.
Các ứng dụng trong thực tế#
Tác động thực tiễn của tăng cường dữ liệu trải rộng trên nhiều ngành, trong đó tình trạng khan hiếm dữ liệu hoặc độ biến thiên cao là một thách thức.
Lái xe tự hành#
Trong quá trình phát triển phương tiện tự hành, gần như không thể thu thập dữ liệu cho mọi điều kiện thời tiết hoặc kịch bản chiếu sáng có thể xảy ra. Các kỹ sư sử dụng tăng cường dữ liệu để mô phỏng mưa, sương mù, tuyết hoặc hiện tượng chói sáng trên các hình ảnh trong điều kiện thời tiết quang đãng. Điều này đảm bảo hệ thống nhận thức có thể phát hiện đáng tin cậy người đi bộ, biển báo giao thông và các phương tiện khác bất kể yếu tố môi trường, qua đó nâng cao tính an toàn và độ tin cậy.
Chẩn đoán hình ảnh y khoa#
Phân tích hình ảnh y khoa thường gặp hạn chế về tập dữ liệu do các mối lo ngại về quyền riêng tư và sự hiếm gặp của một số tình trạng nhất định. Kỹ thuật tăng cường cho phép các nhà nghiên cứu mở rộng những tập dữ liệu nhỏ gồm ảnh X-quang hoặc ảnh chụp MRI bằng cách áp dụng các phép biến dạng đàn hồi, xoay hoặc thay đổi cường độ. Điều này giúp huấn luyện các model chẩn đoán mạnh mẽ, có khả năng xác định khối u hoặc tình trạng gãy xương với độ nhạy cao, ngay cả khi tư thế bệnh nhân hoặc chất lượng ảnh chụp thay đổi.
Phân biệt các khái niệm liên quan#
Điều quan trọng là phải phân biệt tăng cường dữ liệu với Dữ liệu tổng hợp. Mặc dù cả hai đều nhằm mục đích tăng quy mô tập dữ liệu, dữ liệu tổng hợp được tạo nhân tạo từ đầu (thường bằng công cụ dựng hình 3D hoặc engine mô phỏng), trong khi tăng cường dữ liệu sửa đổi dữ liệu thực tế hiện có. Ngoài ra, Tiền xử lý dữ liệu bao gồm việc làm sạch và định dạng dữ liệu (ví dụ: thay đổi kích thước, chuẩn hóa) để dữ liệu phù hợp với model, nhưng khác với tăng cường, quy trình này không nhất thiết làm tăng số lượng mẫu huấn luyện.
Triển khai tăng cường với Ultralytics#
Các framework hiện đại tích hợp trực tiếp tính năng tăng cường vào pipeline huấn luyện. Ví dụ dưới đây minh họa cách áp dụng các phép tăng cường như lật và thay đổi tỷ lệ trong quá trình huấn luyện model Ultralytics YOLO26 bằng package ultralytics.
from ultralytics import YOLO
# Load the YOLO26 model
model = YOLO("yolo26n.pt")
# Train with custom data augmentation hyperparameters
# fliplr: 50% chance of horizontal flip, scale: image scaling gain
results = model.train(data="coco8.yaml", epochs=10, fliplr=0.5, scale=0.5)Bằng cách điều chỉnh các hyperparameter này, developer có thể tùy chỉnh chiến lược tăng cường theo nhu cầu cụ thể của tập dữ liệu và ứng dụng, tận dụng tính linh hoạt của Ultralytics Platform để phát triển model hiệu quả.









