Self-supervised learning cho khử nhiễu: Phân tích từng bước
Xem cách self-supervised learning cho khử nhiễu hoạt động, lý do hình ảnh bị nhiễu và các phương pháp, bước chính được sử dụng để khôi phục chi tiết hình ảnh rõ nét.

Camera không phải lúc nào cũng ghi lại thế giới giống như cách chúng ta nhìn thấy. Một bức chân dung chụp trong điều kiện thiếu sáng hoặc ảnh một chiếc xe đang di chuyển nhanh có thể trông nhiễu hạt, mờ hoặc méo.
Cảm biến chậm, môi trường tối và chuyển động có thể tạo ra những đốm nhiễu nhỏ làm mềm các cạnh và che khuất chi tiết quan trọng. Khi độ rõ nét bị mất, ngay cả các hệ thống AI và machine learning tiên tiến cũng có thể gặp khó khăn trong việc hiểu ảnh chứa gì, vì nhiều hệ thống thông minh phụ thuộc vào những chi tiết nhỏ đó để hoạt động hiệu quả.
Ví dụ, thị giác máy tính là một nhánh của trí tuệ nhân tạo, cho phép máy móc diễn giải hình ảnh và video. Tuy nhiên, để thực hiện chính xác, các model AI thị giác cần dữ liệu hình ảnh sạch và chất lượng cao để học.
Cụ thể, các model như Ultralytics YOLO11 và Ultralytics YOLO26 sắp ra mắt hỗ trợ các tác vụ như phát hiện đối tượng, phân đoạn instance và ước tính tư thế, đồng thời có thể được custom train cho nhiều trường hợp sử dụng khác nhau. Các tác vụ này phụ thuộc vào những dấu hiệu hình ảnh rõ ràng như cạnh, kết cấu, màu sắc và các chi tiết cấu trúc tinh vi.
Khi nhiễu che khuất các đặc trưng này, model nhận được tín hiệu huấn luyện yếu hơn, khiến việc học các pattern chính xác trở nên khó khăn hơn. Do đó, ngay cả một lượng nhiễu nhỏ cũng có thể làm giảm hiệu năng trong các ứng dụng thực tế.
Trước đây, chúng ta đã tìm hiểu cách học tự giám sát khử nhiễu hình ảnh. Trong bài viết này, chúng ta sẽ đi sâu hơn vào cách các kỹ thuật khử nhiễu tự giám sát hoạt động và cách chúng giúp khôi phục thông tin hình ảnh có ý nghĩa. Hãy bắt đầu!
Các loại nhiễu phổ biến trong hình ảnh thực tế#
Trước khi tìm hiểu cách học tự giám sát được sử dụng để khử nhiễu hình ảnh, trước tiên hãy cùng xem lại lý do hình ảnh bị nhiễu.
Hình ảnh các đối tượng và bối cảnh trong thế giới thực hiếm khi hoàn hảo. Ánh sáng yếu, chất lượng cảm biến hạn chế và chuyển động nhanh có thể tạo ra các nhiễu loạn ngẫu nhiên trên từng pixel trong ảnh. Những gián đoạn ở cấp pixel này, được gọi là nhiễu, làm giảm độ rõ nét tổng thể và khiến các chi tiết quan trọng khó nhìn thấy hơn.
Khi nhiễu che khuất các cạnh, kết cấu và pattern tinh tế, hệ thống thị giác máy tính sẽ gặp khó khăn trong việc nhận diện đối tượng hoặc diễn giải bối cảnh một cách chính xác. Các điều kiện khác nhau tạo ra những loại nhiễu khác nhau, mỗi loại ảnh hưởng đến hình ảnh theo một cách riêng.

Hình 1. Ví dụ về cách nhiễu có thể làm gia tăng độ bất định trong hình ảnh. (Nguồn)
Dưới đây là một số loại nhiễu phổ biến nhất trong hình ảnh:
- Nhiễu Gaussian: Loại nhiễu này xuất hiện dưới dạng hạt mềm, ngẫu nhiên do nhiễu giao thoa điện tử của cảm biến hoặc dao động nhiệt gây ra. Nó tuân theo phân phối Gaussian (chuẩn), trong đó các biến thiên nhỏ của pixel làm mờ chi tiết tinh vi và giảm độ sắc nét tổng thể.
- Nhiễu Poisson: Còn gọi là nhiễu shot, loại nhiễu này xảy ra trong điều kiện thiếu sáng hoặc khi thời gian phơi sáng ngắn. Phương sai của nó tăng theo độ sáng, nhưng nhiễu thường dễ nhận thấy hơn ở các vùng tối vì số photon được thu nhận ít hơn, dẫn đến tỷ lệ tín hiệu trên nhiễu thấp hơn.
- Nhiễu muối tiêu: Loại nhiễu này xuất hiện dưới dạng các đột biến pixel đen hoặc trắng sắc nét. Nhiễu thường do lỗi truyền tải, hỏng bit hoặc cảm biến camera bị lỗi gây ra, đồng thời thường dẫn đến các giá trị pixel bị thiếu hoặc hỏng.
- Nhiễu đốm: Loại nhiễu này xuất hiện dưới dạng các pattern dạng hạt, giống đốm và phổ biến trong ảnh y khoa, radar và siêu âm. Nhiễu do nhiễu giao thoa và tán xạ tín hiệu gây ra, làm giảm độ tương phản và khiến việc phát hiện cạnh khó khăn hơn.
Khi nào nên sử dụng khử nhiễu tự giám sát?#
Vậy điều gì khiến khử nhiễu tự giám sát trở nên đặc biệt? Phương pháp này phát huy hiệu quả trong những tình huống không tồn tại ảnh sạch, ground truth hoặc việc thu thập chúng quá khó khăn.
Điều này thường xảy ra trong nhiếp ảnh thiếu sáng, chụp ảnh ISO cao, ảnh y khoa và ảnh khoa học, hoặc bất kỳ môi trường nào mà nhiễu không thể tránh khỏi và việc thu thập dữ liệu tham chiếu hoàn hảo là không thực tế. Thay vì cần các ví dụ sạch, model học trực tiếp từ những ảnh nhiễu bạn đã có, nhờ đó thích ứng với các pattern nhiễu cụ thể của camera hoặc cảm biến.
Khử nhiễu tự giám sát cũng là một lựa chọn tuyệt vời khi bạn muốn cải thiện hiệu năng của các tác vụ thị giác máy tính downstream, nhưng dataset chứa nhiều ảnh không nhất quán hoặc bị nhiễu. Bằng cách khôi phục các cạnh, kết cấu và cấu trúc rõ ràng hơn, những phương pháp này giúp các model như YOLO phát hiện, phân đoạn và hiểu bối cảnh đáng tin cậy hơn. Tóm lại, nếu bạn đang làm việc với dữ liệu nhiễu và không có ảnh huấn luyện sạch, khử nhiễu tự giám sát thường là giải pháp thiết thực và hiệu quả nhất.
Các kỹ thuật cốt lõi thúc đẩy khử nhiễu tự giám sát#
Như đã thấy trước đây, khử nhiễu tự giám sát là một phương pháp AI dựa trên deep learning, cho phép các model học trực tiếp từ ảnh nhiễu mà không phụ thuộc vào nhãn sạch. Phương pháp này dựa trên các nguyên lý của học tự giám sát, trong đó model tự tạo tín hiệu huấn luyện từ chính dữ liệu.
Nói cách khác, một model có thể tự dạy chính nó bằng cách sử dụng ảnh nhiễu vừa làm đầu vào vừa làm nguồn tín hiệu học. Bằng cách so sánh các phiên bản bị hỏng khác nhau của cùng một ảnh hoặc dự đoán các pixel bị che, model học được pattern nào đại diện cho cấu trúc thực và pattern nào chỉ là nhiễu. Thông qua tối ưu hóa lặp và nhận dạng pattern, mạng dần cải thiện khả năng phân biệt nội dung hình ảnh có ý nghĩa với biến thiên ngẫu nhiên.

Hình 2. Ảnh gốc và ảnh đã khử nhiễu. (Nguồn)
Điều này có thể thực hiện được nhờ các chiến lược học cụ thể, hướng dẫn model tách cấu trúc hình ảnh ổn định khỏi nhiễu ngẫu nhiên. Tiếp theo, hãy cùng xem xét kỹ hơn các kỹ thuật và thuật toán cốt lõi giúp tinh giản quy trình này, cũng như cách mỗi phương pháp hỗ trợ model tái tạo hình ảnh sạch và đáng tin cậy hơn.
Các phương pháp khử nhiễu ảnh theo cặp#
Nhiều phương pháp học tự giám sát ban đầu để khử nhiễu hoạt động bằng cách so sánh hai phiên bản nhiễu của cùng một ảnh. Vì nhiễu thay đổi ngẫu nhiên mỗi lần ảnh được chụp hoặc làm hỏng, trong khi cấu trúc thực vẫn giữ nguyên, những khác biệt này có thể được dùng làm tín hiệu học cho model.
Các phương pháp này thường được gọi là phương pháp khử nhiễu ảnh theo cặp vì chúng sử dụng hoặc tạo ra các cặp ảnh nhiễu trong quá trình huấn luyện. Ví dụ, phương pháp Noise2Noise (do Jaakko Lehtinen và nhóm của ông đề xuất) huấn luyện model bằng hai ảnh nhiễu độc lập của cùng một bối cảnh. Vì pattern nhiễu khác nhau giữa hai phiên bản, model học cách nhận diện những chi tiết nhất quán đại diện cho hình ảnh nền thực tế.

Hình 3. Cách Noise2Noise hoạt động (Nguồn)
Theo thời gian, quá trình này dạy mạng loại bỏ nhiễu ngẫu nhiên và bảo toàn cấu trúc thực, dù chưa bao giờ nhìn thấy ảnh tham chiếu sạch. Hãy xét một tình huống đơn giản: bạn chụp hai bức ảnh một con phố thiếu sáng vào ban đêm.
Mỗi ảnh chứa cùng các tòa nhà, ánh đèn và bóng đổ, nhưng nhiễu hạt xuất hiện ở những vị trí khác nhau. Bằng cách so sánh hai ảnh nhiễu này trong quá trình huấn luyện, model tự giám sát có thể học được pattern hình ảnh nào ổn định và pattern nào do nhiễu gây ra, từ đó cải thiện khả năng tái tạo ảnh sạch hơn.
Các phương pháp học tự giám sát khử nhiễu dựa trên vùng mù#
Trong khi các phương pháp theo cặp dựa trên việc so sánh hai phiên bản khác nhau của cùng một ảnh bị làm hỏng, các phương pháp vùng mù sử dụng cách tiếp cận khác. Chúng cho phép model học từ một ảnh nhiễu duy nhất bằng cách che một số pixel được chọn để mạng không thể nhìn thấy giá trị đã bị nhiễu của chúng.
Sau đó, model phải dự đoán các pixel bị che chỉ bằng ngữ cảnh xung quanh. Ý tưởng cốt lõi là nhiễu mang tính ngẫu nhiên, còn cấu trúc nền của hình ảnh thì không.
Bằng cách ngăn model sao chép giá trị nhiễu của một pixel, các phương pháp vùng mù khuyến khích model suy luận giá trị pixel đó dựa trên các pattern hình ảnh ổn định như cạnh, kết cấu hoặc gradient màu lân cận. Các kỹ thuật như Noise2Void (do Alexander Krull và nhóm của ông giới thiệu) và Noise2Self (do Joshua Batson và Loïc Royer phát triển) triển khai nguyên lý này bằng cách che từng pixel riêng lẻ hoặc các vùng lân cận nhỏ rồi huấn luyện model tái tạo chúng.
Các phương pháp nâng cao hơn, bao gồm Noise2Same và PN2V, cải thiện độ bền vững bằng cách áp đặt các dự đoán nhất quán trên nhiều phiên bản bị che hoặc mô hình hóa rõ ràng phân phối nhiễu để ước tính độ bất định. Vì các phương pháp này chỉ cần một ảnh nhiễu duy nhất, chúng đặc biệt hữu ích trong những lĩnh vực mà việc chụp ảnh sạch hoặc ảnh theo cặp là không thực tế hoặc không thể thực hiện, chẳng hạn như kính hiển vi, thiên văn học, ảnh y sinh hoặc nhiếp ảnh thiếu sáng.
Các phương pháp khử nhiễu được hỗ trợ bởi Transformer#
Hầu hết các phương pháp khử nhiễu tự giám sát theo cặp và vùng mù đều dựa trên mạng nơ-ron tích chập (CNN) hoặc mạng khử nhiễu. CNN là lựa chọn tuyệt vời cho các phương pháp này vì chúng tập trung vào các pattern cục bộ, cụ thể là cạnh, kết cấu và chi tiết nhỏ.
Các kiến trúc như U-Net được sử dụng rộng rãi vì kết hợp các đặc trưng chi tiết với thông tin đa tỷ lệ. Tuy nhiên, CNN chủ yếu hoạt động trong các vùng lân cận giới hạn, nghĩa là chúng có thể bỏ sót những mối quan hệ quan trọng trải rộng trên các khu vực lớn hơn của hình ảnh.
Các phương pháp khử nhiễu hiện đại được hỗ trợ bởi Transformer được giới thiệu để giải quyết hạn chế này. Thay vì chỉ xem xét các pixel lân cận, phương pháp được đề xuất sử dụng cơ chế attention để hiểu mối quan hệ giữa các phần khác nhau của hình ảnh.
Một số model sử dụng attention toàn cục, trong khi các model khác sử dụng attention dựa trên window hoặc attention phân cấp để giảm chi phí tính toán, nhưng nhìn chung, chúng được thiết kế để nắm bắt cấu trúc tầm xa mà CNN không thể thực hiện một mình. Góc nhìn rộng hơn này giúp model khôi phục các kết cấu lặp lại, bề mặt mượt hoặc đối tượng lớn cần thông tin từ toàn bộ hình ảnh.
Các phương pháp khử nhiễu ảnh khác#
Ngoài các kỹ thuật tự giám sát, còn có một số cách khác để làm sạch ảnh nhiễu. Các phương pháp truyền thống như lọc song phương, khử nhiễu wavelet và trung bình phi cục bộ sử dụng các quy tắc toán học đơn giản để làm mượt nhiễu trong khi cố gắng giữ lại các chi tiết quan trọng.
Trong khi đó, cũng có các phương pháp deep learning, bao gồm các model có giám sát học từ các cặp ảnh sạch–nhiễu và mạng đối sinh (GAN) tạo ra kết quả sắc nét, chân thực hơn. Tuy nhiên, các phương pháp này thường yêu cầu chất lượng ảnh tốt hơn để huấn luyện.
Tìm hiểu từng bước cách khử nhiễu ảnh tự giám sát hoạt động#
Vì vừa tìm hiểu qua một số kỹ thuật khác nhau, bạn có thể thắc mắc liệu mỗi kỹ thuật có hoạt động theo một cách hoàn toàn khác hay không, bởi chúng sử dụng các kiến trúc riêng. Tuy nhiên, tất cả đều tuân theo một pipeline tương tự, bắt đầu từ chuẩn bị dữ liệu và kết thúc bằng đánh giá model.
Tiếp theo, hãy cùng xem xét kỹ hơn quy trình khử nhiễu ảnh tự giám sát tổng thể hoạt động như thế nào qua từng bước.
Bước 1: Tiền xử lý và chuẩn hóa#
Trước khi model có thể bắt đầu học từ ảnh nhiễu, bước đầu tiên là đảm bảo tất cả ảnh có diện mạo nhất quán. Ảnh thực tế có thể khác nhau rất nhiều.
Một số ảnh có thể quá sáng, một số khác quá tối, còn một số có màu hơi lệch. Nếu đưa trực tiếp những biến thiên này vào model, model sẽ khó tập trung học nhiễu trông như thế nào.
Để xử lý vấn đề này, mỗi ảnh sẽ trải qua bước chuẩn hóa và tiền xử lý cơ bản. Các bước này có thể bao gồm đưa giá trị pixel về một khoảng chuẩn, hiệu chỉnh biến thiên cường độ hoặc crop và resize. Điều cốt lõi là model nhận được dữ liệu sạch có thể được sử dụng làm đầu vào ổn định và có thể so sánh.
Bước 2: Tạo tín hiệu huấn luyện tự giám sát#
Sau khi ảnh đã được chuẩn hóa, bước tiếp theo là tạo tín hiệu huấn luyện cho phép model học mà không cần nhìn thấy ảnh sạch. Các phương pháp khử nhiễu tự giám sát thực hiện điều này bằng cách đảm bảo model không thể đơn giản sao chép các giá trị pixel nhiễu mà nó nhận được.
Thay vào đó, chúng tạo ra các tình huống buộc model phải dựa vào ngữ cảnh xung quanh của hình ảnh, nơi chứa cấu trúc ổn định, thay vì nhiễu khó dự đoán. Các phương pháp khác nhau đạt được điều này theo những cách hơi khác nhau, nhưng ý tưởng cốt lõi là giống nhau.
Một số phương pháp tạm thời che hoặc mask các pixel nhất định để model phải suy luận chúng từ các pixel lân cận, trong khi các phương pháp khác tạo ra một phiên bản bị làm hỏng riêng biệt của cùng ảnh nhiễu để đầu vào và target chứa nhiễu độc lập. Trong cả hai trường hợp, ảnh target chứa thông tin cấu trúc có ý nghĩa nhưng ngăn mạng truy cập giá trị nhiễu ban đầu của pixel mà nó cần dự đoán.
Vì nhiễu thay đổi ngẫu nhiên trong khi hình ảnh nền vẫn nhất quán, thiết lập này tự nhiên khuyến khích model học cấu trúc thực trông như thế nào và bỏ qua nhiễu biến đổi từ phiên bản này sang phiên bản khác.
Bước 3: Học khử nhiễu để khôi phục cấu trúc hình ảnh#
Khi tín hiệu huấn luyện đã sẵn sàng, model có thể bắt đầu học cách tách cấu trúc hình ảnh có ý nghĩa khỏi nhiễu thông qua quá trình huấn luyện model. Mỗi lần dự đoán một pixel bị mask hoặc bị làm hỏng lại, model phải dựa vào ngữ cảnh xung quanh thay vì giá trị nhiễu ban đầu tại vị trí đó.
Qua nhiều iteration hoặc epoch, quá trình này dạy mạng nhận diện những pattern còn ổn định trong hình ảnh, chẳng hạn như cạnh, kết cấu và bề mặt mượt. Mạng cũng học cách bỏ qua các dao động ngẫu nhiên đặc trưng cho nhiễu.
Ví dụ, hãy xét một bức ảnh thiếu sáng trong đó bề mặt trông cực kỳ nhiễu hạt. Mặc dù nhiễu thay đổi từ pixel này sang pixel khác, bề mặt nền vẫn mượt. Bằng cách liên tục suy luận các pixel bị che trong những vùng như vậy, model dần trở nên giỏi hơn trong việc xác định pattern ổn định bên dưới nhiễu và tái tạo pattern đó rõ ràng hơn.
Thông qua quá trình huấn luyện model, mạng học được một biểu diễn nội tại về cấu trúc hình ảnh. Điều này cho phép model khôi phục các chi tiết nhất quán ngay cả khi đầu vào bị hỏng nghiêm trọng.
Bước 4: Xác thực và kết quả giảm nhiễu#
Sau khi model đã học cách dự đoán các pixel bị che hoặc bị làm hỏng lại, bước cuối cùng là đánh giá hiệu năng trên toàn bộ hình ảnh. Trong quá trình kiểm thử, model nhận một ảnh nhiễu hoàn chỉnh và tạo ra phiên bản đã khử nhiễu hoàn chỉnh dựa trên những gì đã học về cấu trúc hình ảnh. Để đo lường mức độ hiệu quả của quy trình này, đầu ra được so sánh với ảnh tham chiếu sạch hoặc các dataset benchmark tiêu chuẩn.
Hai metric thường được sử dụng là PSNR (Tỷ số tín hiệu trên nhiễu cực đại), đo mức độ gần với ground truth sạch của ảnh tái tạo, và SSIM (Chỉ số tương đồng cấu trúc), đánh giá mức độ bảo toàn các đặc trưng quan trọng như cạnh và kết cấu. Điểm số cao hơn nhìn chung cho thấy kết quả khử nhiễu chính xác và đáng tin cậy hơn về mặt hình ảnh.
Các dataset hình ảnh được sử dụng để huấn luyện và benchmark#
Nghiên cứu về khử nhiễu tự giám sát, xuất hiện trong các tạp chí IEEE và hội nghị CVF như CVPR, ICCV và ECCV, cũng như được phân phối rộng rãi trên arXiv, thường dựa vào sự kết hợp giữa dataset tổng hợp và dataset thực tế để đánh giá hiệu năng model của các phương pháp deep learning trong cả điều kiện kiểm soát và thực tiễn. Một mặt, dataset tổng hợp bắt đầu từ ảnh sạch rồi thêm nhiễu nhân tạo, giúp dễ dàng so sánh các phương pháp bằng các metric như PSNR và SSIM.
Dưới đây là một số dataset phổ biến thường được thêm nhiễu tổng hợp để benchmark:
- Kodak24: Dataset này cung cấp các ảnh chụp bối cảnh tự nhiên chất lượng cao, thường được dùng để so sánh trực quan kết quả khử nhiễu.
- DIV2K: Dataset độ phân giải cao này chứa các hình ảnh đa dạng, nhiều chi tiết, được sử dụng để đánh giá độ trung thực của kết cấu và chất lượng khôi phục tổng thể.
Ngược lại, các dataset nhiễu trong thế giới thực chứa những hình ảnh được chụp trực tiếp từ cảm biến camera trong điều kiện thiếu sáng, ISO cao hoặc các điều kiện khó khăn khác. Những dataset này kiểm tra liệu model có thể xử lý nhiễu phức tạp, không Gaussian mà không dễ mô phỏng hay không.
Dưới đây là một số dataset nhiễu thực tế phổ biến:
- SIDD: Dataset này cung cấp các cặp ảnh nhiễu và ảnh sạch thực tế được chụp bằng cảm biến smartphone trong nhiều điều kiện ánh sáng.
- DND: Dataset này bao gồm các ảnh chụp ISO cao, ghi lại những pattern nhiễu cảm biến thực tế thường thấy ở các camera dành cho người dùng.

Hình 4. Ví dụ từ dataset DND. (Nguồn)
Các yếu tố cần cân nhắc khi huấn luyện model khử nhiễu tự giám sát#
Dưới đây là một số yếu tố và hạn chế cần cân nhắc nếu bạn định huấn luyện model khử nhiễu tự giám sát dựa trên deep learning:
- Khớp phân phối nhiễu: Ảnh nhiễu dùng để huấn luyện nên phản ánh cùng loại nhiễu mà model sẽ gặp trong quá trình sử dụng thực tế; nhiễu không tương thích dẫn đến khả năng tổng quát hóa kém.
- Đảm bảo tính đa dạng của dữ liệu huấn luyện: Biến thiên hạn chế có thể gây overfitting hoặc làm quá mượt các kết cấu phức tạp.
- Lưu ý các hạn chế theo loại nhiễu: Các phương pháp tự giám sát gặp nhiều khó khăn hơn với nhiễu có cấu trúc, tương quan hoặc không ngẫu nhiên.
- Kiểm thử trên nhiều thiết bị hoặc cảm biến: Hiệu năng khử nhiễu có thể khác biệt đáng kể giữa các camera hoặc hệ thống chụp ảnh.
Những điểm chính#
Khử nhiễu tự giám sát mang đến cho những người yêu thích AI một cách thiết thực để làm sạch hình ảnh chỉ bằng dữ liệu nhiễu mà chúng ta đã có. Bằng cách học nhận diện cấu trúc thực bên dưới nhiễu, các phương pháp này có thể khôi phục những chi tiết hình ảnh quan trọng. Khi công nghệ khử nhiễu tiếp tục cải thiện, công nghệ này có khả năng giúp nhiều tác vụ thị giác máy tính trở nên đáng tin cậy hơn trong các môi trường hằng ngày.
Hãy trở thành một phần của cộng đồng đang phát triển của chúng tôi! Truy cập repository GitHub để tìm hiểu thêm về AI. Nếu bạn muốn xây dựng các giải pháp thị giác máy tính, hãy tham khảo các tùy chọn cấp phép của chúng tôi. Khám phá những lợi ích của thị giác máy tính trong bán lẻ và xem AI trong sản xuất đang tạo ra sự khác biệt như thế nào!









