Самообучение без учителя для устранения шума: пошаговый разбор
Узнай, как работает самообучение без учителя для устранения шума, почему изображения становятся зашумлёнными и какие ключевые методы и шаги используются для восстановления чистых визуальных деталей.

Камеры не всегда фиксируют мир так, как мы его видим. Портрет, снятый при слабом освещении, или фотография быстро движущегося автомобиля могут выглядеть зернистыми, размытыми или искажёнными.
Медленные сенсоры, тёмные условия и движение могут создавать мелкие шумовые вкрапления, смягчающие границы объектов и скрывающие важные детали. Когда чёткость теряется, даже продвинутым системам ИИ и машинного обучения бывает сложно понять содержимое изображения, поскольку многие интеллектуальные системы зависят от этих тонких деталей.
Например, компьютерное зрение — это область искусственного интеллекта, позволяющая машинам интерпретировать изображения и видео. Но для точной работы моделям ИИ для компьютерного зрения нужны чистые и качественные визуальные данные для обучения.
В частности, такие модели, как Ultralytics YOLO11 и готовящаяся к выпуску Ultralytics YOLO26, поддерживают такие задачи, как обнаружение объектов, сегментация экземпляров и оценка позы, а также могут дообучаться под разные сценарии использования. Эти задачи опираются на чёткие визуальные признаки, такие как границы, текстуры, цвета и мелкие структурные детали.
Когда шум скрывает эти признаки, модель получает менее информативные обучающие сигналы, из-за чего ей сложнее изучать точные закономерности. В результате даже небольшое количество шума может снизить производительность в реальных приложениях.
Ранее мы рассмотрели, как самообучение удаляет шум с изображений. В этой статье мы подробнее разберём, как работают методы удаления шума на основе самообучения и как они помогают восстанавливать значимую визуальную информацию. Начнём!
Распространённые типы шума на реальных изображениях#
Прежде чем рассматривать применение самообучения для удаления шума на изображениях, давай сначала вспомним, почему изображения вообще становятся зашумлёнными.
Изображения реальных объектов и сцен редко бывают идеальными. Недостаточное освещение, ограниченное качество сенсора и быстрое движение могут создавать случайные возмущения в отдельных пикселях по всему изображению. Эти искажения на уровне пикселей, известные как шум, снижают общую чёткость и затрудняют распознавание важных деталей.
Когда шум скрывает границы, текстуры и тонкие закономерности, системам компьютерного зрения сложно точно распознавать объекты и интерпретировать сцены. Разные условия создают разные типы шума, каждый из которых по-своему влияет на изображение.

Рис. 1. Пример того, как шум может повысить неопределённость на изображении. (Источник)
Вот некоторые из наиболее распространённых типов шума на изображениях:
- Гауссов шум: Этот тип шума выглядит как мягкая случайная зернистость, вызванная электронными помехами сенсора или тепловыми колебаниями. Он подчиняется гауссову (нормальному) распределению, при котором небольшие вариации значений пикселей размывают мелкие детали и снижают общую резкость.
- Пуассоновский шум: Этот тип шума также называют дробовым шумом; он возникает при слабом освещении или короткой выдержке. Его дисперсия увеличивается вместе с яркостью, но в тёмных областях шум часто заметнее, поскольку захватывается меньше фотонов, что приводит к более низкому отношению сигнал/шум.
- Импульсный шум («соль и перец»): Этот тип шума выглядит как резкие чёрные или белые выбросы значений пикселей. Обычно он вызван ошибками передачи, повреждением битов или неисправными сенсорами камеры и часто приводит к отсутствующим или повреждённым значениям пикселей.
- Спекл-шум: Этот тип шума выглядит как зернистые пятнистые узоры и часто встречается на медицинских, радиолокационных и ультразвуковых изображениях. Он возникает из-за интерференции и рассеяния сигнала, снижает контраст и затрудняет обнаружение границ.
Когда стоит использовать самообучение для удаления шума?#
Так чем же особенно удаление шума на основе самообучения? Оно отлично подходит для ситуаций, когда чистых эталонных изображений просто нет или их слишком сложно получить.
Такое часто бывает при съёмке при слабом освещении, визуализации с высоким ISO, медицинской и научной визуализации или в любой среде, где шум неизбежен, а сбор идеальных эталонных данных нереалистичен. Вместо чистых примеров модель обучается непосредственно на уже имеющихся у тебя зашумлённых изображениях и адаптируется к характерным для твоей камеры или сенсора особенностям шума.
Удаление шума на основе самообучения также отлично подходит, если ты хочешь повысить эффективность последующих задач компьютерного зрения, но твой датасет заполнен непоследовательными или зашумлёнными изображениями. Восстанавливая более чёткие границы, текстуры и структуры, эти методы помогают моделям вроде YOLO надёжнее обнаруживать объекты, выполнять сегментацию и понимать сцены. Иными словами, если ты работаешь с зашумлёнными данными, а чистые обучающие изображения недоступны, удаление шума на основе самообучения часто оказывается наиболее практичным и эффективным решением.
Основные методы, лежащие в основе удаления шума на основе самообучения#
Как мы уже видели, удаление шума на основе самообучения — это подход ИИ на основе глубокого обучения, позволяющий моделям обучаться непосредственно на зашумлённых изображениях без чистых разметок. Он опирается на принципы самообучения, при котором модели формируют собственные обучающие сигналы из самих данных.
Иными словами, модель может обучать себя, используя зашумлённые изображения одновременно как входные данные и источник обучающего сигнала. Сравнивая разные искажённые версии одного изображения или предсказывая замаскированные пиксели, модель учится определять, какие закономерности представляют реальную структуру, а какие являются лишь шумом. Благодаря итеративной оптимизации и распознаванию закономерностей сеть постепенно улучшает способность отличать содержательное изображение от случайных вариаций.

Рис. 2. Исходное изображение и изображение после удаления шума. (Источник)
Это становится возможным благодаря специальным стратегиям обучения, которые помогают модели отделять устойчивую структуру изображения от случайного шума. Далее подробнее рассмотрим основные методы и алгоритмы, упрощающие этот процесс, а также то, как каждый подход помогает моделям восстанавливать более чистые и надёжные изображения.
Методы попарного удаления шума на изображениях#
Многие ранние методы самообучения для удаления шума работали за счёт сравнения двух зашумлённых версий одного изображения. Поскольку шум каждый раз случайно изменяется при захвате или искажении изображения, а реальная структура остаётся неизменной, эти различия можно использовать как обучающий сигнал для модели.
Такие подходы обычно называют методами попарного удаления шума на изображениях, поскольку во время обучения они используют или создают пары зашумлённых изображений. Например, подход Noise2Noise, предложенный Яакко Лехтиненом и его командой, обучает модель на двух независимо зашумлённых изображениях одной сцены. Поскольку между двумя версиями узоры шума различаются, модель учится выделять постоянные детали, представляющие исходное изображение.

Рис. 3. Как работает Noise2Noise (Источник)
Со временем это учит сеть подавлять случайный шум и сохранять реальную структуру, даже если она никогда не видит чистого эталонного изображения. Представь простую ситуацию: ты фотографируешь ночную улицу при слабом освещении дважды.
На каждом изображении одни и те же здания, фонари и тени, но зернистый шум появляется в разных местах. Сравнивая эти две зашумлённые фотографии во время обучения, модель самообучения может научиться различать устойчивые визуальные закономерности и признаки шума, постепенно улучшая способность восстанавливать более чистые изображения.
Методы самообучения для удаления шума на основе слепых зон#
Если попарные методы сравнивают две по-разному искажённые версии одного изображения, то методы слепых зон используют другой подход. Они позволяют модели обучаться на одном зашумлённом изображении, скрывая выбранные пиксели, чтобы сеть не видела их искажённых значений.
Затем модель должна предсказать скрытые пиксели, используя только окружающий контекст. Основная идея заключается в том, что шум случаен, а лежащая в основе изображения структура — нет.
Не позволяя модели копировать зашумлённое значение пикселя, методы слепых зон побуждают её выводить нужное значение на основе устойчивых закономерностей изображения, таких как соседние границы, текстуры или цветовые градиенты. Такие методы, как Noise2Void, представленный Александром Круллом и его командой, и Noise2Self, разработанный Джошуа Бэтсоном и Лоиком Ройером, реализуют этот принцип, маскируя отдельные пиксели или небольшие области и обучая модель восстанавливать их.
Более продвинутые подходы, включая Noise2Same и PN2V, повышают устойчивость, обеспечивая согласованные предсказания для нескольких замаскированных версий или явно моделируя распределение шума для оценки неопределённости. Поскольку этим методам нужно только одно зашумлённое изображение, они особенно полезны в областях, где получение чистых или парных изображений непрактично или невозможно, например при микроскопии, в астрономии, биомедицинской визуализации или при съёмке при слабом освещении.
Методы удаления шума с поддержкой Transformer#
Большинство попарных методов и методов самообучения на основе слепых зон для удаления шума используют сверточные нейронные сети (CNN) или сети удаления шума. CNN хорошо подходят для этих подходов, поскольку сосредоточены на локальных закономерностях, а именно на границах, текстурах и мелких деталях.
Архитектуры вроде U-Net широко применяются, поскольку объединяют мелкодетализированные признаки с многоштабной информацией. Однако CNN работают преимущественно в ограниченных окрестностях, поэтому могут упускать важные взаимосвязи, охватывающие большие области изображения.
Передовые методы удаления шума с поддержкой Transformer были разработаны для устранения этого ограничения. Вместо того чтобы смотреть только на соседние пиксели, предложенный метод использует механизмы внимания, чтобы понять взаимосвязи между разными частями изображения.
Одни модели используют полное глобальное внимание, другие — оконное или иерархическое внимание для снижения вычислительных затрат, но в целом они предназначены для захвата дальних структурных зависимостей, которые сами по себе CNN уловить не могут. Такой более широкий контекст помогает модели восстанавливать повторяющиеся текстуры, гладкие поверхности или крупные объекты, для которых нужна информация со всего изображения.
Другие методы удаления шума с изображений#
Помимо методов самообучения, существуют и другие способы очистки зашумлённых изображений. Традиционные методы, такие как билатеральная фильтрация, вейвлет-удаление шума и нелокальные средние, используют простые математические правила для сглаживания шума с попыткой сохранить важные детали.
Существуют и подходы на основе глубокого обучения, включая модели с учителем, обучаемые на парах чистых и зашумлённых изображений, а также генеративно-состязательные сети (GAN), создающие более резкие и реалистичные результаты. Однако для обучения этим методам обычно требуются изображения более высокого качества.
Пошаговый разбор работы самообучения для удаления шума на изображениях#
Мы только что рассмотрели несколько разных методов, поэтому ты можешь задуматься, работают ли они совершенно по-разному, учитывая, что используют собственные архитектуры. Однако все они следуют схожему конвейеру, который начинается с подготовки данных и заканчивается оценкой модели.
Теперь подробнее рассмотрим пошаговую работу общего процесса удаления шума на изображениях с помощью самообучения.
Шаг 1: Предобработка и нормализация#
Прежде чем модель сможет начать обучение на зашумлённых изображениях, нужно убедиться, что все изображения выглядят согласованно. Реальные фотографии могут сильно различаться.
Некоторые изображения могут быть слишком яркими, другие — слишком тёмными, а на некоторых цвета могут быть немного искажены. Если напрямую подать такие вариации в модель, ей будет сложнее сосредоточиться на изучении характеристик шума.
Для этого каждое изображение проходит нормализацию и базовую предобработку. Это может включать масштабирование значений пикселей до стандартного диапазона, коррекцию вариаций интенсивности, а также кадрирование и изменение размера. Главное, чтобы модель получала чистые данные, которые можно использовать как стабильные и сопоставимые входные данные.
Шаг 2: Формирование обучающего сигнала для самообучения#
После нормализации изображений нужно сформировать обучающий сигнал, позволяющий модели обучаться, ни разу не видя чистого изображения. Методы удаления шума на основе самообучения делают это, не позволяя модели просто копировать полученные зашумлённые значения пикселей.
Вместо этого они создают ситуации, в которых модель должна опираться на окружающий контекст изображения, содержащий устойчивую структуру, а не на непредсказуемый шум. Разные методы делают это немного по-разному, но основная идея остаётся одинаковой.
Одни подходы временно скрывают или маскируют определённые пиксели, чтобы модель выводила их значения по соседним пикселям, а другие создают отдельно искажённую версию того же зашумлённого изображения, чтобы входные и целевые данные содержали независимый шум. В обоих случаях целевое изображение содержит значимую структурную информацию, но не позволяет сети получить исходное зашумлённое значение пикселя, который она должна предсказать.
Поскольку шум изменяется случайным образом, а исходное изображение остаётся согласованным, такая схема естественным образом побуждает модель изучать истинную структуру и игнорировать шум, который меняется от одной версии к другой.
Шаг 3: Обучение удалению шума для восстановления структуры изображения#
После формирования обучающего сигнала модель может начать отделять значимую структуру изображения от шума в процессе обучения. Каждый раз, когда она предсказывает замаскированный или повторно искажённый пиксель, ей приходится опираться на окружающий контекст, а не на зашумлённое значение, которое изначально занимало это место.
За множество итераций или эпох это учит сеть распознавать закономерности, сохраняющиеся по всему изображению, например границы, текстуры и гладкие поверхности. Она также учится игнорировать случайные колебания, характерные для шума.
Например, рассмотрим фотографию при слабом освещении, на которой поверхность выглядит чрезвычайно зернистой. Хотя шум меняется от пикселя к пикселю, исходная поверхность остаётся гладкой. Многократно выводя скрытые пиксели в таких областях, модель постепенно лучше распознаёт устойчивую закономерность под шумом и восстанавливает её более чисто.
В процессе обучения сеть формирует внутреннее представление структуры изображения. Это позволяет модели восстанавливать согласованные детали, даже когда входные данные сильно искажены.
Шаг 4: Валидация и результаты удаления шума#
После того как модель научилась предсказывать скрытые или повторно искажённые пиксели, нужно оценить, насколько хорошо она работает с целыми изображениями. Во время тестирования модель получает полное зашумлённое изображение и создаёт его полностью очищенную версию на основе изученной структуры изображения. Чтобы измерить эффективность этого процесса, результат сравнивают с чистыми эталонными изображениями или стандартными тестовыми датасетами.
Две часто используемые метрики — PSNR (пиковое отношение сигнал/шум), измеряющая близость реконструкции к чистому эталону, и SSIM (индекс структурного сходства), оценивающая, насколько хорошо сохранены важные признаки, такие как границы и текстуры. Более высокие значения обычно указывают на более точное и визуально надёжное удаление шума.
Датасеты изображений для обучения и бенчмаркинга#
Исследования по самообучению для удаления шума, публикуемые, среди прочего, в журналах IEEE и на конференциях CVF, таких как CVPR, ICCV и ECCV, а также широко распространяемые через arXiv, часто используют сочетание синтетических и реальных датасетов для оценки эффективности методов глубокого обучения в контролируемых и практических условиях. С одной стороны, синтетические датасеты начинаются с чистых изображений, к которым добавляется искусственный шум, что упрощает сравнение методов с помощью таких метрик, как PSNR и SSIM.
Вот несколько популярных датасетов, которые часто используют с добавленным синтетическим шумом для бенчмаркинга:
- Kodak24: Этот датасет содержит высококачественные фотографии природных сцен, которые часто используют для визуального сравнения результатов удаления шума.
- DIV2K: Этот датасет изображений высокого разрешения содержит разнообразные детализированные изображения, используемые для оценки точности передачи текстур и общего качества восстановления.
Реальные зашумлённые датасеты, напротив, содержат изображения, непосредственно полученные с сенсоров камер при слабом освещении, высоком ISO или других сложных условиях. Эти датасеты проверяют, способна ли модель обрабатывать сложный негауссовский шум, который трудно достоверно смоделировать.
Вот несколько популярных датасетов с реальным шумом:
- SIDD: Этот датасет содержит пары реальных зашумлённых и чистых изображений, снятых сенсорами смартфонов в различных условиях освещения.
- DND: Он содержит фотографии с высоким ISO, на которых запечатлены реалистичные закономерности шума сенсоров потребительских камер.

Рис. 4. Пример из датасета DND. (Источник)
Факторы, которые следует учитывать при обучении модели самообучения для удаления шума#
Вот несколько факторов и ограничений, которые следует учитывать, если ты собираешься обучать модель самообучения для удаления шума на основе глубокого обучения:
- Согласуй распределение шума: Зашумлённые изображения, используемые для обучения, должны отражать тот же шум, с которым модель столкнётся при реальном использовании; несоответствующий шум приводит к плохой обобщающей способности.
- Обеспечь разнообразие обучающих данных: Ограниченное разнообразие может привести к переобучению или чрезмерному сглаживанию сложных текстур.
- Учитывай ограничения, связанные с типом шума: Методы самообучения хуже справляются со структурированным, коррелированным или неслучайным шумом.
- Тестируй на разных устройствах или сенсорах: Эффективность удаления шума может сильно различаться для разных камер и систем визуализации.
Основные выводы#
Удаление шума на основе самообучения даёт энтузиастам ИИ практичный способ очищать изображения, используя только уже имеющиеся зашумлённые данные. Обучаясь распознавать реальную структуру под шумом, эти методы могут восстанавливать важные визуальные детали. По мере развития технологий удаления шума они, вероятно, сделают широкий спектр задач компьютерного зрения более надёжным в повседневных условиях.
Стань частью нашего растущего сообщества! Загляни в наш репозиторий на GitHub, чтобы узнать больше об ИИ. Если ты хочешь создавать решения для компьютерного зрения, ознакомься с нашими вариантами лицензирования. Узнай о преимуществах компьютерного зрения в розничной торговле и посмотри, как ИИ в производстве меняет отрасль!









