ノイズ除去のための自己教師あり学習:手順ごとの解説
ノイズ除去のための自己教師あり学習の仕組み、画像にノイズが生じる理由、鮮明な視覚的ディテールを復元するための主要な手法と手順をご紹介します。

カメラは、私たちが見ているとおりに常に世界を捉えるとは限りません。暗所で撮影したポートレートや、動きの速い車の写真は、粒状感があったり、ぼやけたり、歪んだりすることがあります。
センサーの速度が遅いことや暗い環境、動きによって、エッジを弱めたり重要な詳細を隠したりする微細なノイズの斑点が生じることがあります。この鮮明さが失われると、多くの高度なAIおよび機械学習システムは、画像に何が含まれているかを理解するのに苦労します。これは、多くの高性能なシステムが適切に動作するために、こうした細かなディテールに依存しているためです。
たとえば、コンピュータービジョンは、機械が画像や動画を解釈できるようにする人工知能の一分野です。しかし、正確に処理するには、ビジョンAIモデルが学習に利用できる、クリーンで高品質な視覚データを必要とします。
具体的には、Ultralytics YOLO11や近日公開予定のUltralytics YOLO26などのモデルは、物体検出、インスタンスセグメンテーション、ポーズ推定などのタスクをサポートし、さまざまなユースケース向けにカスタムトレーニングできます。これらのタスクは、エッジ、テクスチャ、色、細かな構造的ディテールなど、鮮明な視覚的手がかりに依存します。
ノイズによってこれらの特徴が不明瞭になると、モデルが受け取る学習シグナルが弱くなり、正確なパターンを学習することが難しくなります。その結果、わずかなノイズでも実際のアプリケーションにおける性能が低下する可能性があります。
以前、自己教師あり学習による画像のノイズ除去について解説しました。この記事では、自己教師ありノイズ除去の手法がどのように機能し、有意義な視覚情報の復元にどのように役立つのかを詳しく見ていきます。それでは始めましょう。
実世界の画像における一般的なノイズの種類#
自己教師あり学習が画像のノイズ除去にどのように利用されるかを説明する前に、そもそもなぜ画像にノイズが生じるのかをまず振り返りましょう。
実世界の物体やシーンの画像が完全であることはほとんどありません。暗い照明、限られたセンサー品質、速い動きによって、画像全体の個々のピクセルにランダムな乱れが生じることがあります。ノイズとして知られるこのピクセルレベルの乱れは、全体的な鮮明さを低下させ、重要なディテールを見えにくくします。
ノイズによってエッジ、テクスチャ、微妙なパターンが隠れると、コンピュータービジョンシステムは物体を認識したり、シーンを正確に解釈したりすることが難しくなります。異なる条件によって異なる種類のノイズが発生し、それぞれが独自の形で画像に影響を与えます。

図1. ノイズによって画像の不確実性が増大する仕組みの例。(出典)
画像で見られる代表的なノイズには、次のようなものがあります。
- ガウシアンノイズ: 電子センサーの干渉や熱揺らぎによって生じる、柔らかくランダムな粒状感として現れるノイズです。ガウス(正規)分布に従い、ピクセルの小さな変動によって細部がぼやけ、全体的な鮮明度が低下します。
- ポアソンノイズ: ショットノイズとも呼ばれ、暗所や短い露光時間で発生するノイズです。明るさに応じて分散が増加しますが、撮捉される光子数が少なく信号対雑音比が低くなるため、暗い領域でより目立つことがよくあります。
- 塩胡椒ノイズ: 鋭い黒または白のピクセルスパイクとして現れるノイズです。通常は伝送エラー、ビット破損、故障したカメラセンサーによって発生し、ピクセル値の欠落や破損につながることがよくあります。
- スペックルノイズ: 粒状で斑点状のパターンとして現れ、医療画像、レーダー画像、超音波画像でよく見られるノイズです。信号の干渉や散乱によって生じ、コントラストを低下させ、エッジを検出しにくくします。
自己教師ありノイズ除去はいつ使用すべきですか?#
では、自己教師ありノイズ除去が特別なのはなぜでしょうか。クリーンな正解画像が存在しない、または撮影が非常に難しい状況で、その真価を発揮します。
これは、暗所撮影、高ISO画像、医療・科学画像、あるいはノイズが避けられず完全な参照データの収集が現実的でない環境でよく起こります。クリーンな例を必要とする代わりに、モデルはすでに手元にあるノイズの多い画像から直接学習するため、カメラやセンサー固有のノイズパターンに適応できます。
データセットにばらつきのある画像やノイズの多い画像が含まれていて、下流のコンピュータービジョンタスクの性能を高めたい場合にも、自己教師ありノイズ除去は有効な選択肢です。より鮮明なエッジ、テクスチャ、構造を復元することで、これらの手法はYOLOなどのモデルがシーンをより確実に検出、セグメント化、理解できるようにします。つまり、ノイズの多いデータを扱っていてクリーンな学習画像を利用できない場合、自己教師ありノイズ除去は多くの場合、最も実用的で効果的なソリューションとなります。
自己教師ありノイズ除去を支える主要な手法#
これまで見てきたように、自己教師ありノイズ除去は、クリーンなラベルに依存せず、ノイズの多い画像から直接モデルを学習させる深層学習ベースのAIアプローチです。これは、自己教師あり学習の原則に基づいており、モデル自体がデータから学習シグナルを生成します。
言い換えると、モデルはノイズの多い画像を入力と学習シグナルの両方として利用し、自ら学習できます。同じ画像の異なる破損バージョンを比較したり、マスクされたピクセルを予測したりすることで、モデルはどのパターンが実際の構造を表し、どれが単なるノイズなのかを学習します。反復的な最適化とパターン認識を通じて、ネットワークは有意義な画像内容とランダムな変動を区別する能力を徐々に向上させます。

図2. 元画像とノイズ除去後の画像。(出典)
これは、安定した画像構造とランダムなノイズを分離するようモデルを導く、特定の学習戦略によって可能になります。次に、このプロセスを効率化する主要な手法とアルゴリズム、それぞれのアプローチがモデルによるよりクリーンで信頼性の高い画像の再構成にどのように役立つかを詳しく見ていきましょう。
ペアワイズ画像ノイズ除去手法#
初期の自己教師ありノイズ除去手法の多くは、同じ画像の2つのノイズ付きバージョンを比較することで機能していました。画像が撮影または破損されるたびにノイズはランダムに変化しますが、実際の構造は変わらないため、こうした違いをモデルの学習シグナルとして利用できます。
これらのアプローチは、学習中にノイズ付き画像のペアを使用または生成するため、一般にペアワイズ画像ノイズ除去手法と呼ばれます。たとえば、Noise2Noiseアプローチ(Jaakko Lehtinen氏とチームが提案)は、同じシーンを独立にノイズ付けした2枚の画像を使ってモデルを学習させます。2つのバージョンではノイズパターンが異なるため、モデルは実際の基礎画像を表す一貫したディテールを識別することを学習します。

図3. Noise2Noiseの仕組み(出典)
時間の経過とともに、これによってネットワークはクリーンな参照画像を一度も見ることなく、ランダムなノイズを抑制し、実際の構造を保持できるようになります。夜間の暗い通りを2枚撮影するという、簡単なシナリオを考えてみましょう。
各画像には同じ建物、照明、影が含まれていますが、粒状のノイズは異なる場所に現れます。学習中にこの2枚のノイズ付き写真を比較することで、自己教師ありモデルはどの視覚パターンが安定していて、どれがノイズによるものかを学習し、よりクリーンな画像を再構成する能力を最終的に向上させます。
ノイズ除去のためのブラインドスポットベースの自己教師あり学習手法#
ペアワイズ手法が同じ画像の異なる破損バージョンを比較するのに対し、ブラインドスポット手法は異なるアプローチを取ります。選択したピクセルを隠してネットワークがその破損した値を見られないようにすることで、1枚のノイズ付き画像からモデルを学習させます。
その後、モデルは周囲のコンテキストだけを使って隠されたピクセルを予測する必要があります。核心となる考え方は、ノイズはランダムですが、画像の基礎構造はランダムではないということです。
モデルがピクセルのノイズ付きの値をコピーできないようにすることで、ブラインドスポット手法は、近傍のエッジ、テクスチャ、色の勾配など、安定した画像パターンに基づいてそのピクセルがどうあるべきかを推測するよう促します。Noise2Void(Alexander Krull氏とチームが導入)やNoise2Self(Joshua Batson氏とLoïc Royer氏が開発)などの手法は、個々のピクセルまたは小さな近傍領域をマスクし、それらを再構成するようモデルを学習させることで、この原則を実装します。
Noise2SameやPN2Vなどのより高度なアプローチは、複数のマスクバージョン間で一貫した予測を強制したり、ノイズ分布を明示的にモデル化して不確実性を推定したりすることで、堅牢性を高めます。これらの手法は1枚のノイズ付き画像だけを必要とするため、顕微鏡画像、天文学、生物医学画像、暗所撮影など、クリーンな画像やペア画像の撮影が現実的でない、または不可能な分野で特に有用です。
Transformerを活用したノイズ除去手法#
ペアワイズおよびブラインドスポットによる自己教師ありノイズ除去手法の多くは、畳み込みニューラルネットワーク(CNNs)またはノイズ除去ネットワークに依存しています。CNNsはエッジ、テクスチャ、小さなディテールといった局所パターンに焦点を当てるため、これらのアプローチに適しています。
U-Netなどのアーキテクチャは、細粒度の特徴とマルチスケール情報を組み合わせるため、広く使用されています。しかし、CNNsは主に限られた近傍内で動作するため、画像のより広い領域にまたがる重要な関係を見落とす可能性があります。
この制限に対処するため、Transformerを活用した最先端のノイズ除去手法が導入されました。提案手法は近傍のピクセルだけを見るのではなく、アテンション機構を使って画像の異なる部分同士がどのように関連しているかを理解します。
完全なグローバルアテンションを使うモデルもあれば、計算量を削減するためにウィンドウベースまたは階層型アテンションを使うモデルもありますが、一般に、CNNsだけでは捉えられない長距離の構造を捉えるよう設計されています。この広い視野により、画像全体からの情報を必要とする反復テクスチャ、滑らかな表面、大きな物体をモデルが復元しやすくなります。
その他の画像ノイズ除去手法#
自己教師あり手法以外にも、ノイズの多い画像をきれいにする方法はいくつかあります。バイラテラルフィルタリング、ウェーブレットノイズ除去、非局所平均法などの従来手法は、重要なディテールを保持しながらノイズを平滑化するために、単純な数学的ルールを使用します。
一方、深層学習ベースのアプローチも存在します。これには、クリーン画像とノイズ付き画像のペアから学習する教師ありモデルや、より鮮明で現実的な結果を生成する敵対的生成ネットワーク(GANs)が含まれます。ただし、これらの手法では通常、学習により高品質な画像が必要です。
自己教師あり画像ノイズ除去の仕組みをステップごとに解説#
ここまで複数の異なる手法を見てきたため、それぞれが独自のアーキテクチャを使用していることから、完全に異なる仕組みで動作するのではないかと考えるかもしれません。しかし、いずれもデータ準備から始まり、モデル評価で終わる、同様のパイプラインに従います。
次に、自己教師ありノイズ除去の画像処理プロセス全体が、ステップごとにどのように進むのかを詳しく見ていきましょう。
ステップ1:前処理と正規化#
モデルがノイズ付き画像から学習を開始する前に、まずすべての画像が一貫した見た目になるようにします。実際の写真には大きなばらつきがあります。
明るすぎる画像もあれば、暗すぎる画像もあり、色が少しずれている画像もあります。こうしたばらつきをそのままモデルに入力すると、ノイズの特徴を学習することに集中しにくくなります。
これに対処するため、各画像に正規化と基本的な前処理を施します。これには、ピクセル値を標準範囲にスケーリングする処理、輝度のばらつきの補正、クロップやリサイズなどが含まれます。重要なのは、モデルが安定して比較可能な入力として利用できる、整ったデータを受け取ることです。
ステップ2:自己教師あり学習シグナルの作成#
画像の正規化が完了したら、次に、クリーンな画像を一度も見なくてもモデルが学習できるトレーニングシグナルを作成します。自己教師ありノイズ除去手法では、モデルが受け取ったノイズ付きピクセル値を単純にコピーできないようにすることで、これを実現します。
その代わり、予測不可能なノイズではなく、安定した構造を含む画像周辺のコンテキストにモデルが依存しなければならない状況を作り出します。手法によって実現方法は少し異なりますが、基本的な考え方は同じです。
モデルが近傍のピクセルから推測する必要があるように特定のピクセルを一時的に隠したりマスクしたりするアプローチもあれば、同じノイズ付き画像に別途破損処理を施し、入力とターゲットに独立したノイズを含めるアプローチもあります。どちらの場合も、ターゲット画像は意味のある構造情報を持ちながら、ネットワークが予測すべきピクセルの元のノイズ付き値にアクセスできないようにします。
ノイズはランダムに変化する一方で基礎となる画像は一貫しているため、この設定によってモデルは本来の構造を学習し、バージョンごとに変化するノイズを無視するよう自然に促されます。
ステップ3:ノイズ除去を学習して画像構造を復元#
学習シグナルが整うと、モデルはモデル学習を通じて意味のある画像構造とノイズを分離する方法を学習し始めます。マスクされたピクセルや再度破損させたピクセルを予測するたびに、元々その場所にあったノイズ付きの値ではなく、周囲のコンテキストに依存する必要があります。
多くの反復やエポックを重ねることで、ネットワークはエッジ、テクスチャ、滑らかな表面など、画像全体で安定しているパターンを認識するようになります。また、ノイズを特徴付けるランダムな変動を無視することも学習します。
たとえば、表面が非常に粒状に見える暗所写真を考えてみましょう。ノイズはピクセルごとに異なりますが、基礎となる表面は滑らかなままです。このような領域で隠されたピクセルを繰り返し推測することで、モデルはノイズの下にある安定したパターンを特定し、よりきれいに再構成する能力を徐々に高めます。
モデル学習のプロセスを通じて、ネットワークは画像構造の内部表現を学習します。これにより、入力が大きく破損している場合でも、一貫性のあるディテールを復元できます。
ステップ4:検証とノイズ低減結果#
モデルが隠されたピクセルや再度破損させたピクセルを予測できるようになったら、最後に、完全な画像に対する性能を評価します。テスト中、モデルはノイズの多い画像全体を受け取り、画像構造について学習した内容に基づいて、ノイズ除去済みの完全な画像を生成します。このプロセスの有効性を測定するため、出力をクリーンな参照画像または標準ベンチマークデータセットと比較します。
一般的に使用される指標は2つあります。PSNR(PSNR)は、再構成画像がクリーンな正解画像にどれだけ近いかを測定します。SSIM(SSIM)は、エッジやテクスチャなどの重要な特徴がどの程度保持されているかを評価します。通常、スコアが高いほど、より正確で視覚的にも信頼性の高いノイズ除去を示します。
学習とベンチマークに使用される画像データセット#
IEEEのジャーナルやCVFのカンファレンス(CVPR、ICCV、ECCVなど)で発表され、arXivでも広く公開されている自己教師ありノイズ除去研究では、制御された条件と実用的な条件の両方における深層学習手法のモデル性能を評価するため、合成データセットと実世界のデータセットを組み合わせて使用することがよくあります。一方、合成データセットはクリーンな画像から始めて人工的なノイズを加えるため、PSNRやSSIMなどの指標を使って手法を容易に比較できます。
ベンチマーク用に合成ノイズを追加してよく使用される代表的なデータセットを紹介します。
- Kodak24: 視覚的なノイズ除去結果の比較によく使われる、高品質な自然シーンの写真を提供するデータセットです。
- DIV2K: テクスチャの忠実度と全体的な復元品質の評価に使用される、多様で詳細な高解像度画像を含むデータセットです。
一方、実世界のノイズ付きデータセットには、暗所、高ISO、その他の厳しい条件下でカメラセンサーから直接撮影された画像が含まれます。これらのデータセットは、容易にシミュレートできない複雑な非ガウスノイズをモデルが処理できるかを検証します。
代表的な実世界のノイズ付きデータセットを紹介します。
- SIDD: さまざまな照明環境でスマートフォンのセンサーを使って撮影された、実際のノイズ付き画像とクリーン画像のペアを提供するデータセットです。
- DND: 民生用カメラに見られる現実的なセンサーノイズパターンを捉えた高ISO写真を含みます。

図4. DNDデータセットの例。(出典)
自己教師ありノイズ除去モデルの学習時に考慮すべき要因#
深層学習ベースの自己教師ありノイズ除去モデルを学習する場合は、次の要因と制限事項を考慮してください。
- ノイズ分布を一致させる: 学習に使用するノイズ付き画像は、モデルが実際の利用時に遭遇するノイズを反映している必要があります。ノイズが一致していないと、汎化性能が低下します。
- 学習データの多様性を確保する: ばらつきが限られていると、複雑なテクスチャで過学習や過度な平滑化が生じる可能性があります。
- ノイズの種類による制限を把握する: 自己教師あり手法は、構造化されたノイズ、相関ノイズ、ランダムでないノイズへの対応でより苦労します。
- デバイスやセンサーをまたいでテストする: ノイズ除去性能は、カメラや撮像システムによって大きく異なる可能性があります。
主なポイント#
自己教師ありノイズ除去は、すでに手元にあるノイズの多いデータだけを使って画像をきれいにする、実用的な方法をAI愛好家に提供します。ノイズの下にある実際の構造を認識するよう学習することで、これらの手法は重要な視覚的ディテールを復元できます。ノイズ除去技術が進歩し続けるにつれて、日常的な環境における幅広いコンピュータービジョンタスクの信頼性が高まることが期待されます。
成長を続けるコミュニティにぜひご参加ください。GitHubリポジトリでAIについてさらに学びましょう。コンピュータービジョンソリューションの構築をお考えの場合は、ライセンスオプションをご確認ください。小売業におけるコンピュータービジョンのメリットを探り、製造業におけるAIがどのような変化をもたらしているかをご覧ください。









