Skip to main content
QUICK REVIEW

[論文レビュー] Wavelet Integrated CNNs for Noise-Robust Image Classification

Qiufu Li, Linlin Shen|arXiv (Cornell University)|May 7, 2020
Image and Signal Denoising Methods参考文献 40被引用数 11
ひとこと要約

この論文では、従来のダウンサンプリング操作(マックスプーリング、ストライド付き畳み込み)を離散ウェーブレット変換(DWT)に置き換えることで、ノイズ耐性と精度を向上させるウェーブレット統合型CNNアーキテクチャ「WaveCNets」を提案する。特徴マップを低周波成分(構造を保持)と高周波成分(ノイズを含む)に分解し、推論時に後者を破棄することで、物体の整合性を維持し、ImageNetおよびノイズありImageNet-Cベンチマークにおいて、ベーシックモデルよりも優れた性能を達成する。

ABSTRACT

Convolutional Neural Networks (CNNs) are generally prone to noise interruptions, i.e., small image noise can cause drastic changes in the output. To suppress the noise effect to the final predication, we enhance CNNs by replacing max-pooling, strided-convolution, and average-pooling with Discrete Wavelet Transform (DWT). We present general DWT and Inverse DWT (IDWT) layers applicable to various wavelets like Haar, Daubechies, and Cohen, etc., and design wavelet integrated CNNs (WaveCNets) using these layers for image classification. In WaveCNets, feature maps are decomposed into the low-frequency and high-frequency components during the down-sampling. The low-frequency component stores main information including the basic object structures, which is transmitted into the subsequent layers to extract robust high-level features. The high-frequency components, containing most of the data noise, are dropped during inference to improve the noise-robustness of the WaveCNets. Our experimental results on ImageNet and ImageNet-C (the noisy version of ImageNet) show that WaveCNets, the wavelet integrated versions of VGG, ResNets, and DenseNet, achieve higher accuracy and better noise-robustness than their vanilla versions.

研究の動機と目的

  • 小さな入力ノイズに対して脆弱であるCNNの問題を解決すること。
  • 特徴抽出能力を損なわせることなく、深層ネットワークのノイズ耐性を向上させること。
  • さまざまなウェーブレットに対応できる汎用的なDWT/IDWTレイヤーを設計し、エンドツーエンド学習に適したものとする。
  • ウェーブレットベースのダウンサンプリングをVGG、ResNet、DenseNetなどの主流のCNNアーキテクチャに統合すること。
  • ノイズありおよびクリーンな状態の両方で、画像分類およびセマンティックセグメンテーションタスクにおける手法の評価を行うこと。

提案手法

  • マックスプーリングおよびストライド付き畳み込みの代わりに、離散ウェーブレット変換(DWT)を用いてダウンサンプリングを行い、特徴マップを低周波成分(ll)と高周波成分(lh, hl, hh)に分解する。
  • PyTorchに複数のウェーブレット(例:ハール、ダービーチェス、コイフェット)をサポートする汎用的なDWT/IDWTレイヤーを設計し、深層ネットワークへの柔軟な統合を可能にする。
  • 推論時に高周波成分を破棄することでノイズを抑制し、低周波成分を保持することで耐ノイズ性の高い特徴学習を実現する。
  • VGG、ResNet、DenseNetなどの既存アーキテクチャにDWT/IDWTレイヤーを統合し、エンドツーエンド微分可能であるWaveCNetsを構築する。
  • セグメンテーションタスクのデコーダパスで逆離散ウェーブレット変換(IDWT)を用いて高周波成分を回復させ、解像度回復を向上させる。
  • ImageNetおよびImageNet-CでWaveCNetsを訓練・評価し、WaveUNetsを用いてSegNetへの応用を拡張する。

実験結果

リサーチクエスチョン

  • RQ1従来のダウンサンプリングをDWTに置き換えることで、CNNのノイズ耐性が向上するか?
  • RQ2推論時に低周波成分のみを保持することで、ノイズあり条件下での分類精度が向上するか?
  • RQ3汎用的なDWT/IDWTレイヤーをさまざまなCNNアーキテクチャにエンドツーエンド学習可能に統合できるか?
  • RQ4マックスプーリングと比較して、ウェーブレットベースのダウンサンプリングは特徴保持およびノイズ抑制の観点で優れているか?
  • RQ5DWT/IDWTフレームワークは、セマンティックセグメンテーションのような画像対画像変換タスクにおいて性能向上をもたらすか?

主な発見

  • VGG、ResNet、DenseNetに基づくWaveCNetsは、ImageNetでより高いトップ-1精度(例:WResNet34で74.35%)を達成し、それらのベーシックモデルを上回る。
  • ノイズありImageNet-Cベンチマークでは、WaveCNetsが顕著なノイズ耐性を示し、WResNet34は平均クラス誤差(mCE)72.73%を達成し、標準ResNetsを上回った。
  • WaveUNetsでハールウェーブレットを用いることで、CamVidデータセットで最高のmIoU(64.23%)を達成し、標準SegNet(60.10%)を上回った。
  • WaveUNetsは、木の枝や電柱などの細かいオブジェクトの詳細を効果的に回復させ、アノテーションノイズの修正においてもSegNetを上回った。
  • DWT/IDWTレイヤーは分類タスクにとどまらず、セグメンテーションにも有効であり、エンコーダデコーダネットワークにおける汎用性を示した。
  • 高周波成分を連結するWResNet18_Cは、WResNet18およびWResNet34よりも性能が悪く、ノイズの伝搬が原因であると確認され、高周波成分の破棄による利点が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。