[論文レビュー] Progressive Training of Multi-level Wavelet Residual Networks for Image Denoising
本稿では、画像のノイズ除去のための、段階的訓練を施した多層ウェーブレット残差ネットワーク(PT-MWRN)を提案する。各ウェーブレット分解レベルの後に残差ブロックを統合し、ノイズありおよびクリアなウェーブレットサブバンドを用いたスケール固有の損失を採用する。本手法は、合成および実世界のノイズ除去ベンチマークの両方で、優れたPSNRおよびSSIMを達成しながら、計算効率を維持している。
Recent years have witnessed the great success of deep convolutional neural networks (CNNs) in image denoising. Albeit deeper network and larger model capacity generally benefit performance, it remains a challenging practical issue to train a very deep image denoising network. Using multilevel wavelet-CNN (MWCNN) as an example, we empirically find that the denoising performance cannot be significantly improved by either increasing wavelet decomposition levels or increasing convolution layers within each level. To cope with this issue, this paper presents a multi-level wavelet residual network (MWRN) architecture as well as a progressive training (PTMWRN) scheme to improve image denoising performance. In contrast to MWCNN, our MWRN introduces several residual blocks after each level of discrete wavelet transform (DWT) and before inverse discrete wavelet transform (IDWT). For easing the training difficulty, scale-specific loss is applied to each level of MWRN by requiring the intermediate output to approximate the corresponding wavelet subbands of ground-truth clean image. To ensure the effectiveness of scale-specific loss, we also take the wavelet subbands of noisy image as the input to each scale of the encoder. Furthermore, progressive training scheme is adopted for better learning of MWRN by beigining with training the lowest level of MWRN and progressively training the upper levels to bring more fine details to denoising results. Experiments on both synthetic and real-world noisy images show that our PT-MWRN performs favorably against the state-of-the-art denoising methods in terms both quantitative metrics and visual quality.
研究の動機と目的
- 非常に深い画像ノイズ除去ネットワークの訓練を、その能力増大にもかかわらず可能にするため。
- 深さや幅を増加させた際のMWCNN変種における性能飽和を克服するため。
- 多スケールウェーブレットベースのネットワークにおける訓練安定性および特徴学習を向上させるため。
- 実世界の画像ノイズ除去に適した効率的でスケーラブルなアーキテクチャを開発するため。
提案手法
- MWCNNにおける標準的な畳み込み層を、離散ウェーブレット変換(DWT)後の残差ブロックおよび逆DWT(IDWT)前の残差ブロックに置き換える多層ウェーブレット残差ネットワーク(MWRN)を提案する。
- 各ウェーブレットスケールでの中間出力を、対応するクリアなウェーブレットサブバンドを近似するために、スケール固有の損失関数を導入する。
- 各エンコーダースケールに、ノイズあり画像のウェーブレットサブバンドを追加入力とし、上位レベルからの特徴と追加の畳み込み層を介して統合する。
- 段階的訓練方式を採用:訓練は最低レベルのウェーブレットスケールから開始し、徐々に上位スケールを追加することで詳細回復を精緻化する。
- 多スケールの監視を適用することで、特徴学習を強化し、深層アーキテクチャにおける訓練の難易度を低減する。
- エンドツーエンド訓練とスケール固有の監視を組み合わせることで、収束性および性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1多層ウェーブレットフレームワークにおけるより深い残差ネットワークは、標準的なMWCNNを上回る画像ノイズ除去を実現できるか?
- RQ2クリアおよびノイズあり画像のウェーブレットサブバンドに基づくスケール固有の損失は、訓練安定性および性能を向上させるか?
- RQ3多スケールウェーブレットネットワークの段階的訓練は、特徴学習を向上させ、性能劣化を回避できるか?
- RQ4本手法は、実世界の画像ノイズ除去ベンチマークにおいて、最先端のモデルと比較してどうなるか?
- RQ5本アーキテクチャは、合成および実世界のノイズタイプの両方で、効率的に訓練され、一般化可能か?
主な発見
- DNDベンチマークにおいて、PT-MWRNは39.80 dBのPSNRを達成し、テストされたすべての手法の中で第1位を記録した。
- SIDDベンチマークでは、39.80 dBのPSNRを達成し、モデルアンサンブルやGANベースのデータ拡張を用いていないにもかかわらず、上位手法の中での第3位に位置した。
- モデルは最も計算効率が良く、1枚の256×256画像あたりの推論時間がわずか38.6 msであり、DIDN や DHDN などの重いモデルを上回った。
- 段階的訓練方式により、より深いネットワークの安定した学習が可能となり、標準的な深さ増加MWCNN変種で見られる性能劣化を回避できた。
- ノイズありウェーブレットサブバンド入力を用いたスケール固有の損失は、標準的監視に比べて顕著に性能向上をもたらし、特に多スケール特徴学習において顕著であった。
- 本手法は実世界のノイズに非常に良好に一般化でき、困難な実際のノイズデータセットにおいて、従来の手法およびディープラーニングベースのベースラインを上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。