Skip to main content
QUICK REVIEW

[論文レビュー] AdaDM: Enabling Normalization for Image Super-Resolution

Jie Liu, Jie Tang|arXiv (Cornell University)|Nov 27, 2021
Advanced Image Processing Techniques参考文献 39被引用数 7
ひとこと要約

本稿では、バッチ正規化(BN)が画素の変動を減少させ、エッジをぼかす傾向を相殺するために特徴の標準偏差を適応的に増幅することで、画像超解像(SR)ネットワークにおけるBNの使用を可能にする、新しいAdaptive Deviation Modulator(AdaDM)を提案する。AdaDMを用いることで、EDSR*、RDN*、NLSN*といった最先端のSRモデルが顕著なPSNR向上(例:Urban100 ×4で+0.15–0.30 dB)を達成する一方で、BNの訓練安定性と一般化性能の利点も活用できる。

ABSTRACT

Normalization like Batch Normalization (BN) is a milestone technique to normalize the distributions of intermediate layers in deep learning, enabling faster training and better generalization accuracy. However, in fidelity image Super-Resolution (SR), it is believed that normalization layers get rid of range flexibility by normalizing the features and they are simply removed from modern SR networks. In this paper, we study this phenomenon quantitatively and qualitatively. We found that the standard deviation of the residual feature shrinks a lot after normalization layers, which causes the performance degradation in SR networks. Standard deviation reflects the amount of variation of pixel values. When the variation becomes smaller, the edges will become less discriminative for the network to resolve. To address this problem, we propose an Adaptive Deviation Modulator (AdaDM), in which a modulation factor is adaptively predicted to amplify the pixel deviation. For better generalization performance, we apply BN in state-of-the-art SR networks with the proposed AdaDM. Meanwhile, the deviation amplification strategy in AdaDM makes the edge information in the feature more distinguishable. As a consequence, SR networks with BN and our AdaDM can get substantial performance improvements on benchmark datasets. Extensive experiments have been conducted to show the effectiveness of our method.

研究の動機と目的

  • バッチ正規化(BN)が他のビジョンタスクでは有益であるのに対し、画像超解像ネットワークでは性能を低下させる理由を調査すること。
  • BNが特徴の標準偏差を減少させることでエッジの識別性が低下し、再構成がぼやけるという問題に対処すること。
  • BNの訓練利点を維持しつつ、有用な画素変動を回復するメカニズムを開発すること。
  • 特に高精細な設定において、性能損ないなしに深層SRネットワークでBNを使用可能にすること。
  • BN + AdaDMが複数の最先端SRアーキテクチャで一般化性能と性能を向上させることを実証すること。

提案手法

  • BNの後に残差特徴の標準偏差を増幅するスケーリング係数を予測する、学習可能なモodulationモジュールAdaDMを提案する。
  • EDSR、RDN、NLSNの残差ブロックのBN層の後にAdaDMを統合し、EDSR*、RDN*、NLSN*を構築する。
  • AdaDMで特徴マップの標準偏差を適応的にスケーリングするための学習可能なアフィン変換を用いることで、エッジ情報の保持を図る。
  • 標準的な最適化プロトコルを用いてモデルを訓練し、BNによる収束の高速化と一般化性能の向上を活用する。
  • 特に困難なベンチマークで性能をさらに向上させるために、自己アンサンブル推論を適用する。
  • DIV2KおよびDF2Kデータセットで訓練・評価を行い、堅牢性とスケーラビリティを評価する。

実験結果

リサーチクエスチョン

  • RQ1他のビジョンタスクでは有益であるにもかかわらず、なぜバッチ正規化は画像超解像ネットワークの性能を低下させるのか?
  • RQ2BNは残差特徴の標準偏差にどのように影響を与え、エッジ再構成にどのような影響を及えるのか?
  • RQ3正規化を除去せずに、BNが特徴変動に与える悪影響を逆転できるか?
  • RQ4学習可能なモodulation機構により、BNの訓練利点を維持しながらも、識別性の高いエッジ特徴を回復できるか?
  • RQ5提案されたAdaDMにより、深層かつ高精細なSRネットワークでBNが性能向上に寄与できるか?

主な発見

  • BNとAdaDMを備えたEDSR*は、Urban100 ×4で33.83 dBのPSNRを達成し、元のEDSRよりも+0.30 dBの向上を示した。
  • AdaDMを備えたRDN*およびNLSN*は、すべてのベンチマークで一貫したPSNR向上を示し、NLSN*は自己アンサンブルを用いてSet5 ×2で38.50/0.9624のPSNR/SSIMを達成した。
  • DF2Kデータセットで学習したNLSN*は、Set5 ×3で35.04/0.9322のPSNR/SSIMを達成し、元のNLSNを上回り、SwinIRの性能と同等となった。
  • AdaDMにより、BNが入力RGBレンジの変動に対して頑健となり、EDSR*は異なる入力分布に対しても一貫した性能を維持した。
  • 視覚的結果では、AdaDMが特に髪や生地のような複雑な領域でエッジのシャープネスとテクスチャの詳細を顕著に向上させた。
  • 変換器ベースのモデルSwinIR+は、NLSN*+と同等の性能を達成した。これは、AdaDMがCNNベースのモデルが最先端の変換器モデルと同等の性能を達成可能にすることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。