Skip to main content
QUICK REVIEW

[論文レビュー] Magic ELF: Image Deraining Meets Association Learning and Transformer

Kui Jiang, Zhongyuan Wang|arXiv (Cornell University)|Jul 21, 2022
Image Enhancement Techniques被引用数 5
ひとこと要約

本稿では、連関学習を用いて畳み込みニューラルネットワーク(CNN)とトランスフォーマーを統合する軽量な画像雨消去モデル、Magic ELFを提案する。このモデルは、雨筋除去と背景ディテール回復を同時に最適化する。マルチインプットアテンションモジュールとディープワイズ分離畳み込みを導入することで、MPRNetと比較して計算コストが88.4%低減され、パラメータは11.7%にまで削減され、平均PSNRで0.25 dBの向上を達成し、リアルタイム推論を可能にする。

ABSTRACT

Convolutional neural network (CNN) and Transformer have achieved great success in multimedia applications. However, little effort has been made to effectively and efficiently harmonize these two architectures to satisfy image deraining. This paper aims to unify these two architectures to take advantage of their learning merits for image deraining. In particular, the local connectivity and translation equivariance of CNN and the global aggregation ability of self-attention (SA) in Transformer are fully exploited for specific local context and global structure representations. Based on the observation that rain distribution reveals the degradation location and degree, we introduce degradation prior to help background recovery and accordingly present the association refinement deraining scheme. A novel multi-input attention module (MAM) is proposed to associate rain perturbation removal and background recovery. Moreover, we equip our model with effective depth-wise separable convolutions to learn the specific feature representations and trade off computational complexity. Extensive experiments show that our proposed method (dubbed as ELF) outperforms the state-of-the-art approach (MPRNet) by 0.25 dB on average, but only accounts for 11.7\% and 42.1\% of its computational cost and parameters. The source code is available at https://github.com/kuijiang94/Magic-ELF.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNN)が長距離依存関係を捉えきれないこと、およびトランスフォーマーが局所的特徴を学習しにくいことによる画像雨消去の限界を解消すること。
  • CNNとトランスフォーマーのアーキテクチャを統合し、局所的不変性とグローバルアテンションの両方の利点を活かして雨消去性能を向上させること。
  • 計算コストを低減しながらも、画像雨消去および後続タスクにおける性能を維持または向上させること。
  • 雨消去モデルの adversarial 攻撃に対する耐性を高めること。
  • 物体検出などの後続ビジョンタスクにおける雨消去とそのタスクの共同性能を向上させること。

提案手法

  • 雨除去と背景回復を別々のが関連する学習パスに分離する2段階アーキテクチャを提案する。
  • 雨摂動と背景回復ブランチからの特徴を動的に関連付けるためのマルチインプットアテンションモジュール(MAM)を導入する。
  • モデルの複雑さを低減しながらも特徴表現能力を維持するため、ディープワイズ分離畳み込みを採用する。
  • 雨の分布から導出された劣化事前知識を用いて背景回復をガイドし、構造的一致性を向上させる。
  • 雨除去とディテール再構築タスクの相性を高めるために、共同最適化戦略を採用する。
  • 共有表現の最適化を可能にする動的関連学習メカニズムを採用し、エンドツーエンド学習を実現する。

実験結果

リサーチクエスチョン

  • RQ1統合されたCNN-Transformerアーキテクチャは、独立したCNNまたはトランスフォーマー・モデルを上回る性能を発揮できるか?
  • RQ2CNNの局所的不変性とトランスフォーマーのグローバルアテンションを、雨消去タスクに効果的に統合できるか?
  • RQ3雨の分布から導出された劣化事前知識は、背景回復を向上させ、残存アーティファクトを低減できるか?
  • RQ4軽量モデルは、顕著に低い計算コストでSOTA性能を達成できるか?
  • RQ5雨除去とディテール回復の共同学習は、物体検出などの後続タスク性能を向上させられるか?

主な発見

  • ELFはTEST1200データセットで平均33.38 dBのPSNRを達成し、MPRNetを0.25 dB上回りながら、パラメータは11.7%、FLOPsは42.1%にまで削減された。
  • ELF-LWはCOCO350/BDD350で18.43/18.09 dBのPSNRを達成し、PCNetを0.52 dB上回り、計算コストも低く抑えられている(21.53 vs. 28.21 GFLOPs)。
  • YOLOv3を用いた物体検出タスクにおいて、ELFはBDD350で33.85%の精度と62.61%のIoUを達成し、すべてのベースラインを上回った。
  • LMSEおよびLPIPSの指標において、他の雨消去モデルと比較してELFは優れた耐性を示した。
  • 視覚的結果では、ELFは競合手法と比較して、雨の残渣が少なく、より自然な画像とより良好に保たれたテクスチャを生成した。
  • Restormerと比較して推論時間を88.0%短縮し、512×512の画像で125 msを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。