Skip to main content
QUICK REVIEW

[論文レビュー] Two-Stage Single Image Reflection Removal with Reflection-Aware Guidance

Yu Li, Ming Liu|arXiv (Cornell University)|Dec 2, 2020
Image Enhancement Techniques被引用数 5
ひとこと要約

本稿では、最初に反射層を推定し、その後に反射に敏感なガイド(RAG)モジュールを用いて透過推定を改善する二段階のディーブラーニングフレームワーク、RAGNetを提案する。RAGモジュールは特徴の差分を用いて反射を抑制し、部分畳み込みを用いて線形結合仮説の違反に対応するための自己適応マスクを生成する。この手法により、5つのベンチマークデータセットで最先端の性能を達成した。

ABSTRACT

Removing undesired reflection from an image captured through a glass surface is a very challenging problem with many practical application scenarios. For improving reflection removal, cascaded deep models have been usually adopted to estimate the transmission in a progressive manner. However, most existing methods are still limited in exploiting the result in prior stage for guiding transmission estimation. In this paper, we present a novel two-stage network with reflection-aware guidance (RAGNet) for single image reflection removal (SIRR). To be specific, the reflection layer is firstly estimated due to that it generally is much simpler and is relatively easier to estimate. Reflectionaware guidance (RAG) module is then elaborated for better exploiting the estimated reflection in predicting transmission layer. By incorporating feature maps from the estimated reflection and observation, RAG can be used (i) to mitigate the effect of reflection from the observation, and (ii) to generate mask in partial convolution for mitigating the effect of deviating from linear combination hypothesis. A dedicated mask loss is further presented for reconciling the contributions of encoder and decoder features. Experiments on five commonly used datasets demonstrate the quantitative and qualitative superiority of our RAGNet in comparison to the state-of-the-art SIRR methods. The source code and pre-trained model are available at https://github.com/liyucs/RAGNet.

研究の動機と目的

  • 単一画像の反射除去(SIRR)の不適切な性質に対処するため、二段階のディーブラーニングフレームワークを活用すること。
  • 第一段階で得られた推定反射層を効果的に活用して透過推定を改善すること。
  • 実世界の画像における線形結合仮説(I = T + R)の違反を引き起こす強い反射の影響を軽減すること。
  • エンコーダーとデコーダーの特徴の寄与をバランスさせるために、マスク損失を設計すること。

提案手法

  • ネットワークは最初の段階で、観測値 $I$ から反射層 $\hat{R}$ を専用の段階で推定する。
  • 第二段階では、観測値 $I$ と $\hat{R}$ を用いて透過推定 $\hat{T}$ をガイドする反射に敏感なガイド(RAG)モジュールを用いる。
  • RAGモジュールは特徴の差分 $\mathbf{F}_{\text{diff}} = \mathbf{F}_I - \mathbf{F}_{\hat{R}}$ を計算し、観測値における反射効果を抑制する。
  • 差分特徴用の $\mathbf{M}_{\text{diff}}$ とデコーダー特徴用の $\mathbf{M}_{\text{dec}}$ の2つのマスクを生成し、非線形領域に対応するため部分畳み込みに使用する。
  • エンコーダーとデコーダー特徴の寄与をバランスさせるために、専用のマスク損失 $\mathcal{L}_{\text{mask}}$ を導入する。
  • スキップ接続とマルチスケール特徴統合戦略を用いて、空間的詳細と文脈を保持する。

実験結果

リサーチクエスチョン

  • RQ1最初に反射層を推定することで、SIRRにおける透過推定の正確性と頑健性が向上するか?
  • RQ2線形結合仮説が崩壊する領域において、推定された反射を効果的に活用して透過予測をガイドできるか?
  • RQ3部分畳み込みによる自己適応マスクが、強い反射や非線形反射を伴う画像において性能を向上させられるか?
  • RQ4専用のマスク損失が、ネットワーク内でのエンコーダーとデコーダー特徴の寄与をバランスに与える影響は何か?

主な発見

  • RAGNetは、5つの広く使われているSIRRベンチマークで最先端の性能を達成し、Real 20データセットではPSNRが22.95、SSIMが0.793を記録した。
  • SIR-2-Wildデータセットでは、RAGNetは25.52のPSNRと0.880のSSIMを達成し、比較されたすべての手法を上回った。
  • アブレーションスタディの結果、マスク損失や差分特徴を削除すると性能が著しく低下し、それらの必要性が確認された。
  • チャンネルごとのマスクを用いたバリアント RAGNet ${}_{\mathbf{F}\circ\mathbf{M}^{2c}}$ は、統一マスクバージョンを上回り、SIRRに適していることが示された。
  • ワンステージバージョンのRAGNet I→Tは顕著な性能低下を示し、二段階アーキテクチャの重要性が裏付けられた。
  • 定性的な結果から、RAGNetは、光沢のある表面に強い反射があるような複雑なシーンにおいても、重い反射を効果的に除去でき、競合手法が失敗する領域でも優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。