Skip to main content
QUICK REVIEW

[論文レビュー] CRFormer: A Cross-Region Transformer for Shadow Removal

Jin Wan, Yin Hui|arXiv (Cornell University)|Jul 4, 2022
Advanced Image Processing Techniques被引用数 8
ひとこと要約

CRFormer は、パッチ化を伴わずに、非影領域から影領域へ文脈特徴を転送する一方向で領域に敏感なクロスアテンションを活用する、影除去のための新しいクロスリージョントランスフォーマーを提案する。ハイブリッド CNN-Transformer アーキテクチャに二重エンコーダーと洗練されたデコーダーを統合することで、CRFormer は ISTD、AISTD、SRD、および Video Shadow Removal データセットで最先端の性能を達成し、RMSE を最大で 17.1 減少させ、SSIM を 0.854 まで向上させた。

ABSTRACT

Aiming to restore the original intensity of shadow regions in an image and make them compatible with the remaining non-shadow regions without a trace, shadow removal is a very challenging problem that benefits many downstream image/video-related tasks. Recently, transformers have shown their strong capability in various applications by capturing global pixel interactions and this capability is highly desirable in shadow removal. However, applying transformers to promote shadow removal is non-trivial for the following two reasons: 1) The patchify operation is not suitable for shadow removal due to irregular shadow shapes; 2) shadow removal only needs one-way interaction from the non-shadow region to the shadow region instead of the common two-way interactions among all pixels in the image. In this paper, we propose a novel cross-region transformer, namely CRFormer, for shadow removal which differs from existing transformers by only considering the pixel interactions from the non-shadow region to the shadow region without splitting images into patches. This is achieved by a carefully designed region-aware cross-attention operation that can aggregate the recovered shadow region features conditioned on the non-shadow region features. Extensive experiments on ISTD, AISTD, SRD, and Video Shadow Removal datasets demonstrate the superiority of our method compared to other state-of-the-art methods.

研究の動機と目的

  • 画像および動画における影除去の課題に対処すること。影は視覚的品質を低下させ、後続タスクに悪影響を及げる。
  • 長距離依存関係をモデル化する際の CNN の限界と、パッチベースのトランスフォーマーが不規則な影の形状を処理する際の制限を克服すること。
  • 非影領域から影領域へ文脈的情報を効果的に転送する一方向アテンションメカニズムを設計し、損傷を受けてしまった影特徴による干渉を回避すること。
  • パッチ化を回避することで高精細な影除去を実現し、微細なディテールを保持するとともに、色の歪みを最小限に抑えること。
  • 動的影を含む動画シーケンスを含む多様なデータセットにわたる汎用性とロバストネスを示すこと。

提案手法

  • 非影画像とその影マスクから非対称な特徴を抽出する二重エンコーダーを用いたハイブリッド CNN-Transformer フレームワークを提案する。
  • コア的イノベーションは、非影特徴に条件づけられ、非影領域から影領域へのみアテンションを計算する領域に敏感なクロスアテンション機構である。
  • トランスフォーマー層内のクロスリージョンアライメントブロックは、非影領域全体からの文脈的手がかりを用いて、繰り返し影特徴を精緻化する。
  • 1 つの CNN ベースのデコーダーが統合特徴から復元画像を再構築し、その後、軽量な U 字型 RefineNet による後処理が行われる。
  • 構造的および意味的整合性を保つために、L1 損失と知覚的損失の組み合わせを用いて、エンドツーエンドでモデルを訓練する。
  • パッチ化を回避することで、フル解像度画像の直接処理が可能となり、不規則な影境界の処理がより効果的になる。

実験結果

リサーチクエスチョン

  • RQ1非影領域から影領域への一方向アテンション機構は、標準的な双方向自己アテンションを上回る性能を示せるか?
  • RQ2パッチ化を回避することで、不規則な影形状を有する画像における性能が向上するか?
  • RQ3損傷を受けてしまった影特徴から生じるノイズを導入せずに、非影領域全体からの文脈的情報を効果的に活用できるか?
  • RQ4提案された領域に敏感なクロスアテンションは、通常の自己アテンションと比較して、影除去の質とロバストネスにおいて優れているか?
  • RQ5モデルは、複雑な影動的特性を有する動画シーケンスを含む多様なデータセットにどの程度汎用的に適応できるか?

主な発見

  • CRFormer は Video Shadow Removal データセットで RMSE 17.1 を達成し、すべての先行最先端手法を上回った。
  • Video Shadow Removal データセットにおいて SSIM が 0.854 まで向上し、優れた知覚的品質と構造的保存性を示した。
  • 領域に敏感なクロスアテンション機構により、通常のアテンションと比較して RMSE が 7.7% 減少し、影領域の回復が著しく向上した。
  • 2 つのクロスリージョンアライメントブロックを用いることで最適な性能が得られ、それ以上に増加させると効果が薄れ、FLOPs も増加する傾向にあった。
  • CRFormer は未観測の動画データに対しても強く汎用性を示し、VSR ベンチマークで教師ありおよび教師なしベースラインを上回った。
  • 定性的な結果では、色の歪みが低減され、特に複雑な影領域でアーチファクトが減少しており、図 4 の赤枠で確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。