Skip to main content
QUICK REVIEW

[論文レビュー] Event-Based Fusion for Motion Deblurring with Cross-modal Attention

Lei Sun, Christos Sakaridis|arXiv (Cornell University)|Nov 30, 2021
Photoacoustic and Ultrasonic Imaging被引用数 7
ひとこと要約

本稿では、フレームベースとイベントベースのデータを、新規のクロスモーダルアテンション機構を用いて融合するエンドツーエンドの2段階型デブラーであるEFNetを提案する。対称的累積イベント表現と段階間のゲート付き接続を導入することで、合成データ(GoPro)および実世界データ(REBlur)の両方のモーションデブラーのベンチマークで最先端の性能を達成し、従来手法に比べてPSNRを最大2.47dB向上させた。

ABSTRACT

Traditional frame-based cameras inevitably suffer from motion blur due to long exposure times. As a kind of bio-inspired camera, the event camera records the intensity changes in an asynchronous way with high temporal resolution, providing valid image degradation information within the exposure time. In this paper, we rethink the eventbased image deblurring problem and unfold it into an end-to-end two-stage image restoration network. To effectively fuse event and image features, we design an event-image cross-modal attention module applied at multiple levels of our network, which allows to focus on relevant features from the event branch and filter out noise. We also introduce a novel symmetric cumulative event representation specifically for image deblurring as well as an event mask gated connection between the two stages of our network which helps avoid information loss. At the dataset level, to foster event-based motion deblurring and to facilitate evaluation on challenging real-world images, we introduce the Real Event Blur (REBlur) dataset, captured with an event camera in an illumination controlled optical laboratory. Our Event Fusion Network (EFNet) sets the new state of the art in motion deblurring, surpassing both the prior best-performing image-based method and all event-based methods with public implementations on the GoPro dataset (by up to 2.47dB) and on our REBlur dataset, even in extreme blurry conditions. The code and our REBlur dataset will be made publicly available.

研究の動機と目的

  • 極端なまたは実世界のモーションブラーを扱う際、従来の画像のみのデブラー手法の限界を克服すること。
  • 関連するイベント特徴を効果的に統合できる、学習可能なアテンションベースのメカニズムを設計することで、イベントと画像のモダリティ統合を向上させること。
  • 画像のブラー形成の物理モデルに整合する、物理的に根拠のあるイベント表現を考案すること。
  • 制御された条件下で重度のモーションブラーを捉えた、新規の実世界のイベントベースデブラー用ベンチマーク(REBlurデータセット)を構築すること。
  • マルチレベル統合、ゲート付き情報フロー、2段階型ネットワークアーキテクチャを組み合わせることで、優れたデブラー性能を達成すること。

提案手法

  • EFNetは、最初の段階で複数レベルで画像とイベント特徴を統合する新規のイベント-画像クロスモーダルアテンション(EICA)モジュールを用いた、U-Netに類似した2段階型アーキテクチャを採用する。
  • EICAモジュールは、画像のデブラーに寄与するイベント特徴の関連性に基づいて動的に重みを付与する多ヘッドチャネルワイドアテンションを適用し、選択的特徴統合を可能にする。
  • 画像のブラー形成の物理モデルと整合するように設計された、対称的累積イベント表現(SCER)が導入された。
  • イベントマスクゲート付き接続(EMGC)を用いて、最初の段階のエンコーダーおよびデコーダーから2段階目に特徴を選択的に転送し、重要な情報を保持する。
  • ネットワークは、ペアドの曇り画像、シャープな画像、イベントストリームを用いてエンドツーエンドで訓練され、PSNRおよびSSIMを最適化する損失関数が使用される。
  • REBlurデータセットは、高精度のスライドレールと制御された照明を用いて収集され、実世界のモーションブラーを、真値のシャープな画像とイベントストリームとともに提供する。

実験結果

リサーチクエスチョン

  • RQ1イベント特徴と画像特徴の間のクロスモーダルアテンションは、単純な統合戦略に比べて、デブラー性能を顕著に向上させるか?
  • RQ2SCERのような物理的根拠のあるイベント表現は、標準的なイベント蓄積手法に比べて、デブラータスクで優れた性能を示すか?
  • RQ3ゲート付き情報フローを備えた2段階型ネットワークアーキテクチャは、重度に曇った画像の復元にどの程度効果的か?
  • RQ4イベントベースのデブラー手法は、合成データセットにとどまらず、実世界の極端なモーションブラー状況にも一般化可能か?
  • RQ5マルチレベル統合とアテンション機構は、復元画像における微細なディテールやエッジの保持にどのような影響を及ぼすか?

主な発見

  • GoProデータセットにおいて、EFNetは35.46 dBのPSNRを達成し、画像のみの1段階ベースラインに比べて6.4 dBの向上を示した。
  • REBlurデータセットでは、すべての従来のイベントベースおよび画像ベースの手法を上回り、極端なブラー状況下でも頑健であることを示した。
  • EICA統合モジュールは、要素ごとの加算、乗算、または連結に比べて、PSNRを0.6 dB以上向上させた。
  • SCER表現は35.46 dBのPSNRを達成し、SBT(35.12 dB)および「スタック」表現(31.90 dB)を上回り、その有効性を実証した。
  • EMGCモジュールは、段階間での文脈に配慮した情報転送を可能にすることで、PSNRに0.15 dBの向上をもたらした。
  • アブレーションスタディにより、マルチレベル統合と2段階型設計が不可欠であることが確認され、完全なモデルはベースラインに比べてSSIMが3.6%向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。