Skip to main content
QUICK REVIEW

[論文レビュー] WaveFuse: A Unified Deep Framework for Image Fusion with Discrete Wavelet Transform

Shaolei Liu, Manning Wang|arXiv (Cornell University)|Jul 28, 2020
Advanced Image Fusion Techniques参考文献 28被引用数 7
ひとこと要約

WaveFuseは、エンコーダ・デコーダネットワークの特徴マップとマルチスケール離散ウェーブレット変換(DWT)を統合する、画像融合のための画期的な教師なし深層学習フレームワークを提案する。深層特徴に適応的なDWTベースの統合ルールを適用することで、詳細と構造の保持が向上し、トレーニングデータと計算コストを著しく削減しながら、複数の画像統合ベンチマークで最先端の性能を達成する。

ABSTRACT

We propose an unsupervised image fusion architecture for multiple application scenarios based on the combination of multi-scale discrete wavelet transform through regional energy and deep learning. To our best knowledge, this is the first time the conventional image fusion method has been combined with deep learning. The useful information of feature maps can be utilized adequately through multi-scale discrete wavelet transform in our proposed method.Compared with other state-of-the-art fusion method, the proposed algorithm exhibits better fusion performance in both subjective and objective evaluation. Moreover, it's worth mentioning that comparable fusion performance trained in COCO dataset can be obtained by training with a much smaller dataset with only hundreds of images chosen randomly from COCO. Hence, the training time is shortened substantially, leading to the improvement of the model's performance both in practicality and training efficiency.

研究の動機と目的

  • 従来の変換ドメイン手法と学習された特徴を効果的に統合する、統合的で教師なしのマルチシーン画像統合用深層学習フレームワークの開発。
  • 特徴の単純な重み付き平均化に依存し、大規模データセットが必要な従来の深層学習ベースの統合手法の限界を克服すること。
  • マルチスケール離散ウェーブレット変換を活用して、深層特徴マップ内の構造的およびテクスチャ的情報をより効果的に抽出することで、統合性能を向上させること。
  • 最小限のトレーニングデータで高品質な統合結果を達成できることを実証すること。これにより、トレーニング時間と計算オーバーヘッドが低減する。

提案手法

  • 入力元画像から階層的深層特徴を抽出するために、エンコーダ・デコーダネットワークが使用される。
  • 抽出された特徴マップは、マルチスケール離散ウェーブレット変換(DWT)を用いてウェーブレット領域に変換され、低周波数成分(構造的)と高周波数成分(テクスチャ的)に分離される。
  • 領域エネルギーに基づく適応的統合ルールを、低周波数および高周波数サブバンドごとに独立して適用し、顕著なディテールとエッジを保持する。
  • 逆DWTを用いて統合された特徴マップを再構成し、空間的整合性を回復させた後、最終的な統合画像にデコードされる。
  • 全フレームワークは、ペairedの真値統合画像を必要としないエンド・ツー・エンドの教師なし学習で訓練される。
  • 本手法はウェーブレット分解レベルやウェーブレット基底の変動に対して頑健であり、2層とdb1基底で最適な性能が得られる。

実験結果

リサーチクエスチョン

  • RQ1従来の離散ウェーブレット変換(DWT)を深層特徴マップと統合することで、標準的な深層学習統合手法と比較して画像統合性能が向上するか?
  • RQ2DWTベースの統合モジュールは、深層特徴における構造的およびテクスチャ的ディテールの表現をどの程度向上させるか?
  • RQ3提案されたフレームワークは、大規模データセットではなく、小さなデータサブセット(例:COCOの0.5%)でトレーニングされた場合、同等または優れた性能を達成できるか?
  • RQ4本フレームワークにおいて、異なるウェーブレット分解レベルとウェーブレット基底は、最終的な統合品質にどのように影響を与えるか?

主な発見

  • WaveFuseは、複数の画像統合ベンチマークで最先端の性能を達成し、マルチフォーカスおよび赤外線・可視光統合タスクにおいて10の評価指標のうち7つ(EN、CE、FMI_pixel、FMI_dct、Q^NICE、Q^AB/F、MS-SSIM)で第1位を獲得した。
  • マルチフォーカス画像統合において、WaveFuseはFMI_pixel、FMI_dct、FMI_w、Q^NICE、Q^AB/Fで最高スコアを記録し、EN、CE、VARI、MS-SSIMでは2位を獲得した。
  • 赤外線および可視光画像統合において、WaveFuseはFMI_dct、FMI_w、Q^NICE、Q^AB/Fで最高値を記録し、EN、FMI_pixel、VARIでは2位を獲得した。
  • COCOデータセットのわずか0.5%(約100枚)のミニセットでトレーニングされたモデルが、フルデータセットでトレーニングされたモデルと同等の統合性能を達成した。トレーニング時間は7.78時間から1時間未塔に短縮された。
  • ミニセットでのトレーニング中、GPUメモリ使用量は4085 MBにとどまり、フルデータセットトレーニング(17345 MB)と比較して著しく低い計算コストを示した。
  • アブレーションスタディにより、DWTベースの統合モジュールが性能向上に顕著に寄与することが確認され、最適な設定は2層の分解とdb1ウェーブレット基底であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。