Skip to main content
QUICK REVIEW

[論文レビュー] A Multiple Source Hourglass Deep Network for Multi-Focus Image Fusion

Fidel A. Guerrero Peña, Pedro D. Marrero Fernández|arXiv (Cornell University)|Aug 28, 2019
Advanced Image Fusion Techniques参考文献 20被引用数 4
ひとこと要約

本稿では、回帰ベースの損失関数を用いて、焦点マップ推定と融合ルールを一括して学習するエンド・ツー・エンド訓練を実施する、複数の入力源を想定したアワークラス深層ネットワークの提案を行う。本手法は、520×520の画像において、既存手法と比較して60倍の高速化を達成し、最先端の性能を発揮するとともに、2つ以上の入力源に対して高い計算効率と一般化性能を示している。

ABSTRACT

Multi-Focus Image Fusion seeks to improve the quality of an acquired burst of images with different focus planes. For solving the task, an activity level measurement and a fusion rule are typically established to select and fuse the most relevant information from the sources. However, the design of this kind of method by hand is really hard and sometimes restricted to solution spaces where the optimal all-in-focus images are not contained. Then, we propose here two fast and straightforward approaches for image fusion based on deep neural networks. Our solution uses a multiple source Hourglass architecture trained in an end-to-end fashion. Models are data-driven and can be easily generalized for other kinds of fusion problems. A segmentation approach is used for recognition of the focus map, while the weighted average rule is used for fusion. We designed a training loss function for our regression-based fusion function, which allows the network to learn both the activity level measurement and the fusion rule. Experimental results show our approach has comparable results to the state-of-the-art methods with a 60X increase of computational efficiency for 520X520 resolution images.

研究の動機と目的

  • マルチフォーカス画像統合における、手作業で設計された活動度測定値や融合ルールの限界を是正すること。
  • 焦点マップ推定と融合戦略を一括して学習するデータ駆動型でエンド・ツー・エンドの深層学習フレームワークの開発。
  • 最先端の統合品質を維持または上回りながら、計算効率を向上させること。
  • 入力源の順序に依存しない可換な統合を実現し、2つ以上の入力源に一般化できること。
  • 医療画像やデジタルフォトグラフィーなどの実用的応用に向け、ニアリアルタイムの統合を可能とすること。

提案手法

  • エンコーダ・デコーダ構造にスカイプ接続を組み合わせた、複数の入力源を想定したアワークラスアーキテクチャを採用し、空間的詳細の保持を図る。
  • 高品質な画像を制御的にぼかして生成した合成マルチフォーカスデータセットを用いて、エンド・ツー・エンドの訓練を実施。
  • 回帰ベースの損失関数により、活動度測定(焦点マップ)と融合ルールの両方を一括して学習可能にしている。
  • 2つのバリエーションを提案:HF-Reg(回帰ベース)とHF-Seg(セグメンテーションベース)、両者とも重み付き平均統合を採用。
  • 100組の画像ペアを用いた合成データセットで学習を実施。最適化にはPyTorchとGPUを用いている。
  • 入力画像サイズや入力源数に依存しないため、2つ以上の入力画像に柔軟に適用可能である。

実験結果

リサーチクエスチョン

  • RQ1手作業で設計されたコンponentsを一切用いずに、深層ニューラルネットワークが焦点マップ推定と融合ルールを同時に学習可能か?
  • RQ2エンド・ツー・エンドのアワークラスアーキテクチャは、従来のパッチベースやシアンプスベースの統合ネットワークと比較して、速度と精度の両面で優れているか?
  • RQ3データ駆動型で回帰ベースのアプローチは、複数の入力源に一般化可能であり、高い性能を維持できるか?
  • RQ4本手法は、既存の最先端のマルチフォーカス画像統合(MFIF)手法と比較して、計算効率に優れているか?
  • RQ5ノイズを含むマルチフォーカス入力に対しても、モデルは効果的に統合でき、クリーンなデータ以外の環境でも頑健性を示せるか?

主な発見

  • 提案されたHF-RegおよびHF-Segネットワークは、合成データおよび実データの両方で、最先端の手法と同等またはそれ以上の性能を達成している。
  • 既存手法と比較して推論時間に60倍の高速化を達成しており、GPU上での520×520画像処理ではわずか0.0023秒で実現している。
  • Lytro 3入力源の実データセットにおいて、HF-Segバージョンが優れた視覚的結果を示し、特に統合過程での誤差蓄積の低減が顕著に見られた。
  • HF-Regモデルはノイズを含む入力に対しても頑健性を示し、ノイズを含むデータで学習した場合でも、フィルタリングされた高品質なすべての焦点が合った画像を生成した。
  • 130×130、260×260、520×520の解像度において、画像サイズや入力源数の変化に対しても一貫した性能を示し、良好な一般化性能を確認した。
  • 制御されたぼかし処理を用いた合成データのトレーニングプロトコルにより、取得コストをかけずに無限に近い高品質なトレーニングサンプルを生成可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。