Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Sensor Fusion In Single Thermal image Super-Resolution

Feras Almasri, Olivier Debeir|arXiv (Cornell University)|Dec 21, 2018
Advanced Image Processing Techniques参考文献 19被引用数 8
ひとこと要約

本稿では、残差ネットワークを用いた深層学習フレームワークを提案し、高分解能の可視(RGB)画像と低分解能の赤外画像を統合することで、単一の赤外画像に対する超解像を実現する。視覚的品質と高周波数ディテールの回復が著しく向上し、新規ベンチマークデータセットを用いた定量的指標および人間の知覚評価において、最先端のモデルを上回る性能を発揮する。

ABSTRACT

With the fast growth in the visual surveillance and security sectors, thermal infrared images have become increasingly necessary ina large variety of industrial applications. This is true even though IR sensors are still more expensive than their RGB counterpart having the same resolution. In this paper, we propose a deep learning solution to enhance the thermal image resolution. The following results are given:(I) Introduction of a multimodal, visual-thermal fusion model that ad-dresses thermal image super-resolution, via integrating high-frequency information from the visual image. (II) Investigation of different net-work architecture schemes in the literature, their up-sampling methods,learning procedures, and their optimization functions by showing their beneficial contribution to the super-resolution problem. (III) A bench-mark ULB17-VT dataset that contains thermal images and their visual images counterpart is presented. (IV) Presentation of a qualitative evaluation of a large test set with 58 samples and 22 raters which shows that our proposed model performs better against state-of-the-arts.

研究の動機と目的

  • 高価な高分解能赤外センサが不可避な監視および産業用途における低分解能赤外画像の課題に対処する。
  • MSE損失関数に依存する従来の超解像手法が高周波数ディテールを回復できないという限界を克服する。
  • マルチモーダルセンサ統合により、高分解能可視画像を活用して低分解能赤外画像に欠落している高周波数コンテンツを補完する。
  • 超解像手法の評価と比較を支援するため、新規ベンチマークデータセット(ULB17-VT)を構築する。
  • PSNR/SSIMを上回る視覚的品質を実現するため、大規模な定性的評価スタディを通じて人間の知覚を統合する。

提案手法

  • 低分解能赤外画像と高分解能可視画像を入力とし、深層残差ネットワークを用いた超解像のためのマルチモーダル統合フレームワークを提案する。
  • 低周波数コンテンツの保持と高周波数ディテールの強化の両立のため、コンテンツ損失(MSE)と adversarial 損失の組み合わせを用いる。
  • 構造的類似性と視覚的忠実度の向上のため、事前学習済みの VGG ネットワークからの知覚的損失を統合する。
  • 訓練の安定化と特徴表現の向上のため、残差学習スキームを実装する。
  • 視覚的および赤外特徴を効果的に統合するため、共有およびモality特化の畳み込み層を備えた二重ブランチアーキテクチャを設計する。
  • 視覚的類似度を基準に、22名の評価者と58件のテストサンプルを用いた大規模な定性的評価を実施し、投票システムを用いてモデル出力の順位付けを実施する。

実験結果

リサーチクエスチョン

  • RQ1高分解能可視画像は、低分解能赤外画像の超解像に効果的に利用可能か?
  • RQ2可視および赤外データのマルチモーダル統合は、単一モーダルアプローチと比較して、高周波数ディテールの回復をどの程度向上させるか?
  • RQ3知覚的損失および adversarial 損失は、従来の PSNR/SSIM 指標を上回る視覚的品質をどの程度向上させるか?
  • RQ4人間の視覚的知覚および定量的指標の観点から、提案手法は最先端の手法と比較してどの程度優れているか?
  • RQ5異なるネットワークアーキテクチャおよび損失関数は、赤外超解像性能にどのような影響を及えるか?

主な発見

  • 提案された VTSRCNN および VTSRGAN モデルは、ULB17-VT ベンチマークでそれぞれ 51.727 dB の PSNR と 0.9434 の SSIM を達成し、すべての最先端手法を上回る性能を示した。
  • 22名の評価者と58枚のテスト画像を用いた定性的評価において、VTSRCNN は全投票の39%を獲得し、VTSRGAN は17%を獲得し、統合モデルに対する強い人間の好みが示された。
  • 図8の色分けされた投票フローダイアグラムは、マルチモーダル統合モデルが単一モーダルまたは非統合モデルよりも一貫して高い順位に位置していることを確認した。
  • adversarial 損失および知覚的損失の使用により、視覚的品質が著しく向上し、MSEオンリーベースラインと比較してぼやけを低減し、テクスチャディテールを強化した。
  • ULB17-VT ベンチマークは、ペアドされた可視および赤外画像を備えた標準化されたデータセットを提供し、今後の手法の信頼性ある評価と比較を可能にする。
  • センサの不整合や物体の位置ずれに起因する再構成画像のアーティファクトが観察されたため、実運用環境におけるより良い同期化の必要性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。