Skip to main content
QUICK REVIEW

[論文レビュー] Cascaded Generation of High-quality Color Visible Face Images from Thermal Captures

Naser Damer, Fadi Boutros|arXiv (Cornell University)|Oct 21, 2019
Face recognition and analysis参考文献 21被引用数 10
ひとこと要約

本稿では、大規模なデータセットやデータオーグメンテーション、偏光センサーを必要とせず、高品質なカラー可視顔画像を赤外線画像から生成するための段階的精錬ネットワーク(CRN)と文脈損失を提案する。本手法は、多様なポーズ、遮蔽、照明条件において、最先端の視覚的品質と真値画像との定量的類似性を達成し、2つの最先端手法を上回る結果を得た。

ABSTRACT

Generating visible-like face images from thermal images is essential to perform manual and automatic cross-spectrum face recognition. We successfully propose a solution based on cascaded refinement network that, unlike previous works, produces high quality generated color images without the need for face alignment, large databases, data augmentation, polarimetric sensors, computationally-intense training, or unrealistic restriction on the generated resolution. The training of our solution is based on the contextual loss, making it inherently scale (face area) and rotation invariant. We present generated image samples of unknown individuals under different poses and occlusion conditions.We also prove the high similarity in image quality between ground-truth images and generated ones by comparing seven quality metrics. We compare our results with two state-of-the-art approaches proving the superiority of our proposed approach.

研究の動機と目的

  • クロススペクトル顔認識を目的とした、赤外線入力から高品質なカラー可視顔画像を生成すること。
  • 大規模なデータセット、データオーグメンテーション、偏光センサー、計算コストの高いトレーニングを必要とする従来手法の制限を克服すること。
  • ポーズの変化、遮蔽、低照度などの困難な条件下でも、視覚的に現実的で定量的に正確な可視画像を生成すること。
  • 推論時に顔のアライメントを必要としないスケールおよび回転不変性を確保すること。
  • 視覚的品質および画像忠実度メトリクスの両面で、2つの最先端手法を上回る優れた性能を示すこと。

提案手法

  • 本手法は、低解像度(4×4)から開始し、段階的にターゲット解像度(128×128)にアップスケーリングするマルチスケール精錬モジュールを備えた段階的精錬ネットワーク(CRN)を採用する。
  • 各精錬モジュールは、入力、中間、出力の3層構造から構成され、最小限のパラメータで効率的なマルチスケール特徴抽出を可能にする。
  • トレーニングは、深層特徴表現の類似性を強制する文脈損失によってガイドされ、この手法は本質的にスケールおよび回転不変性を有する。
  • 本アプローチは、画像アライメント、データオーグメンテーション、偏光センサーを必要とせず、大規模または特殊なデータセットへの依存を低減する。
  • モデルは比較的小さなデータセット上でエンドツーエンドにトレーニングされ、文脈損失の不変性を活用して、頑健な性能を達成する。

実験結果

リサーチクエスチョン

  • RQ1大規模かつアライメント済みのトレーニングデータセットやデータオーグメンテーションを必要とせず、赤外線入力から高品質なカラー可視顔画像を生成できるか?
  • RQ2ポーズや遮蔽の変化下において、本手法のCRNと文脈損失は、GANベースの手法と比較して視覚的品質および画像忠実度でどのように差をつけるか?
  • RQ3真値可視画像と比較して、本手法はシャープネス、コントラスト、明るさなどの画像品質メトリクスをどの程度維持するか?
  • RQ4顔のアライメントや監視なしに、未学習の人物、ポーズ、遮蔽状況にも一般化可能か?
  • RQ5文脈損失は、生成画像におけるスケールおよび回転不変性にどのように寄与するか?

主な発見

  • 提案手法は、多様なポーズ、顔の表情、遮蔽タイプ(眼鏡、サングラス、帽子、手による遮蔽など)に対しても、赤外線入力から視覚的に現実的なカラー可視顔画像を生成する。
  • 大規模なアーティファクトはほとんど見られず、特に非正面ポーズでは目の周囲などの細部にわずかな欠損が見られるにとどまる。
  • 7つの画像品質メトリクスを用いた定量的分析により、生成画像と真値画像との類似性が高く確認された。生成画像はわずかにぼやけており明るさがやや高いが、コントラストとGCFがより高い。
  • 文脈損失によりスケールおよび回転不変性が実現され、推論時に画像アライメントを必要とせずに一般化が可能である。
  • 視覚的品質およびメトリクス類似性の両面で、2つの最先端ベースライン(TV-GANとPIX2PIX)を上回り、生成画像の照度対称性が優れていることを示す低いLS値を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。