Skip to main content
QUICK REVIEW

[論文レビュー] Low Resolution Face Recognition Using a Two-Branch Deep Convolutional Neural Network Architecture

Erfan Zangeneh, Mohammad Rahmati|arXiv (Cornell University)|Jun 19, 2017
Advanced Image Processing Techniques被引用数 13
ひとこと要約

本稿では、非線形特徴マッピングとスーパーレゾリューション再構成を共同で学習する2本の分岐を持つ深層畳み込みニューラルネットワーク(DCNN)を、低解像度顔認識に提案する。共通の埋め込み空間における画像間距離を最小化するように、5層のスーパーレゾリューションネットワークと14層の特徴抽出器を併せて学習することで、6×6ピクセルのプローブ画像において、最先端の手法よりも11.4%高い認識精度を達成するとともに、認識に最適化された高品質なHR顔再構成も得られる。

ABSTRACT

We propose a novel couple mappings method for low resolution face recognition using deep convolutional neural networks (DCNNs). The proposed architecture consists of two branches of DCNNs to map the high and low resolution face images into a common space with nonlinear transformations. The branch corresponding to transformation of high resolution images consists of 14 layers and the other branch which maps the low resolution face images to the common space includes a 5-layer super-resolution network connected to a 14-layer network. The distance between the features of corresponding high and low resolution images are backpropagated to train the networks. Our proposed method is evaluated on FERET data set and compared with state-of-the-art competing methods. Our extensive experimental results show that the proposed method significantly improves the recognition performance especially for very low resolution probe face images (11.4% improvement in recognition accuracy). Furthermore, it can reconstruct a high resolution image from its corresponding low resolution probe image which is comparable with state-of-the-art super-resolution methods in terms of visual quality.

研究の動機と目的

  • プローブ画像がしばしば32×24ピクセル未満となる実世界の監視環境における低解像度顔認識の課題に対処すること。
  • 従来の手法が高解像度ギャラリー情報の一部を無視するか、視覚的品質の最適化のみを目的としているという限界を克服すること。
  • 深層学習を用いた非線形な結合マッピングアプローチを開発し、低解像度と高解像度顔特徴を共通の空間に一致させること。
  • 同時に認識精度の向上と、視覚的に魅力的であるだけでなく認識に最適なスーパーレゾリューション顔画像の生成を実現すること。
  • 標準的な深層ネットワーク(例:VGGNet)よりも大幅にメモリを削減したコンactモデルを設計し、リソース制限のあるシステムへのデプロイを可能にすること。

提案手法

  • アーキテクチャは2本のDCNN分岐を採用:14層の高解像度(HR)画像用と、5層のスーパーレゾリューションネットワークと14層の特徴抽出器を統合した低解像度(LR)画像用。
  • 対応するHRとLR顔ペアの埋め込み特徴間のL2距離を最小化するコントラスト損失を用いて、エンド・ツー・エンドでネットワークを学習する。
  • スーパーレゾリューション分岐は、LR入力から高解像度画像を再構成し、共同学習中に重みが更新されることで認識性能の向上に寄与する。
  • 同じIDの特徴が近づくように共有埋め込み空間を採用することで、低解像度条件下での識別性が向上する。
  • 学習プロセスでは、認識損失がスーパーレゾリューションおよび特徴抽出の両コンponentを通じて誤差逆伝播され、再構成が認識目的に一致するように調整される。
  • 複数の設定(バイキュービック補間やスパースコーディングをSRネットワークの代わりに使用)を用いて、FERETデータセット上でモデルを評価した。

実験結果

リサーチクエスチョン

  • RQ1従来の手法と比較して、深層学習に基づく結合マッピングアプローチが、極めて低解像度の顔画像における認識精度を顕著に向上させることができるか?
  • RQ2特徴抽出器とスーパーレゾリューションネットワークを同時に学習させることで、別々に学習するか、標準的なスーパーレゾリューション手法を用いる場合と比較して、より優れた認識性能が得られるか?
  • RQ3提案フレームワークにおいて、再構成された高解像度画像の視覚的品質と認識性能の相関関係はどの程度か?
  • RQ4低解像度顔認識ベンチマークにおいて、提案手法は最先端のスーパーレゾリューションおよび結合マッピング手法と比較して、性能と効率の両面で優れているか?
  • RQ5標準的なハードウェア上で動作可能な、小さなメモリフットプリントを維持しながら、高い認識精度を達成できるか?

主な発見

  • 提案手法は、6×6ピクセルのプローブ画像において、最先端の手法よりも11.4%高い認識精度を達成し、極めて低い解像度に対しても強い耐性を示した。
  • 本手法は、全プローブ画像解像度において、競合手法を上回ったが、特に挑戦的な低解像度領域で最大の向上が見られた。
  • スーパーレゾリューションと特徴抽出ネットワークの共同学習は、分離または事前学習済みのSRコンponentを用いた設定よりも顕著に優れた認識性能をもたらした。
  • 再構成された高解像度顔の視覚的品質は、最先端のスーパーレゾリューション手法と同等水準であったが、PSNRおよびSSIMの指標では上位2つの手法よりわずかに低かった。
  • VGGNetのような標準的な深層ネットワークと比較して、大幅に少ないメモリを要するため、計算リソースが制限されたシステムへのデプロイに適している。
  • テスト画像全体におけるPSNRおよびSSIMのばらつきから、スーパーレゾリューションネットワークが一貫した視覚的強化よりも認識に最適化された再構成を優先していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。