Skip to main content
QUICK REVIEW

[論文レビュー] Recurrent Regression for Face Recognition

Li Yang, Wenming Zheng|arXiv (Cornell University)|Jul 24, 2016
Face recognition and analysis参考文献 22被引用数 5
ひとこと要約

本論文は、順序付き画像変換をモデル化することで、統合的クロスポーズおよび動画ベースの顔認識を実現する再帰的回帰ニューラルネットワーク(RRNN)を提案する。再帰的エンコーディング・デコーディングとポーズ順序の監視を活用することで、RRNNはポーズ間で特徴を適応的に記憶・忘却し、YTCで86.6%、MultiPIEで95.2%の最先端性能を達成する。

ABSTRACT

To address the sequential changes of images including poses, in this paper we propose a recurrent regression neural network(RRNN) framework to unify two classic tasks of cross-pose face recognition on still images and video-based face recognition. To imitate the changes of images, we explicitly construct the potential dependencies of sequential images so as to regularize the final learning model. By performing progressive transforms for sequentially adjacent images, RRNN can adaptively memorize and forget the information that benefits for the final classification. For face recognition of still images, given any one image with any one pose, we recurrently predict the images with its sequential poses to expect to capture some useful information of others poses. For video-based face recognition, the recurrent regression takes one entire sequence rather than one image as its input. We verify RRNN in static face dataset MultiPIE and face video dataset YouTube Celebrities(YTC). The comprehensive experimental results demonstrate the effectiveness of the proposed RRNN method.

研究の動機と目的

  • 静止画像および動画シーケンスにおけるポーズ変動の課題に対処すること。
  • 2つの古典的顔認識タスクであるクロスポーズ認識と動画ベース認識を、統一されたフレームワークで統合すること。
  • 画像シーケンス内の順序依存性をモデル化することで、学習プロセスの正則化を図り、ポーズおよび外見の変動に対する耐性を向上させること。
  • 画像シーケンスの再帰的変換を通じて時間的ダイナミクスを明示的に符号化することで、認識精度を向上させること。
  • 複雑なポーズおよび外見の変動を伴う非制約的データセットにおいて、有効性を実証すること。

提案手法

  • 再帰的エンコーダ・デコーダアーキテクチャを用いて、順序付き画像変換をモデル化する再帰的回帰ニューラルネットワーク(RRNN)を提案する。
  • 既知のポーズシーケンスに基づいて予測された画像シーケンスの一貫性を保証するため、シーケンス再構成損失を用いる。
  • 再構成された画像のシーケンス全体にわたり構造的整合性を維持するためのグローバル正則化項を統合する。
  • 動画ベース認識の分類性能を向上させるために、判別的ラベル予測損失を組み込む。
  • 再構成、グローバル整合性、分類損失の3つを組み合わせた共同目的関数により、モデルをエンドツーエンドで訓練する。
  • 既知のポーズ順序に基づいて、1枚の入力画像から順序付きポーズを予測することで、同じフレームワークを静止画像にも適用する。

実験結果

リサーチクエスチョン

  • RQ1統合的なディープラーニングフレームワークは、静止画像のクロスポーズ顔認識および動画ベース顔認識の両方を効果的に処理できるか?
  • RQ2順序付き画像変換をモデル化することで、ポーズおよび外見の変動に対する耐性がどのように向上するか?
  • RQ3再帰的メモリ機構が、認識性能の向上に寄与するポーズ間依存性をどのように捉えているか?
  • RQ4目的関数の異なる構成要素(再構成、グローバル正則化、分類)が最終的な性能に与える影響は何か?
  • RQ5提案手法は、複雑なポーズ変動を示すベンチマークデータセットにおいて、既存の最先端手法を上回る性能を発揮するか?

主な発見

  • RRNNはYouTube セレブリティ(YTC)データセットで86.6%の平均正答率を達成し、先行する最先端手法を最大7.2ポイントも上回った。
  • MultiPIEデータセットでは、クロスポーズ顔認識で95.2%の正答率を達成し、ポーズ変動に強い一般化性能を示した。
  • アブレーションスタディの結果、シーケンス再構成損失とラベル予測損失の両方を含めることで性能が向上し、両方を有効にした際が最も良い結果を示した。
  • 驚くべきことに、フロントアルファ($0^\circ$)の顔をギャラリーとして使用した場合、非フロントアルファのポーズよりも正答率が低かった。これは、誤差伝搬および非フロントアルファビューに豊富な輪郭情報が存在するためと考察された。
  • モデルの再帰的構造により、特徴の効果的な記憶と忘却が可能となり、ポーズ間での外見変動に対する耐性が向上した。
  • 本手法は、MMDML、SSDML、DFRVといった部分空間ベースおよびメトリックベースのアプローチを、両方のデータセットで一貫して上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。