Skip to main content
QUICK REVIEW

[論文レビュー] Recurrent Embedding Aggregation Network for Video Face Recognition

Sixue Gong, Yichun Shi|arXiv (Cornell University)|Apr 26, 2019
Face recognition and analysis参考文献 49被引用数 16
ひとこと要約

本論文は、LSTMによるコンテキストに配慮したアテンションを用いて事前学習済みの深層顔埋め込みを集約する、動画顔認識のための再帰的埋め込み集約ネットワーク(REAN)を提案する。ノイズの多いフレームに対して高い耐性を示し、IJB-S、YTF、PaSCデータセットにおいてCNN-LSTMや品質に配慮した集約手法を上回る性能を発揮する。特徴の識別性を効果的に保持しながらノイズを抑制する。

ABSTRACT

Recurrent networks have been successful in analyzing temporal data and have been widely used for video analysis. However, for video face recognition, where the base CNNs trained on large-scale data already provide discriminative features, using Long Short-Term Memory (LSTM), a popular recurrent network, for feature learning could lead to overfitting and degrade the performance instead. We propose a Recurrent Embedding Aggregation Network (REAN) for set to set face recognition. Compared with LSTM, REAN is robust against overfitting because it only learns how to aggregate the pre-trained embeddings rather than learning representations from scratch. Compared with quality-aware aggregation methods, REAN can take advantage of the context information to circumvent the noise introduced by redundant video frames. Empirical results on three public domain video face recognition datasets, IJB-S, YTF, and PaSC show that the proposed REAN significantly outperforms naive CNN-LSTM structure and quality-aware aggregation methods.

研究の動機と目的

  • 監視映像におけるノイズが多く、品質が低い動画フレームの課題に対処すること。
  • 深層特徴を再学習せずに、動画シーケンス内の時間的コンテキストを活用して認識精度を向上させること。
  • 品質評価とコンテキスト認識を統合した、より優れた特徴表現を実現する耐障害性の高い集約メカニズムを開発すること。
  • 平均プーリングや品質に配慮したモデルを含む、従来の集約手法を、標準的な動画顔認識ベンチマークで上回ること。

提案手法

  • REANは、特徴抽出器のエンドツーエンド学習を避けるために、事前学習済みのCNNを用いて各動画フレームから深層顔埋め込みを抽出する。
  • LSTMネットワークが埋め込みの系列を処理し、時間的依存性に注目してコンテキストに配慮した表現を学習する。
  • LSTMは、動画コンテキスト内での関連性と品質に基づいて、埋め込みを動的に重みづけるアテンション重みを生成する。
  • 最終的なビデオレベルの表現は、LSTMから得られるアテンションスコアを用いた重み付き集約によって形成され、コンactで識別性の高いベクトルが得られる。
  • 品質に配慮したアテンションをLSTMフレームワークに統合し、情報量の多いフレームを優先し、ノイズや低品質なフレームを抑制する。
  • 静止画(例:IJB-S)の場合は、品質予測が高品質な画像では信頼性が低いため、REANではなく平均プーリングが用いられる。

実験結果

リサーチクエスチョン

  • RQ1再帰的ネットワークを用いて、事前学習済み顔埋め込みをノイズの多い動画フレームに対して耐性を持つ方法で集約できるか?
  • RQ2埋め込み集約にコンテキストに配慮したアテンションを組み込むことで、品質のみまたは平均プーリング手法よりも優れた性能が得られるか?
  • RQ3REANは、監視映像や制約のない動画データを含む多様な動画顔認識ベンチマークに効果的に一般化できるか?
  • RQ4静止画および動画マッチングタスクにおいて、エンドツーエンドのLSTMベースモデルと比較して、REANは過学習の度合いと性能の両面で優れているか?

主な発見

  • IJB-Sの監視映像から監視映像へのプロトコルにおいて、REANはベースラインLSTM比でランク5で15.24%の向上を示し、ノイズの多い動画フレームに対する強い耐性を示した。
  • マルチビューの監視映像から予約データへのプロトコルでは、REANは1% FPIRにおけるオープンセット認識性能を5.45%向上させ、クロスドメインマッチングの有効性を示した。
  • YTFデータセットでは、REANは96.60%の認証精度を達成し、C-FAN(96.50%)や他の最先端手法を上回ったが、YTFは比較的高いフレーム品質を有する。
  • PaSCでは、ハンドヘルドシナリオにおけるFAR=0.01での認証率が96.52%に達し、ベースライン手法を上回り、最先端性能に近づいた。
  • REANは、YTFで60.00%の精度にまで低下する(過学習による)単純なLSTMベースラインを著しく上回った。
  • REANが生成するアテンションスコアは、文脈的情報を活用して識別性の高いフレームを効果的に特定し、ノイズを抑制しながら顔の重要な特徴を保持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。