Skip to main content
QUICK REVIEW

[論文レビュー] Dependency-aware Attention Control for Unconstrained Face Recognition with Image Sets

Xiaofeng Liu, B. V. K. Vijaya Kumar|arXiv (Cornell University)|Jul 5, 2019
Face recognition and analysis参考文献 69被引用数 8
ひとこと要約

本稿では、非制約的顔認識のための無順序画像集合における画像間依存関係をモデル化する、深層強化学習フレームワークである依存関係感知注意制御(DAC)を提案する。アクター・クリティック強化学習を用いたマルコフ決定過程として注意割り当てを定式化することで、文脈的関係に基づいて画像の重みを動的に制御し、余分な監督なしにYTFおよびCelebrity-1000ベンチマークで最先端手法を上回る精度を達成する。

ABSTRACT

This paper targets the problem of image set-based face verification and identification. Unlike traditional single media (an image or video) setting, we encounter a set of heterogeneous contents containing orderless images and videos. The importance of each image is usually considered either equal or based on their independent quality assessment. How to model the relationship of orderless images within a set remains a challenge. We address this problem by formulating it as a Markov Decision Process (MDP) in the latent space. Specifically, we first present a dependency-aware attention control (DAC) network, which resorts to actor-critic reinforcement learning for sequential attention decision of each image embedding to fully exploit the rich correlation cues among the unordered images. Moreover, we introduce its sample-efficient variant with off-policy experience replay to speed up the learning process. The pose-guided representation scheme can further boost the performance at the extremes of the pose variation.

研究の動機と目的

  • 従来の方法が画像の重要性を等価または独立と仮定するのに対し、顔認識における無順序かつ多様な画像集合における画像間関係をモデル化する課題に対処する。
  • 個々の画像の品質に基づいて重みを割り当てる従来の手法の限界を克服し、重複を生じさせたり、多様で低品質だが情報量の多い視点を失うのを防ぐ。
  • 集合内依存関係と集合間関係の両方を活用する汎用的な注意メカニズムを開発し、非制約的顔認証および識別における耐性を向上させる。
  • 追加のアノテーションや複雑なデータパイプラインを必要とせず、集合レベルのアイデンティティ監督のみでエンドツーエンドの学習を可能にする。
  • ポーズガイドド表現方式とオフポリシー経験リプレイを用いて、計算効率と情報活用のバランスを図る。

提案手法

  • 各画像を状態依存の行動選択で逐次処理する潜在空間におけるマルコフ決定過程(MDP)として、画像集合の注意割り当て問題を定式化する。
  • アクター・クリティック深層強化学習を用いて、以前に処理された画像の文脈に基づき各画像の注意重みを決定する方策を学習するDACネットワークを設計する。
  • 訓練の高速化とデータ効率の向上を図るため、オフポリシー経験リプレイを用いた効率的なサンプリング手法を導入したDACの変種を提案する。
  • ポーズガイドド表現(PGR)方式を導入し、確率的ルーティングを組み合わせることで、集合間依存関係をモデル化し、ポーズ変動に対する耐性を高める。
  • 画像の特徴抽出と注意制御の両方を、集合レベルのアイデンティティラベルのみで一括最適化可能なエンドツーエンドの学習を実現する。
  • 訓練中に密集した監視信号を提供するため、報酬ネットワークを用いて、集合レベル表現をコン pact かつ判別性の高いものに促進する。

実験結果

リサーチクエスチョン

  • RQ1強化学習は、顔認識のための無順序画像集合における画像間依存関係を効果的にモデル化するために適用可能か?
  • RQ2画像同士の文脈的関係に基づいて注意重みを学習することは、独立または品質に基づく重み割り当て方式よりも性能を向上させるか?
  • RQ3深層アクター・クリティックフレームワークは、画像レベルのアノテーションを一切必要とせず、集合レベルの監督のみでエンドツーエンドに学習可能か?
  • RQ4YTFおよびIJB-Aのような困難なベンチマークにおいて、提案手法DACは最先端手法と比較して、精度および耐性面で優れているか?
  • RQ5ポーズガイドド表現方式は、極端なポーズ変動下でも性能をどの程度向上させるか?

主な発見

  • YTFデータセットにおいて、DACは微調整を行わずとも95.97% ± 0.0041の検証精度を達成し、FaceNet や NAN といった最先端手法を上回る。
  • Celebrity-1000データセットでは、クローズドセット識別でランク1精度91.37%、オープンセット識別で82.64%を達成し、NAN や MTJSR を含むすべてのベースラインを上回る。
  • オフポリシー経験リプレイを用いたDAC(off)バージョンは、DAC(on)よりもわずかに高い性能を示しており、サンプル効率および訓練安定性の向上を裏付けている。
  • アブレーションスタディの結果、DACは類似した低品質な画像の重みを低下させることで、冗長性を効果的に低減するとともに、プロファイルなど情報量の多い視点を保持していることが確認された。
  • ポーズガイドド表現方式は、極端なポーズ変動下での性能を顕著に向上させ、現実世界の困難な状況下での有効性を示している。
  • 本手法は複数のデータセットにわたって良好な一般化性能を示し、高度なCNNアーキテクチャとも容易に統合可能であるため、顔認識を越えた幅広い応用可能性が示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。