Skip to main content
QUICK REVIEW

[論文レビュー] PAM: Pose Attention Module for Pose-Invariant Face Recognition

En-Jung Tsai, Wei‐Chang Yeh|arXiv (Cornell University)|Nov 23, 2021
Face recognition and analysis参考文献 36被引用数 4
ひとこと要約

本稿では、ソフトゲート機構を用いて階層的特徴空間において正面顔と側顔の間の残差特徴変換を学習することにより、ポーズ不変性を実現する軽量なアテンションブロック、Pose Attention Module (PAM) を提案する。PAM は、先行手法と比較してメモリ要件を75倍以上削減しながら、複数のベンチマークで最先端の性能を達成している。

ABSTRACT

Pose variation is one of the key challenges in face recognition. Conventional techniques mainly focus on face frontalization or face augmentation in image space. However, transforming face images in image space is not guaranteed to preserve the lossless identity features of the original image. Moreover, these methods suffer from more computational costs and memory requirements due to the additional models. We argue that it is more desirable to perform feature transformation in hierarchical feature space rather than image space, which can take advantage of different feature levels and benefit from joint learning with representation learning. To this end, we propose a lightweight and easy-to-implement attention block, named Pose Attention Module (PAM), for pose-invariant face recognition. Specifically, PAM performs frontal-profile feature transformation in hierarchical feature space by learning residuals between pose variations with a soft gate mechanism. We validated the effectiveness of PAM block design through extensive ablation studies and verified the performance on several popular benchmarks, including LFW, CFP-FP, AgeDB-30, CPLFW, and CALFW. Experimental results show that our method not only outperforms state-of-the-art methods but also effectively reduces memory requirements by more than 75 times. It is noteworthy that our method is not limited to face recognition with large pose variations. By adjusting the soft gate mechanism of PAM to a specific coefficient, such semantic attention block can easily extend to address other intra-class imbalance problems in face recognition, including large variations in age, illumination, expression, etc.

研究の動機と目的

  • 深層顔認識におけるポーズ変動の課題に取り組むこと。これは、トレーニングデータにおけるクラス内不均衡が原因で性能が著しく低下するためである。
  • 顔認識のための画像空間変換手法に起因する限界を克服すること。これらの手法は顔のアイデンティティ特徴を保持できず、計算コストも増加する。
  • 画像空間や最終埋め込み空間ではなく、階層的特徴空間において効果的な特徴変換を実行する軽量でモジュラーなアテンションブロックを開発すること。
  • 多段階特徴を活用することで、表現学習と連携した学習を可能にし、ポーズ変動に対してより強い耐性を発揮すること。
  • 提案されたモジュールの適用範囲をポーズ変動にとどまらず、年齢、照明、表情などの他のクラス内変動に対しても拡張できること。

提案手法

  • PAM は、2つの連続するサブモジュールから構成される軽量なアテンションブロックである:Depthwise Residual Module (DRM) と Channel Attention Module (CAM)。
  • DRM は、ソフトゲート機構を用いて、正面顔と側顔の特徴の間の残差を学習する。深度可分畳み込みを用いることで、特徴変換を適応的に制御する。
  • CAM は DRM の出力後に特徴チャネルを再重み付けし、ポーズ変動に応じた判別性の高い特徴の表現を強化する。
  • このモジュールは、深層顔認識モデルの複数の特徴レベルに統合され、階層的特徴変換を可能にする。
  • DRM に内蔵されたソフトゲート機構により、パラメータ効率の良い方法で、ポーズ変動間で共通の近似特徴変換を学習できる。
  • PAM は、既存の顔認識アーキテクチャに簡単に組み込み可能であり、最小限のアーキテクチャ変更で実装可能である。

実験結果

リサーチクエスチョン

  • RQ1階層的特徴空間における特徴変換は、画像空間や最終埋め込み空間における変換よりも、ポーズ不変性顔認識において優れた性能を発揮するか?
  • RQ2軽量なアテンションブロックは、顔のアイデンティティ情報を保持しつつ、正面顔と側顔の特徴の間の残差変換を効果的に学習できるか?
  • RQ3提案された PAM モジュールは、性能を損なわずに、従来のポーズ不変性手法と比較してメモリと計算コストを削減できるか?
  • RQ4PAM に内蔵されたソフトゲート機構は、年齢、照明、表情などの他のクラス内変動に対しても一般化可能か?
  • RQ5LFW や CPLFW などの困難なベンチマークにおいて、PAM は ArcFace や DREAM といった最先端手法と比較して、精度と効率の面で優れているか?

主な発見

  • PAM は LFW、CFP-FP、AgeDB-30、CPLFW、CALFW で最先端の性能を達成し、LFW では 99.82%、CPLFW では 92.80% の精度を記録した。
  • 50層の ResNet を使用しているにもかかわらず、CPLFW および CALFW において ArcFace (IR100) を上回った。これは、高いパラメータ効率を示している。
  • DREAM ブロックと比較して、PAM はモデルパラメータを75倍以上削減しながら、CFP-FP および CPLFW でより優れた性能を達成した。
  • IR50 ベースラインと比較して、PAM ブロックは CFP-FP で 0.35%、CPLFW で 0.15% の検証精度向上を達成した。
  • パラメータ数が少ないにもかかわらず、AgeDB-30 で 0.05%、CALFW で 0.12% の向上を DREAM を上回った。これは、強い一般化性能を示している。
  • アブレーションスタディの結果、階層的特徴空間変換は特徴埋め込み空間よりも効果的であり、ポーズ耐性の面で顕著な向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。