[論文レビュー] Disentangled Variational Representation for Heterogeneous Face Recognition
本稿では、NIRとVISの顔画像における異種顔認識のための分離可変表現(DVR)フレームワークを提案する。変分推論を用いて、NIRおよびVIS顔表現における個人識別情報と個人内変動を分離する。同一被験者に対する識別情報の最小化と、モダリティ変動における緩和された相関整合を適用することで、ドメイン差を低減し、過学習を軽減する。Oulu-CASIAでVR@FAR=1%において最大19.1%の向上を達成し、3つのベンチマークデータセットで最先端の性能を発揮した。
Visible (VIS) to near infrared (NIR) face matching is a challenging problem due to the significant domain discrepancy between the domains and a lack of sufficient data for training cross-modal matching algorithms. Existing approaches attempt to tackle this problem by either synthesizing visible faces from NIR faces, extracting domain-invariant features from these modalities, or projecting heterogeneous data onto a common latent space for cross-modal matching. In this paper, we take a different approach in which we make use of the Disentangled Variational Representation (DVR) for cross-modal matching. First, we model a face representation with an intrinsic identity information and its within-person variations. By exploring the disentangled latent variable space, a variational lower bound is employed to optimize the approximate posterior for NIR and VIS representations. Second, aiming at obtaining more compact and discriminative disentangled latent space, we impose a minimization of the identity information for the same subject and a relaxed correlation alignment constraint between the NIR and VIS modality variations. An alternative optimization scheme is proposed for the disentangled variational representation part and the heterogeneous face recognition network part. The mutual promotion between these two parts effectively reduces the NIR and VIS domain discrepancy and alleviates over-fitting. Extensive experiments on three challenging NIR-VIS heterogeneous face recognition databases demonstrate that the proposed method achieves significant improvements over the state-of-the-art methods.
研究の動機と目的
- 異種顔認識におけるNIRとVIS顔画像間の顕著なドメイン差を解消すること。
- NIR顔認識における限られた学習データによる過学習を軽減すること。
- 識別性が高く、コンactな潜在表現を学習し、個人識別情報を個人内変動から分離すること。
- 分離可能な潜在表現と認識ネットワークを同時に最適化することで、クロスモダリティマッチング性能を向上させること。
- 分離可変表現とHFRネットワークの間で相互最適化スキームを構築し、一般化性能を向上させること。
提案手法
- 変分オートエンコーダーの枠組みを用いて、顔表現を個人識別情報と個人内変動を別々の潜在変数に分離する。
- NIRおよびVIS両モダリティの近似事後分布を最適化するため、変分下界を用いる。
- 同一被験者に対する識別情報の最小化により、分離された潜在空間における識別力の向上を図る。
- モダリティ変動間の緩和された相関整合制約を適用し、照明およびスペクトル差を補正する。
- DVRモジュールとHFRネットワークを交互に更新する代替最適化スキームを導入し、相互に改善を促進する。
- 学習された事後分布から合成されたNIRおよびVISサンプルを生成し、学習を拡張し、過学習を軽減する。
実験結果
リサーチクエスチョン
- RQ1分離可変表現は、異種顔認識における個人識別情報と個人内変動を効果的に分離できるか?
- RQ2同一被験者に対する識別情報の最小化が、クロスモダリティマッチング性能にどのように寄与するか?
- RQ3モダリティ変動間の緩和された相関整合は、どの程度ドメイン差を低減できるか?
- RQ4分離表現とHFRネットワークの相互最適化は、小規模なNIRデータセットにおける過学習を軽減できるか?
- RQ5提案されたDVRフレームワークは、挑戦的なNIR-VIS顔認識ベンチマークで最先端の手法を上回るか?
主な発見
- CASIA NIR-VIS 2.0では、DVRにLightCNN-9を適用した場合、Rank-1精度が99.1%、VR@FAR=0.1%が98.6%に達し、比較されたすべての最先端手法を上回った。
- LightCNN-29を用いる場合、DVRはLightCNN-9に比べてRank-1精度を0.8%、VR@FAR=0.1%を1.0%向上させ、深層ネットワークへのスケーラビリティを示した。
- Oulu-CASIA NIR-VISでは、DVRがVR@FAR=1%で89.7%を達成し、前回のSOTA手法W-CNN(81.5%)に対して8.2%の向上を示した。
- BUAA-VisNirでは、DVRがVR@FAR=1%で97.0%を達成し、W-CNNを1.0%上回り、限られたデータでも高い一般化性能を示した。
- アブレーションスタディの結果、各構成要素(分離可変部分、平均差分最小化、相関整合)が性能向上に顕著に寄与していることが確認された。
- ROC曲線の結果、DVRはすべてのベースラインを一貫して上回っており、特に低偽陽性率領域で優れたロバスト性と高い識別力が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。