[論文レビュー] Part-based Face Recognition with Vision Transformers
本稿では、標準的な損失関数を用いて複数のベンチマークで最先端の性能を達成する、Vision Transformerに基づく顔認識モデルfViTを提案する。さらに、顔の顔認識特徴を端末から予測する軽量なCNNを用いて、顔の特徴点をエンドツーエンドで予測し、その周囲から抽出したパッチにViTを適用する部分ベースのフレームワーク、part fViTを導入する。これにより、顔認識の精度が向上するが、顔認識特徴点の教師なしラベルは不要である。
Holistic methods using CNNs and margin-based losses have dominated research on face recognition. In this work, we depart from this setting in two ways: (a) we employ the Vision Transformer as an architecture for training a very strong baseline for face recognition, simply called fViT, which already surpasses most state-of-the-art face recognition methods. (b) Secondly, we capitalize on the Transformer's inherent property to process information (visual tokens) extracted from irregular grids to devise a pipeline for face recognition which is reminiscent of part-based face recognition methods. Our pipeline, called part fViT, simply comprises a lightweight network to predict the coordinates of facial landmarks followed by the Vision Transformer operating on patches extracted from the predicted landmarks, and it is trained end-to-end with no landmark supervision. By learning to extract discriminative patches, our part-based Transformer further boosts the accuracy of our Vision Transformer baseline achieving state-of-the-art accuracy on several face recognition benchmarks.
研究の動機と目的
- 標準的な損失関数を用いて、顔認識の強力なベースラインとしてのヴァニラ型Vision Transformer(fViT)の性能を評価すること。
- 部分ベースの顔認識にインspiredされた、不規則に配置された視覚的トークンを処理できるVision Transformerの可能性を調査すること。
- 顔の部分の局所化と認識を明示的な顔認識特徴点アノテーションなしに同時に学習できる、エンドツーエンドで訓練可能な新規なパイプライン、part fViTの開発。
- ViTを用いて部分ベースの特徴を学習することで、全体的な特徴学習に比べて一般化性能と精度が向上することを示すこと。
- part fViTにおける顔認識特徴点予測ヘッドが、有効な教師なし顔認識特徴点発見手法として機能できることを示すこと。
提案手法
- 標準的なArcFace損失関数を用いて、入力画像全体に対してVision Transformer(ViT)を直接学習させ、fViTベースラインモデルを構築する。
- アノテートされた顔認識特徴点を必要とせず、入力画像から顔のキーポイント座標を直接回帰する軽量なCNNを用いる。
- 予測された顔認識特徴点座標の周囲からパッチを抽出し、非一様なグリッドとしての視覚的トークンを形成する。
- 不規則に配置されたこれらのパッチを、特徴抽出と認識に用いるVision Transformerに供給し、部分ベースのアテンション学習を可能にする。
- 顔認識特徴点予測ヘッドとViTを含む、全システムをアイデンティティのラベルのみでエンドツーエンドで訓練する。
- 本手法は、ViTが非一様に配置されたトークンに注目できるという特性を活用し、目、鼻、口などの顔の部分を効果的にモデル化できる。
実験結果
リサーチクエスチョン
- RQ1アーキテクチャの変更なしに、標準的なVision Transformerバックボーンが適切に最適化された場合、最先端の顔認識精度を達成できるか?
- RQ2Vision Transformerが非一様に配置された視覚的トークンを処理できるという内在的な柔軟性を活用し、部分ベースの顔認識システムを設計できるか?
- RQ3アイデンティティラベルのみで、顔認識特徴点予測ヘッドとViTをエンドツーエンドで訓練することで、効果的かつ判別力のある部分局所化が可能になるか?
- RQ4提案手法であるpart fViTの性能は、全体的ViTや他の最先端の顔認識モデルと比較して、標準ベンチマークでどのように評価されるか?
- RQ5part fViTパイプラインにおける顔認識特徴点予測ヘッドは、有用な教師なし顔認識特徴点検出手法として機能できるか?
主な発見
- 標準的なArcFace損失で学習されたfViTベースラインは、特別なデータオーグメンテーションや複雑なヘッド構造を用いないモデルの中で、LFW(99.44%)、AgeDB-30(93.52%)、IJB-C(91.03%)で最先端の精度を達成した。
- part fViTモデルは、評価されたすべてのベンチマークでfViTベースラインを上回り、LFWでは99.56%、AgeDB-30では93.92%、IJB-Cでは91.03%の精度を達成し、これらのデータセットで新たな最先端の記録を樹立した。
- アテンションマップの可視化結果から、part fViTは特に目を的確に注目する一方で、全体的fViTはヘッド間で注目が不均一で、集中度が低いことがわかった。
- part fViTで学習された顔認識特徴点は、異なるポーズに対しても良好な一致を示しており、教師なし条件下でも意味のある顔の構造を暗黙的に学習していることが示された。
- 補足資料で確認したように、part fViTにおける顔認識特徴点予測ヘッドは、教師なし顔認識特徴点発見手法として優れた一般化性能を示した。
- アブレーションスタディの結果、顔認識特徴点予測ヘッドおよび部分ベースのパッチ抽出機構の両方が、全体的fViTベースラインからの最終的な精度向上に顕著に寄与していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。