Skip to main content
QUICK REVIEW

[論文レビュー] Boosting Masked Face Recognition with Multi-Task ArcFace

David Montero, Marcos Nieto|arXiv (Cornell University)|Apr 20, 2021
Face recognition and analysis参考文献 26被引用数 7
ひとこと要約

本稿では、ResNet-50を変更し、マスク検出のためのバイナリクロスエントロピー損失と組み合わせたArcFace損失を組み合わせることで、マスクをかけた顔認識とマスク使用状況分類を同時に最適化するマルチタスク学習フレームワーク、Multi-Task ArcFace (MTArcFace) を提案する。この手法は、マスクをかけたLFWで98.92%の精度を達成し、マスク検出では平均99.78%の精度を示す一方で、非マスクデータにおいては元の性能にほぼ等しい水準を維持する。

ABSTRACT

In this paper, we address the problem of face recognition with masks. Given the global health crisis caused by COVID-19, mouth and nose-covering masks have become an essential everyday-clothing-accessory. This sanitary measure has put the state-of-the-art face recognition models on the ropes since they have not been designed to work with masked faces. In addition, the need has arisen for applications capable of detecting whether the subjects are wearing masks to control the spread of the virus. To overcome these problems a full training pipeline is presented based on the ArcFace work, with several modifications for the backbone and the loss function. From the original face-recognition dataset, a masked version is generated using data augmentation, and both datasets are combined during the training process. The selected network, based on ResNet-50, is modified to also output the probability of mask usage without adding any computational cost. Furthermore, the ArcFace loss is combined with the mask-usage classification loss, resulting in a new function named Multi-Task ArcFace (MTArcFace). Experimental results show that the proposed approach highly boosts the original model accuracy when dealing with masked faces, while preserving almost the same accuracy on the original non-masked datasets. Furthermore, it achieves an average accuracy of 99.78% in mask-usage classification.

研究の動機と目的

  • 新型コロナウイルス感染症の流行期におけるマスク着用による顔認識精度の著しい低下を是正すること。
  • 追加の推論コストなしに、マスクをかけた顔認識とマスク使用状況の両方を同時に向上させる統合されたディープラーニングフレームワークの開発。
  • 後方互換性を確保するため、非マスク顔認識データセットにおいても高い性能を維持すること。
  • データ拡張を用いて合成的にマスクを追加することで、モデルの汎化性能を向上させるための合成マスク付きトレーニングデータセットの作成。

提案手法

  • データ拡張技術を用いて、元の顔認識データセットに合成的にマスクを追加することで、拡張されたデータセットを構築する。
  • 追加の計算コストなしに、深層特徴埋め込みとマスク使用確率予測の両方を出力するように、ResNet-50バックボーンを変更する。
  • マスク検出のためのバイナリクロスエントロピー損失と、マージンに基づく分類損失であるArcFace損失を組み合わせた、新規のマルチタスクArcFace (MTArcFace) 損失関数を導入する。
  • 元の顔とマスクをかけた顔の両方を含む統合データセット上で、エンドツーエンドにモデルを学習させ、オクルージョンに強い性能を向上させる。
  • 両タスクに共通の特徴抽出器を採用することで、顔認識とマスク検出の両方を同時に最適化可能にする。
  • マスク確率出力に0.5のしきい値を適用して、二値のマスク使用状況分類を実行する。

実験結果

リサーチクエスチョン

  • RQ11つのディープラーニングモデルが、同時にマスクをかけた顔を効果的に認識し、マスク使用状況を検出できるか。
  • RQ2マスクをかけた顔と非マスク顔の両方のデータを同時に学習させることで、マスクをかけた顔認識ベンチマークおよび非マスク顔認識ベンチマークにおける性能にどのような影響を与えるか。
  • RQ3提案手法が、元のArcFaceモデルと比較して、非マスク顔認識の精度をどの程度維持できるか。
  • RQ4モデルが、顔にマスクが着用されているかどうかを分類する精度はどの程度か。

主な発見

  • 提案されたMTArcFaceモデルは、マスクをかけたLFWデータセットで98.92%の認証精度を達成し、元のArcFaceモデルの94.75%と比較して顕著な向上を示す。
  • CFP_FPデータセットでは、マスクをかけた顔認識の精度が約12%向上(76.81%から88.43%に)した。
  • 非マスクデータセットでは高い性能を維持しており、LFWでは元のモデルの99.62%と比較してわずか0.17%の低下(99.45%)にとどまる。
  • マスク使用状況分類タスクでは、全テストデータセットで平均99.78%の精度を達成し、CFP_FPで最も低い性能(98.82%)を示した。
  • プロファイル顔(横顔)では、前面顔(正面顔)と比較して性能が低く、トレーニングデータにプロファイル画像をより多く含める必要があることを示唆している。
  • 本手法は、マスクをかけた顔認識とマスク検出の二重目的を、非マスク顔認識性能への妥協を最小限に抑えながら効果的にバランスさせている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。