Skip to main content
QUICK REVIEW

[論文レビュー] My Eyes Are Up Here: Promoting Focus on Uncovered Regions in Masked Face Recognition

Pedro C. Neto, Fadi Boutros|arXiv (Cornell University)|Aug 2, 2021
Face recognition and analysis参考文献 22被引用数 19
ひとこと要約

本論文は、平均二乗誤差(MSE)と従来の三重損失を組み合わせた変更された三重損失を用いることで、露出した顔面領域に注目するように改良された、マスク付き顔認識(MFR)のための新しいトレーニングパラダイムを提案する。この手法により、マスクあり対マスクなしの比較における認証性能が向上し、合成および実際のマスク付き顔データセットの両方で最先端の結果を達成しており、AUCは最大0.985、EERは6.2%まで低下している。

ABSTRACT

The recent Covid-19 pandemic and the fact that wearing masks in public is now mandatory in several countries, created challenges in the use of face recognition systems (FRS). In this work, we address the challenge of masked face recognition (MFR) and focus on evaluating the verification performance in FRS when verifying masked vs unmasked faces compared to verifying only unmasked faces. We propose a methodology that combines the traditional triplet loss and the mean squared error (MSE) intending to improve the robustness of an MFR system in the masked-unmasked comparison mode. The results obtained by our proposed method show improvements in a detailed step-wise ablation study. The conducted study showed significant performance gains induced by our proposed training paradigm and modified triplet loss on two evaluation databases.

研究の動機と目的

  • パンデミックに伴うマスク着用に起因するマスク付き顔認識(MFR)の課題に対処すること。
  • 現実世界の重要なシナリオであるマスクあり対マスクなしの顔認識比較における認証性能を向上させること。
  • 露出した顔面領域に注目することで、モデルのロバスト性を向上させるトレーニングパラダイムを開発すること。
  • 損失関数の変更がMFR性能に与える影響をアブレーションスタディを通じて調査すること。
  • 合成および実世界のマスク付き顔データセットの両方で有効性を示すこと。

提案手法

  • 分類ヘッドを交差エントロピー(CE)損失を用いて事前学習する2段階のトレーニングパラダイムを提案する。
  • その後、すべての層を固定し、最終的な埋め込み層のみを微調整することでネットワークをファインチューニングする。
  • 平均二乗誤差(MSE)を組み込んだ変更された三重損失を導入する。
  • 修正された損失関数は、アングルとネガティブの距離がアングルとポジティブの距離より小さい場合にモデルをペナルティを与える。マージンは0である。
  • 特徴の重要度を可視化し、露出した顔面領域に注目していることを検証するためにSmooth Grad-CAM++を用いる。
  • MSE部は、露出した顔面領域を強調する表現を学習するのを促進する。

実験結果

リサーチクエスチョン

  • RQ1MSEを三重損失と組み合わせることで、マスクあり対マスクなしの認証におけるMFR性能はどのように向上するか?
  • RQ2露出した顔面領域に注目することで、MFRにおけるモデルのロバスト性はどの程度向上するか?
  • RQ32段階のトレーニングアプローチ(分類の学習の後、埋め込みのファインチューニング)はMFR性能を向上させるか?
  • RQ4本手法は、VGGFace2のようなベースラインモデルと比較して、現実世界のマスク付き顔認識においてどのように性能を発揮するか?
  • RQ5アブレーションスタディで示されるように、各コンポーネント(CE、三重損失、MSE)は最終的な性能にどの程度寄与しているか?

主な発見

  • 合成マスク付き顔データセットでは、提案手法(CE + TL + MSE)がAUC 0.985、EER 6.2%、FMR10 4.1%を達成した。
  • 実際のマスク付き顔データセットでは、U-Mモード(マスクなし対マスクあり)でAUC 0.957を達成し、EERは9.799%まで低下した。
  • アブレーションスタディにより、三重損失にMSEを追加することで、CE + TLのみのものよりも顕著に性能向上が確認された。
  • 合成データのみで学習したモデルが実際のマスク付きデータに対しても強く一般化していたことから、提案損失の堅牢性が示された。
  • Grad-CAM++の可視化により、MSEを修正したモデルが、ベースラインモデルよりも露出した顔面領域に重点を置いていることが確認された。
  • M-M(マスクあり対マスクあり)モードでは、期待通り性能向上が見られなかった。これは、トレーニング目的がU-M認証に特化していたためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。