[論文レビュー] A realistic approach to generate masked faces applied on two novel masked face recognition data sets
本論文では、SparkAR Studioを用いた現実的な手法により、合成されたマスク付き顔を生成する方法を提案しており、CASIA-WebFaceおよびCelebAデータセットに640,446件のマスク付き顔サンプルを追加している。このアプローチにより、マスク付き顔認識の性能が顕著に向上し、オリジナルデータや現実性に欠けるマスクデータで学習したモデルに比べて、特に実世界のマスク付きベンチマークにおいて優れた性能を示している。
The COVID-19 pandemic raises the problem of adapting face recognition systems to the new reality, where people may wear surgical masks to cover their noses and mouths. Traditional data sets (e.g., CelebA, CASIA-WebFace) used for training these systems were released before the pandemic, so they now seem unsuited due to the lack of examples of people wearing masks. We propose a method for enhancing data sets containing faces without masks by creating synthetic masks and overlaying them on faces in the original images. Our method relies on SparkAR Studio, a developer program made by Facebook that is used to create Instagram face filters. In our approach, we use 9 masks of different colors, shapes and fabrics. We employ our method to generate a number of 445,446 (90%) samples of masks for the CASIA-WebFace data set and 196,254 (96.8%) masks for the CelebA data set, releasing the mask images at https://github.com/securifai/masked_faces. We show that our method produces significantly more realistic training examples of masks overlaid on faces by asking volunteers to qualitatively compare it to other methods or data sets designed for the same task. We also demonstrate the usefulness of our method by evaluating state-of-the-art face recognition systems (FaceNet, VGG-face, ArcFace) trained on our enhanced data sets and showing that they outperform equivalent systems trained on original data sets (containing faces without masks) or competing data sets (containing masks generated by related methods), when the test benchmarks contain masked faces.
研究の動機と目的
- 顔認識システムの訓練に適した現実的で大規模なマスク付き顔データの不足に対処する。
- COVID-19パンデミック期におけるマスク着用の広がりによって引き起こされる分布シフトを克服する。
- アクセス可能なツールを用いて、スケーラブルで自動化された方法で現実的なマスクを非マスク顔に合成する。
- 最先端の顔認識モデルのマスク付き顔認識タスクにおける性能を向上させる。
- マスクの現実性がモデルの一般化能力および認識精度に直接影響することを示す。
提案手法
- Instagramフィルター開発に用いられる、Facebookが開発したツール「SparkAR Studio」を活用し、現実的なテクスチャ、色、形状の合成マスクを生成する。
- 色、形状、素材が異なる9種類のマスクタイプを、既存データセットの非マスク顔に適用する。
- マスクの重ね合わせにおける顔のランドマークの正確な検出と色の一貫性を確保するため、Dlib-mlおよびColorMatcherを用いる。
- アライメントと現実性を保証するため、カスタム検証スクリプトを用いてマスク生成パイプラインを自動化する。
- 前処理スクリプトを含めて、https://github.com/securifai/masked_faces にて強化済みデータセットを公開する。
- FaceNet、VGG-face、ArcFaceといった最先端の顔認識モデルを、オリジナルデータセットおよび強化済みデータセットの両方で学習・評価する。
実験結果
リサーチクエスチョン
- RQ1Instagramフィルター開発ツールとして知られる、消費者向けツール「SparkAR Studio」を用いた合成マスク生成は、従来の手法に比べてより現実的なマスク付き顔画像を生成できるか?
- RQ2合成マスク付きデータで学習した顔認識モデルは、実際のマスク付き顔ベンチマークで性能向上を示せるか?
- RQ3合成マスクの現実性が、顔認識システムの一般化能力にどのように影響するか?
- RQ4現実的なマスクを含む強化済みデータセットは、黒塗りマスクや現実性に欠ける合成マスクを用いたベースラインを上回る性能を示せるか?
- RQ5マスクの現実性と、実世界のマスク付き顔データにおける認識精度の相関関係はどの程度か?
主な発見
- 提案手法により、CASIA-WebFaceの90%(445,446件)およびCelebAの96.8%(196,254件)がマスク付き顔に変換され、トレーニングデータが顕著に拡張された。
- 人間による評価により、SparkAR Studioで生成されたマスクは、他の手法で生成されたマスクよりも顕著に現実的であると確認された。
- 強化済みデータセットで学習した顔認識モデルは、MFR2の実マスク顔ベンチマークで96.22%の精度を達成し、黒塗りマスクで学習したモデル(93.04%)やMaskTheFaceで学習したモデル(95.16%)を上回った。
- 合成マスクを含むCASIA-WebFaceテストセットにおいて、ArcFaceを用いたモデルは91.47%の精度を達成したのに対し、オリジナルデータで学習したモデルでは87.95%であった。
- 現実的なマスクで学習したモデルと黒塗りマスクで学習したモデルとの間で約3%の性能差が生じており、マスクの形状やテクスチャが顔認識に有用な手がかりを提供することが示された。
- MobileNetV2に基づく2値分類器は、マスクありとマスクなしの顔を区別する際、99.44%の精度を達成し、動的システムスイッチングの実現が可能となった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。