Skip to main content
QUICK REVIEW

[논문 리뷰] FaceOcc: A Diverse, High-quality Face Occlusion Dataset for Human Face Extraction

Xiangnan Yin, Liming Chen|arXiv (Cornell University)|2022. 01. 20.
Face recognition and analysis인용 수 5
한 줄 요약

이 논문은 CelebA-HQ 및 인터넷 자료에서 유래한 30,000개 이상의 다양한 수작업(annotation) 처리된 가림막을 포함하는 대규모 고품질 얼굴 가림 데이터셋인 FaceOcc를 소개한다. 이는 선글라스, 마스크, 손, 스카프 등을 포함한다. FaceOcc를 CelebAMask-HQ의 속성 마스크와 결합하여 단순한 U-Net 기반 모델을 훈련시킨 결과, 얼굴 분할에서 최고 성능(SOTA)을 달성하였으며, 이는 모델 복잡성보다 데이터 품질과 다양성이 더 중요하다는 것을 입증한다.

ABSTRACT

Occlusions often occur in face images in the wild, troubling face-related tasks such as landmark detection, 3D reconstruction, and face recognition. It is beneficial to extract face regions from unconstrained face images accurately. However, current face segmentation datasets suffer from small data volumes, few occlusion types, low resolution, and imprecise annotation, limiting the performance of data-driven-based algorithms. This paper proposes a novel face occlusion dataset with manually labeled face occlusions from the CelebA-HQ and the internet. The occlusion types cover sunglasses, spectacles, hands, masks, scarfs, microphones, etc. To the best of our knowledge, it is by far the largest and most comprehensive face occlusion dataset. Combining it with the attribute mask in CelebAMask-HQ, we trained a straightforward face segmentation model but obtained SOTA performance, convincingly demonstrating the effectiveness of the proposed dataset.

연구 동기 및 목표

  • 제약 조건이 없는 환경에서 정확한 얼굴 추출을 방해하는 고품질 다각도 얼굴 가림 데이터셋의 부족 문제를 해결하기 위해.
  • 다양한 가림 유형과 질감을 포함하는 포괄적이고 정확히 애너테이션 처리된 데이터셋을 제공하여 얼굴 분할 성능을 향상시키기 위해.
  • 데이터 품질과 다양성이 얼굴 추출 작업에서 복잡한 모델 아키텍처를 능가할 수 있음을 입증하기 위해.
  • 실제 적용에 적합하고 확장 가능한 데이터셋을 구축하여 일반화 능력을 향상시키기 위한 현실적인 데이터 증강을 지원하기 위해.

제안 방법

  • CelebA-HQ 및 추가적인 인터넷 자료에서 유래한 30,000장의 고해상도 얼굴 이미지에 대해 선글라스, 마스크, 손, 스카프 등의 가림을 수작업으로 애너테이션 처리하기.
  • CelebAMask-HQ의 사전 존재하는 속성 마스크와 가림 마스크를 통합하여 잘라내기 방식을 활용한 정밀한 얼굴 마스크 생성: $M_{\text{face}} = \max(\hat{M}_{\text{face}} - M_{\text{occ}}, 0)$.
  • 공간적, 색상적, 가림 질감 변형을 포함한 실시간 데이터 증강 기법을 적용하여 데이터의 다양성과 현실감을 향상시키기.
  • 이진 교차 엔트로피 손실과 온라인 하드 예외 마이닝(OHEM)을 사용하여 ResNet-18 백본을 갖춘 경량 U-Net 모델을 훈련하기.
  • 초기 모델을 사용해 FFHQ에서 하드 샘플을 선별하고 이를 데이터셋에 추가하여 모델의 강인성을 향상시키기.
  • 정확한 수작업 애너테이션을 확보하기 위해 Apple Pencil과 Magic Eraser 앱을 활용하기.

실험 결과

연구 질문

  • RQ1대규모, 다각도, 정확하게 애너테이션 처리된 얼굴 가림 데이터셋이 얼굴 분할 성능을 크게 향상시킬 수 있는가?
  • RQ2훈련된 얼굴 추출 모델에서 데이터 품질과 다양성이 아키텍처의 복잡성보다 더 우월한가?
  • RQ3정제된 가림 데이터셋으로 훈련된 단순하고 경량의 모델이 최신 기술을 초월할 수 있는가?
  • RQ4가림 질감의 다양성을 포함한 실시간 데이터 증강 기법이 모델 일반화 능력을 향상시키는 데 얼마나 효과적인가?

주요 결과

  • 제안된 FaceOcc 데이터셋은 30,000개 이상의 이미지와 다양한 수작업 애너테이션 처리된 가림을 포함하여, 지금까지 가장 크고 포괄적인 얼굴 가림 데이터셋이다.
  • FaceOcc와 CelebAMask-HQ를 기반으로 ResNet-18 백본을 갖춘 단순한 U-Net 모델을 훈련시킨 결과, COFW 벤치마크에서 IOU 93.7%를 기록하여 이전 모든 방법을 능가했다.
  • 모델은 전역 정확도 98.0%와 재현율 98.3%를 달성하여, 이전의 최고 성능(SOTA) 방법보다 두 지표에서 뚜렷이 뛰어났다.
  • Masi 등(2020)의 ($128\times128$)보다 높은 입력 해상도($256\times256$)를 사용했음에도 불구하고, 경쟁적인 추론 속도 257 FPS를 달성했다.
  • 결과적으로, 복잡한 모델 설계보다 고품질 다각도 훈련 데이터가 더 큰 영향을 미친다는 것이 확인되었으며, 단순한 모델이 특수 기능 없이도 이전의 SOTA 방법을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.