Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Eyeglasses Removal in the Wild

Bingwen Hu, Zhedong Zheng|arXiv (Cornell University)|2019. 09. 16.
Face recognition and analysis참고 문헌 65인용 수 4
한 줄 요약

이 논문은 통합 생성 적대 기반 네트워크(ERGAN)를 사용하여 비지도 학습 기반의 안경 제거 방법을 제안한다. 이 방법은 동시에 안경 제거와 생성을 학습함으로써 다양한 안경 유형과 자연계 얼굴 자세에서도 강인한 성능을 발휘한다. 제안된 방법은 제거 성능의 현실성과 다양성에서 최신 기술을 초월하며, 얼굴 인식 및 표정 인식과 같은 후속 작업의 성능을 향상시킨다.

ABSTRACT

Eyeglasses removal is challenging in removing different kinds of eyeglasses, e.g., rimless glasses, full-rim glasses and sunglasses, and recovering appropriate eyes. Due to the large visual variants, the conventional methods lack scalability. Most existing works focus on the frontal face images in the controlled environment, such as the laboratory, and need to design specific systems for different eyeglass types. To address the limitation, we propose a unified eyeglass removal model called Eyeglasses Removal Generative Adversarial Network (ERGAN), which could handle different types of glasses in the wild. The proposed method does not depend on the dense annotation of eyeglasses location but benefits from the large-scale face images with weak annotations. Specifically, we study the two relevant tasks simultaneously, i.e., removing and wearing eyeglasses. Given two facial images with and without eyeglasses, the proposed model learns to swap the eye area in two faces. The generation mechanism focuses on the eye area and invades the difficulty of generating a new face. In the experiment, we show the proposed method achieves a competitive removal quality in terms of realism and diversity. Furthermore, we evaluate ERGAN on several subsequent tasks, such as face verification and facial expression recognition. The experiment shows that our method could serve as a pre-processing method for these tasks.

연구 동기 및 목표

  • 얼굴 자세, 조명, 안경 유형이 크게 변하는 제약 없는 실제 환경에서의 안경 제거 과제를 해결한다.
  • 동일한 신원의 안경 유무가 있는 쌍화된 학습 데이터가 필요로 하는 기존 방법의 한계를 극복한다.
  • 각 유형별 별도의 시스템이 필요로 하지 않는 확장 가능한 통합 모델을 개발하여 다양한 안경 유형(프레임 없는, 전체 프레임, 선글라스 등)에 일반화한다.
  • 이중 학습 체계를 통해 안경 제거와 생성을 동시에 수행함으로써 특징 학습과 현실감 있는 결과를 향상시킨다.
  • 후속 얼굴 관련 작업(예: 얼굴 인식, 표정 인식)의 전처리 도구로써의 방법의 유용성을 입증한다.

제안 방법

  • 이중 학습 프레임워크를 통해 안경 제거와 생성을 동시에 학습하는 통합 생성 적대 기반 네트워크(ERGAN)를 제안한다.
  • 약한 지도 학습을 활용: 정확한 바운딩 박스나 쌍화된 이미지가 필요로 하지 않으며, 오직 안경 유무의 이진 레이블만 필요하다.
  • 202,599장의 얼굴 이미지를 포함하는 CelebA 데이터셋에서 학습을 수행하며, 안경이 있는 경우와 없는 경우로 나누어 대규모 약한 레이블 학습을 가능하게 한다.
  • 얼굴 중심을 기준으로 하는 회전 기반 사전 처리 단계를 구현하여 랜드마크 기반 정렬의 복잡성을 피하고 자세 변화에 대한 강건성을 향상시킨다.
  • 사이클 일관성 GAN 아키텍처를 사용하여 두 이미지(안경이 있는 경우와 없는 경우) 간에 눈 영역을 교환함으로써 신원 유지와 현실적인 눈 영역 생성을 강제한다.
  • 생성자와 판별자를 눈 영역에 집중시켜 국소 세부 사항의 정확성 향상과 전체 얼굴 생성의 복잡성 감소를 달성한다.

실험 결과

연구 질문

  • RQ1쌍화된 학습 데이터가 없이도 다양한 안경 유형을 제약 없는 실제 얼굴 이미지에서 효과적으로 제거할 수 있는 통합 비지도 GAN 기반 방법은 가능한가?
  • RQ2안경 제거와 생성을 동시에 학습하는 방식이 단일 작업 접근 방식에 비해 결과의 품질과 현실감을 어떻게 향상시키는가?
  • RQ3제안된 방법이 얼굴 인식 및 표정 인식과 같은 후속 얼굴 인식 작업에서 얼마나 향상시키는가?
  • RQ4명시적인 정렬 또는 자세 정규화 없이도 다양한 얼굴 자세와 안경 외관에 일반화 가능한가?
  • RQ5쌍화된 지도 학습이 없는 상황에서 이중 학습 체계가 특징 학습과 신원 유지에 어떻게 기여하는가?

주요 결과

  • 제안된 ERGAN 방법은 현실성과 다양성 측면에서 안경 제거 성능에서 경쟁적인 성능을 달성하며, 이전 최신 기술을 능가한다.
  • MeGlass 데이터셋에서 얼굴 인식 정확도는 안경이 있는 경우 73.65%에서 제거 후 78.59%로 향상되었으며, 안경이 없는 이미지의 80.61%에 근접했다.
  • 제거 후 일치하는 얼굴 쌍 간의 평균 유클리드 거리가 크게 감소하여 신원 유지가 향상되고 차폐 간섭이 감소함을 시사한다.
  • 안경이 있는 경우 표정 인식 정확도는 73.65%로 감소했으나, 제거 후 78.59%로 향상되어 표정 인식에 큰 이점이 있음을 보여준다.
  • 정성적 결과에서는 안경이 있는 이미지가 자주 잘못 분류되었으며(예: 분노 또는 중립으로), 제거 후에는 모두 행복으로 올바르게 분류됨을 확인하여 실용적 유용성을 입증한다.
  • 회전 기반 사전 처리 덕분에 자세 변화에 강건하며, 복잡한 정렬을 피하고 다양한 머리 자세에서도 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.