Skip to main content
QUICK REVIEW

[논문 리뷰] Mask-off: Synthesizing Face Images in the Presence of Head-mounted Displays

Yajie Zhao, Qingguo Xu|arXiv (Cornell University)|2016. 10. 26.
Face recognition and analysis참고 문헌 28인용 수 5
한 줄 요약

이 논문은 단일 가시광선 카메라와 두 개의 근적외선(NIR) 눈 카메라를 사용하여 헤드셋을 착용한 상태에서도 사진처럼 사실적인, 가림이 없는 얼굴 이미지를 합성하는 새로운 시스템을 제안한다. 이는 헤드셋을 착용한 경우에도 현실적인 얼굴 재구성을 가능하게 한다. 방법은 개인화된 3차원 헤드 모델링, 심각한 가림 상태에서도 강력한 3차원 얼굴 추적, 특수 설계된 눈 색조 및 빨간 눈 제거 파이프라인을 포함하며, 평균 강도 오차가 5.6인 가림 영역에서 고해상도의 표정 재현을 달성한다.

ABSTRACT

A head-mounted display (HMD) could be an important component of augmented reality system. However, as the upper face region is seriously occluded by the device, the user experience could be affected in applications such as telecommunication and multi-player video games. In this paper, we first present a novel experimental setup that consists of two near-infrared (NIR) cameras to point to the eye regions and one visible-light RGB camera to capture the visible face region. The main purpose of this paper is to synthesize realistic face images without occlusions based on the images captured by these cameras. To this end, we propose a novel synthesis framework that contains four modules: 3D head reconstruction, face alignment and tracking, face synthesis, and eye synthesis. In face synthesis, we propose a novel algorithm that can robustly align and track a personalized 3D head model given a face that is severely occluded by the HMD. In eye synthesis, in order to generate accurate eye movements and dynamic wrinkle variations around eye regions, we propose another novel algorithm to colorize the NIR eye images and further remove the "red eye" effects caused by the colorization. Results show that both hardware setup and system framework are robust to synthesize realistic face images in video sequences.

연구 동기 및 목표

  • 가상 및 증강현실 응용 분야에서 헤드셋(HMD)으로 인한 얼굴 가림 문제를 해결한다.
  • 헤드셋이 상부 얼굴을 가로막는 영상 회의 및 멀티플레이어 게임 환경에서 현실적인 얼굴 대면 통신을 가능하게 한다.
  • 부분적인 입력에서 표정과 눈의 운동을 포함한 전체 얼굴 외형을 재구성하는 시스템을 개발한다.
  • 기존 방법들이 아바타에 의존하거나 큰 가림 상태를 고려하지 못하는 한계를 극복한다.
  • 다중 센서 입력과 고급 3차원 모델링 기법을 활용하여 가림 영역을 사진처럼 사실적으로 재현한다.

제안 방법

  • 가시광선 RGB 카메라 1대와 눈 부위에 초점을 맞춘 근적외선(NIR) 카메라 2대를 사용하여 가시광선 및 NIR 데이터를 동시에 캡처하는 하드웨어 구성을 구축한다.
  • 구조-운동에서 유도된 방법과 파라미터 기반 얼굴 모델링을 활용하여 개인화된 3차원 얼굴 모델을 구축함으로써 정확한 3차원 재구성 및 추적을 가능하게 한다.
  • 헤드셋에 의해 상부 얼굴가 심각하게 가려진 상태에서도 개인화된 3차원 모델을 강력하게 정렬하고 추적할 수 있는 새로운 3차원 헤드 추적 알고리즘을 구현한다.
  • 사전 기록된 데이터베이스에서 얼굴 랜드마크 기반으로 최적의 표정 템플릿을 검색하고, 이를 현재 프레임에 맞게 왜곡하여 적용하는 얼굴 합성 파이프라인을 개발한다.
  • 두 단계로 구성된 눈 합성 방법을 설계한다. 첫 번째 단계는 NIR 눈 이미지를 현실적인 피부 톤으로 색조화하고, 두 번째 단계는 근적외선 조명으로 인한 '빨간 눈' 아티팩트를 제거하는 보정을 수행한다.
  • 공간적 및 시간적 일관성을 확보하기 위해 캘리브레이션된 프레임워크를 통해 모든 구성 요소를 통합한다.

실험 결과

연구 질문

  • RQ1헤드셋에 의해 상부 얼굴가 가려진 상태에서 가시광선 및 근적외선 카메라로 구성된 다중 센서 설정이 전체 얼굴 외형을 효과적으로 재구성할 수 있는가?
  • RQ2헤드셋에 의한 심각한 가림 상태에서도 개인화된 3차원 얼굴 모델이 얼마나 정확하게 추적되고 정렬되는가?
  • RQ3합성된 눈 부위가 동적인 눈 움직임과 주름 변화와 같은 실제 얼굴 세부 사항을 어느 정도 정확하게 재현할 수 있는가?
  • RQ4시스템이 가림 영역에서 정확한 표정을 유지하면서 사진처럼 사실적인 결과를 생성하고 시각적 아티팩트를 최소화할 수 있는가?
  • RQ5시스템의 성능 오버헤드는 얼마이며, 실시간 운영을 위해 최적화될 수 있는가?

주요 결과

  • 합성된 이미지와 진짜 이미지 간 비교 시, 가림 영역에서 평균 강도 오차가 5.6으로 나타나 얼굴 질감 재구성의 높은 정확도를 입증한다.
  • Microsoft Emotion API를 활용한 표정 인식 결과, 합성된 표정이 진짜 표정과 유사하게 분류되며, 8개의 감정 범주에서 일관된 분류 성능을 보였다.
  • 얼굴 합성 모듈이 가장 계산 비용이 높으며, CPU에서 프레임당 약 400ms 소요되나, 추적 및 눈 색조화는 훨씬 더 빠르게 처리된다.
  • 근적외선 조명의 고유한 광학적 특성을 고려하여 눈 합성 파이프라인은 빨간 눈 효과를 성공적으로 제거했으며, 기존 표준 빨간 눈 제거 기법보다 뛰어난 성능을 보였다.
  • 모의 환경과 모바일 설정 모두에서 다양한 사용자와 표정(눈과 입의 움직임 포함)에 대해 높은 강건성을 입증하였다.
  • 런타임 분석 결과, GPU 가속과 해상도 감소를 통해 실시간 성능을 달성할 수 있으며, 이는 화상 회의 및 AR/VR 응용 분야에서의 실용적 구현 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.