[논문 리뷰] Real-Time Facial Segmentation and Performance Capture from RGB Input
이 논문은 극한의 가림을 견디는 정확하고 강력한 얼굴 분할을 달성하기 위해 공유된 컨volution 특징을 가진 이중 스트림 디컨볼루션 신경망을 사용하는 실시간 RGB 기반 얼굴 분할 및 성능 캡처 시스템을 제안한다. 합성 손으로 가리는 상황과 비얼굴 영역을 마스킹하는 데이터셋을 활용해 훈련함으로써, 이 방법은 30 fps에서 최신 기술 수준의 3D 얼굴 추적을 가능하게 하며, 손으로 얼굴을 완전히 가리는 동작이나 측면 시야에서도 매우 높은 강건성을 확보한다. 이는 이전의 RGB 전용 접근 방식보다 크게 향상된 성능이다.
We introduce the concept of unconstrained real-time 3D facial performance capture through explicit semantic segmentation in the RGB input. To ensure robustness, cutting edge supervised learning approaches rely on large training datasets of face images captured in the wild. While impressive tracking quality has been demonstrated for faces that are largely visible, any occlusion due to hair, accessories, or hand-to-face gestures would result in significant visual artifacts and loss of tracking accuracy. The modeling of occlusions has been mostly avoided due to its immense space of appearance variability. To address this curse of high dimensionality, we perform tracking in unconstrained images assuming non-face regions can be fully masked out. Along with recent breakthroughs in deep learning, we demonstrate that pixel-level facial segmentation is possible in real-time by repurposing convolutional neural networks designed originally for general semantic segmentation. We develop an efficient architecture based on a two-stream deconvolution network with complementary characteristics, and introduce carefully designed training samples and data augmentation strategies for improved segmentation accuracy and robustness. We adopt a state-of-the-art regression-based facial tracking framework with segmented face images as training, and demonstrate accurate and uninterrupted facial performance capture in the presence of extreme occlusion and even side views. Furthermore, the resulting segmentation can be directly used to composite partial 3D face models on the input images and enable seamless facial manipulation tasks, such as virtual make-up or face replacement.
연구 동기 및 목표
- 제한 없는 RGB 입력에서 실시간으로 강력한 3D 얼굴 성능 캡처를 가능하게 하여 극한의 가림 상황에서도 안정성을 확보한다.
- 머리카락, 손, 액세서리 등으로 인한 고차원적인 외관 변동성을 해결한다.
- 얼굴 영역을 명시적으로 분할하고 마스킹된 얼굴 데이터로 3D 회귀 모델을 훈련시켜 추적 정확도를 향상시킨다.
- 일반화 능력을 향상시키기 위해 합성 가림과 부정적 샘플을 포함한 데이터 증강 전략을 개발한다.
- 세분화된 분할이 3D 얼굴 모델링의 차원을 줄여 더 안정적이고 정확한 회귀를 가능하게 하는지 검증한다.
제안 방법
- 공유된 저수준 컨볼루션 특징을 가진 이중 스트림 디컨볼루션 네트워크를 사용하여 동시에 거시적 얼굴 형태와 세밀한 경계 정보를 예측한다.
- 네트워크는 확률 맵을 출력하고, 이를 그래프 컷 알고리즘을 통해 정제하여 정밀한 분할 마스크를 생성한다.
- 사전 훈련된 ImageNet 특징을 활용하고, LFW 및 FaceWarehouse 데이터셋에서 신중히 설계된 훈련 샘플을 사용해 미세조정한다.
- 새로운 데이터 증강 전략은 변형, 무작위 자르기, 합성 가림(예: 손), 그리고 얼굴이 없는 부정적 샘플을 포함한다.
- 최종 분할 마스크는 얼굴 영역을 분리하고, 이를 최신 기술 수준의 DDE 기반 3D 얼굴 추적 프레임워크에 입력한다.
- 시스템은 GPU와 CPU에서 병렬로 분할 및 추적 단계를 처리하여 실시간으로 30 fps로 작동한다.
실험 결과
연구 질문
- RQ1제한 없는 RGB 입력에서 실시간으로 픽셀 수준의 얼굴 분할이 극한의 가림 상황에서 3D 얼굴 성능 캡처의 강건성에 크게 기여할 수 있는가?
- RQ2공유된 컨볼루션 특징을 가진 이중 스트림 디컨볼루션 아키텍처가 얼굴 분할에서 전반적인 형태와 세밀한 경계 정보를 동시에 캡처하는 데 얼마나 효과적인가?
- RQ3합성 가림 데이터와 부정적 샘플이 제한된 데이터 환경에서 얼굴 분할의 일반화 능력을 얼마나 향상시킬 수 있는가?
- RQ4딥 러닝 분할에서 유도된 마스킹된 훈련 데이터는 마스킹되지 않은 훈련에 비해 극한의 가림 상황에서 3D 얼굴 회귀 성능을 얼마나 향상시킬 수 있는가?
- RQ5명시적인 의미 분할이 3D 얼굴 피팅 문제의 효과적 차원을 줄여 더 안정적이고 정확한 추적을 가능하게 하는가?
주요 결과
- 제안된 방법은 RGB 입력만으로도 30 fps에서 실시간 성능 캡처를 구현하며, CPU와 GPU에서 병렬로 분할 및 추적 처리가 이루어진다.
- 손이 얼굴과 유사한 피부 톤을 가진 경우에도 손으로 얼굴을 완전히 가리는 동작 중에도 정확한 추적을 유지하며, 이전의 RGB 전용 방법보다 뛰어난 성능을 보인다.
- 데이터 증강에 합성 가림과 부정적 샘플을 활용함으로써, 제한된 실제 분할 데이터에서의 과적합을 줄이고 일반화 능력을 크게 향상시켰다.
- 공유된 컨볼루션 특징을 가진 이중 스트림 디컨볼루션 아키텍처는 특히 세밀한 경계 정보 유지 측면에서 최신 기술 수준의 얼굴 분할 정확도를 달성했다.
- RGB 입력에만 의존함에도 불구하고 최근의 RGB-D 기반 접근 방식 [7]과 유사한 가림 처리 능력을 보였다.
- 생성된 분할 마스크는 머리카락이나 손 등 가림 물체가 존재하는 상황에서도 3D 얼굴 모델의 자연스러운 복합를 가능하게 하여 가상 메이크업 및 얼굴 교체 등의 애플리케이션을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.