Skip to main content
QUICK REVIEW

[논문 리뷰] Label Denoising Adversarial Network (LDAN) for Inverse Lighting of Face Images

Hao Zhou, Jin Sun|arXiv (Cornell University)|2017. 09. 06.
Image Enhancement Techniques참고 문헌 21인용 수 7
한 줄 요약

이 논문은 실존하는 얼굴 이미지의 노이즈가 많은 레이블 문제를 완화하기 위해 정확한 레이블을 가진 합성 데이터를 사용하여 단일 얼굴 이미지에서 구면 조화 분석 조명 파arameter를 회귀하는 딥 컨volution 네트워크인 레이블 디노이징 적대적 네트워크(LDAN)를 제안한다. GAN 기반의 특징 도메인 적응과 회귀 손실을 결합함으로써, LDAN은 최적화 기반 방법 대비 100,000배 빠른 추론 속도를 달성하고, 유사한 조명 조건에서 이전 연구 대비 일관성과 정확도 면에서 뛰어난 성능을 보인다.

ABSTRACT

Lighting estimation from face images is an important task and has applications in many areas such as image editing, intrinsic image decomposition, and image forgery detection. We propose to train a deep Convolutional Neural Network (CNN) to regress lighting parameters from a single face image. Lacking massive ground truth lighting labels for face images in the wild, we use an existing method to estimate lighting parameters, which are treated as ground truth with unknown noises. To alleviate the effect of such noises, we utilize the idea of Generative Adversarial Networks (GAN) and propose a Label Denoising Adversarial Network (LDAN) to make use of synthetic data with accurate ground truth to help train a deep CNN for lighting regression on real face images. Experiments show that our network outperforms existing methods in producing consistent lighting parameters of different faces under similar lighting conditions. Moreover, our method is 100,000 times faster in execution time than prior optimization-based lighting estimation approaches.

연구 동기 및 목표

  • 실외에서 촬영된 실제 얼굴 이미지에 대해 진정한 조명 레이블이 부족한 문제를 해결하기 위해.
  • 기존 추정 방법으로부터 유도된 노이즈가 많은 레이블이 존재하는 상황에서도 실제 얼굴 이미지의 조명 회귀 성능을 향상시키기 위해.
  • 정확한 조명 레이블을 가진 합성 얼굴 이미지를 활용하여 실세계 추론에 적합한 강력한 딥 컨volution 네트워크를 훈련시키기 위해.
  • GAN 기반 도메인 적응과 회귀 손실을 결합하여 의미 있는, 레이블 일관성을 확보하는 특징 매핑을 보장하기 위해.
  • 저해상도 얼굴 이미지에 대해 빠르고 정확한 조명 추정을 가능하게 하여, 이미지 편집 및 위조 탐지와 같은 애플리케이션에 적합하게 하기 위해.

제안 방법

  • LDAN은 두 개의 스트림 아키텍처를 사용한다: 실존 데이터를 위한 특징 넷과 구면 조화 계수를 예측하기 위한 조명 넷.
  • 모델은 정확한 레이블을 가진 합성 데이터로 사전 훈련되며, 합성 데이터에 대해 조명 넷과 특징 넷을 고정한다.
  • 도메인 적응 모듈은 구분자(discriminator)를 사용하여 실존 조명 특징와 합성 조명 특징를 구분한다. 이때 실존 데이터 특징 넷은 이를 속이도록 훈련된다.
  • 실존 데이터 특징 넷은 노이즈가 있는 실존 레이블에 대한 예측 오차를 최소화하기 위해 회귀 손실과 함께 공동 최적화된다.
  • 이 방법은 합성 데이터가 노이즈 없는 지도 학습을 제공하는 반면, 실존 데이터 레이블은 노이즈가 있지만 유용한 정보를 담고 있다는 가정을 활용한다.
  • 모델은 64×64 RGB 얼굴 이미지에서 끝내기로 훈련되어 저해상도 입력을 지원한다.

실험 결과

연구 질문

  • RQ1정확한 조명 레이블을 가진 합성 데이터가 노이즈가 많은 레이블을 가진 실제 얼굴 이미지에서 딥 컨volution 네트워크 성능을 향상시키는가?
  • RQ2GAN 기반 도메인 적응과 회귀 손실을 결합할 경우 조명 회귀 정확도에 어떤 영향을 미치는가?
  • RQ3제안된 방법이 최적화 기반 조명 추정보다 더 빠른 추론 속도를 달성할 수 있는가?
  • RQ4동일한 조명 조건에서 서로 다른 얼굴에 대해 모델이 더 일관성 있는 조명 예측을 하는가?
  • RQ5정상적인 성능과 일반화 능력 측면에서 최신 기술 대비 어떻게 비교되는가?

주요 결과

  • LDAN은 SIRFS 방법 대비 100,000배 빠른 속도를 기록하여 GPU에서 매초 2,400장의 얼굴 이미지를 처리한다.
  • MultiPie 데이터셋에서 LDAN은 SIRFS SH 및 REAL 기반 모델보다 유클리드 거리와 Q-측도 모두에서 뛰어난 성능을 보이며, 동일한 조명 조건에서의 얼굴 쌍 간 일관성도 향상되었다.
  • 제거 실험 결과, GAN 손실이나 회귀 손실을 제거할 경우 성능 저하가 발생함을 확인하여 두 구성 요소가 모두 필수적임을 입증했다.
  • 3DMM 기반 방법이 노말 추정에 오류가 생겨 실패하는 64×64 해상도 얼굴 이미지에서도 LDAN은 높은 정확도를 유지한다.
  • LDAN은 '3D 조명'이 종종 음수 DC 성분을 생성하는 것과 달리, 물리적으로 타당한 조명(비음수 DC 성분 포함)을 예측한다.
  • LDAN이 예측한 SH 파arameter를 사용한 시각적 합성 결과는 특히 균일한 조명 조건에서 SIRFS SH에 비해 더 현실적인 조명 효과를 만들어 냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.