[논문 리뷰] Photo-realistic Face Images Synthesis for Learning-based Fine-scale 3D Face Reconstruction.
이 논문은 단일 이미지나 단일 영상에서 실시간으로 고정밀 3D 얼굴 재구성에 적합한 코arse-to-fine CNN 프레임워크를 구현하기 위해 역렌더링과 다중 척도 세부 정보 전달 기법을 활용한 새로운 데이터 생성 방법을 제안한다. 이는 주름과 표정을 포함한 사진 수준의 현실감 있는 얼굴 이미지를 합성함으로써, 기존 최고 수준의 방법들보다 품질과 효율성 면에서 뛰어난 성능을 발휘한다.
With the powerfulness of convolution neural networks (CNN), CNN based face reconstruction has recently shown promising performance in reconstructing detailed face shape from 2D face images. The success of CNN-based methods relies on a large number of labeled data. The state-of-the-art synthesizes such data using a coarse morphable face model, which however has difficulty to generate detailed photo-realistic images of faces (with wrinkles). This paper presents a novel face data generation method. Specifically, we render a large number of photo-realistic face images with different attributes based on inverse rendering. Furthermore, we construct a fine-detailed face image dataset by transferring different scales of details from one image to another. We also construct a large number of video-type adjacent frame pairs by simulating the distribution of real video data. With these nicely constructed datasets, we propose a coarse-to-fine learning framework consisting of three convolutional networks. The networks are trained for real-time detailed 3D face reconstruction from monocular video as well as from a single image. Extensive experimental results demonstrate that our framework can produce high-quality reconstruction but with much less computation time compared to the state-of-the-art. Moreover, our method is robust to pose, expression and lighting due to the diversity of data.
연구 동기 및 목표
- CNN 기반 3D 얼굴 재구성에 적합한 다양한 사진 수준의 현실감 있는 훈련 데이터의 부족을 해결한다. 특히 주름과 같은 세부 사항에 초점을 맞춘다.
- 거시적 형태 모델의 한계를 극복하여 현실적인 얼굴 텍스처와 표정을 생성한다.
- 일반화 능력을 향상시키기 위해 다양한 현실감 있는 얼굴 이미지와 인접한 영상 프레임 쌍으로 구성된 대규모 데이터셋을 구축한다.
- 다양한 자세, 표정, 조명 조건에서도 실시간으로 고정밀 3D 얼굴 재구성을 가능하게 한다.
제안 방법
- 다양한 특성(실제 주름, 조명 변화 포함)을 가진 사진 수준의 현실감 있는 얼굴 이미지를 생성하기 위해 역렌더링 기법을 활용한다.
- 다양한 소스 이미지의 특징을 조합하여 다중 척도 세부 정보 전달 기법을 적용함으로써 고해상도의 세밀한 얼굴 이미지를 합성한다.
- 위의 기법들을 활용해 현실감 있는 텍스처와 표정을 갖춘 대규모 3D 얼굴 이미지 데이터셋을 구축한다.
- 실제 영상 데이터의 시간적 분포를 시뮬레이션하여 영상처럼 보이는 인접 프레임 쌍을 생성함으로써 시간적 일관성을 향상시킨다.
- 종단 간 3D 얼굴 재구성을 위한 세 개의 연결된 컨볼루션 네트워크로 구성된 코어스-투-파인 학습 프레임워크를 설계한다.
- 합성된 데이터셋으로 프레임워크를 훈련시켜 단일 영상 또는 단일 이미지에서 실시간 추론을 가능하게 한다.
실험 결과
연구 질문
- RQ1역렌더링과 다중 척도 세부 정보 전달 기법이 주름과 표정과 같은 세부 사항을 갖춘 사진 수준의 현실감 있는 얼굴 이미지를 효과적으로 생성할 수 있는가?
- RQ2합성된 얼굴 이미지로 구성된 대규모이고 다양한 데이터셋이 3D 얼굴 재구성 모델의 일반화 능력과 강건성에 기여하는가?
- RQ3합성 데이터로 훈련된 코어스-투-파인 CNN 프레임워크가 단일 이미지나 영상에서 실시간으로 고정밀 3D 얼굴 재구성을 달성할 수 있는가?
- RQ4제안된 방법이 다양한 자세, 표정, 조명 조건에서 최고 수준의 기존 방법들과 비교해 어떻게 성능을 발휘하는가?
주요 결과
- 제안된 방법은 주름과 표정과 같은 고정밀 세부 사항을 갖춘 사진 수준의 현실감 있는 얼굴 이미지를 생성하며, 전통적인 형태 모델보다 뛰어난 현실감을 구현한다.
- 합성된 데이터셋 덕분에 모델은 다양한 자세, 표정, 조명 조건에 걸쳐 잘 일반화되는 것으로 나타났다.
- 코어스-투-파인 프레임워크는 최고 수준의 방법들보다 훨씬 감소된 계산 시간으로 고정밀 3D 얼굴 재구성을 달성한다.
- 모델은 단일 영상 및 단일 이미지 입력에서도 시간적 일관성과 기하학적 정확성을 유지하면서 강력한 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.