[논문 리뷰] MVF-Net: Multi-View 3D Face Morphable Model Regression
이 논문은 다중 시야 얼굴 영상에서 기하학적 일관성을 활용하여 3D 모형화 모델(3DMM) 파라미터를 직접 회귀하는 엔드 투 엔드 딥 러닝 프레임워크인 MVF-Net을 제안한다. 다층 광학 흐름 추정기를 사용한 미분 가능 시야 정렬 손실을 도입하여 영상 간 재투영 오차를 최소화함으로써, 조명 변화나 모호한 기하학적 구조 조건에서도 단시야 방법보다 훨씬 높은 3D 얼굴 재구성 정확도를 달성한다.
We address the problem of recovering the 3D geometry of a human face from a set of facial images in multiple views. While recent studies have shown impressive progress in 3D Morphable Model (3DMM) based facial reconstruction, the settings are mostly restricted to a single view. There is an inherent drawback in the single-view setting: the lack of reliable 3D constraints can cause unresolvable ambiguities. We in this paper explore 3DMM-based shape recovery in a different setting, where a set of multi-view facial images are given as input. A novel approach is proposed to regress 3DMM parameters from multi-view inputs with an end-to-end trainable Convolutional Neural Network (CNN). Multiview geometric constraints are incorporated into the network by establishing dense correspondences between different views leveraging a novel self-supervised view alignment loss. The main ingredient of the view alignment loss is a differentiable dense optical flow estimator that can backpropagate the alignment errors between an input view and a synthetic rendering from another input view, which is projected to the target view through the 3D shape to be inferred. Through minimizing the view alignment loss, better 3D shapes can be recovered such that the synthetic projections from one view to another can better align with the observed image. Extensive experiments demonstrate the superiority of the proposed method over other 3DMM methods.
연구 동기 및 목표
- 단일 시야 3D 얼굴 재구성에서 3D 제약 조건이 부족해 발생하는 본질적 모호성 문제를 해결하기 위해.
- 엔드 투 엔드 학습 가능한 프레임워크 내에서 다중 시야 기하학적 제약 조건을 통합하여 3DMM 기반 재구성 성능을 향상시키기 위해.
- SfM/MVS 파ip라인에서 유도된 노이즈가 많은 초기 3D 재구성에 대한 의존도를 줄이기 위해 다중 시야 입력에서 직접 3DMM 파라미터를 회귀시키기 위해.
- 미분 가능 정렬 손실을 통해 시야 간 조명 변화에 대한 강건성을 향상시키기 위해.
- 반복 최적화 없이 딥 러닝 기반으로만 상태 최신 성능을 달성하기 위해.
제안 방법
- 이 방법은 다중 시야 얼굴 영상에서 직접 3DMM 형태 및 표정 파라미터를 회귀하기 위해 CNN을 사용한다.
- 관측된 영상과 예측된 3D 형상 및 카메라 자세에서 렌더링된 합성 영상 간의 광학적 재투영 오차를 비교하는 광학적 재투영 손실을 도입한다.
- 관측 영상과 렌더링된 영상 간의 정렬 오차를 계산하기 위해 새로운 미분 가능한 밀도 광학 흐름 추정기를 제안하며, 이를 통해 기하학적 일관성의 역전파가 가능해진다.
- 시야 정렬 손실은 예측된 3D 형상에 기반해 한 시야의 렌더링 영상을 다른 시야로 투영한 후, 목표 시야의 관측 영상와 비교하여 계산된다.
- 전체 네트워크는 3DMM 파라미터 회귀와 미분 가능한 렌더링 및 흐름 추정을 통한 기하학적 일관성 강화를 결합한 엔드 투 엔드 학습 가능한 구조이다.
- 3DMM에서 유도된 강력한 3D 얼굴 사전 지식을 활용하면서도, 다중 시야 제약 조건을 통해 깊이의 모호성을 해소한다.
실험 결과
연구 질문
- RQ1다중 시야 기하학적 제약 조건이 3D 얼굴 재구성에 대한 딥 러닝 프레임워크에 효과적으로 통합될 수 있는가?
- RQ2표준 광학적 손실 대비 광학 흐름 기반 정렬 손실이 3DMM 파라미터 회귀 성능을 향상시키는가?
- RQ3시야 간 조명 조건이 일관되지 않을 경우 제안된 방법의 성능은 어떠한가?
- RQ4다중 시야 감독을 통한 엔드 투 엔드 학습이 단일 시야 3DMM 회귀 방법을 능가하는가?
- RQ5시야 정렬 손실이 학습 중 局부 최소값에 대한 민감도를 어느 정도 감소시키는가?
주요 결과
- 제안된 방법은 MICC 데이터셋에서 평균 평면 간 거리 오차가 1.220 mm로, MoFA 및 Tran et al. [35]를 포함한 모든 단시야 기준선보다 뛰어난 성능을 달성하였다.
- 시야 정렬 손실을 추가함으로써, 조명 조건이 일관되지 않을 경우 광학적 손실만을 사용한 경우 대비 재구성 오차가 11.5% 감소하였다.
- 시각적 비교 결과, MVF-Net은 특히 코와 턱뼈와 같은 단일 시야 설정에서 모호성이 높은 영역에서 더 정확한 얼굴 기하학적 구조와 표정을 재현하였다.
- 광학적 손실과 정렬 손실을 모두 사용해 훈련한 모델은 조명 변화에 더 잘 일반화되었으며, 그림 8에서 볼 수 있듯이 정렬 손실이 없는 경우 성능 저하가 심각하게 나타났다.
- 제거 실험을 통해 미분 가능한 광학 흐름 추정기가 정렬 오차를 효과적으로 역전파하여 수렴성과 형태 정확도를 향상시킨다는 것이 확인되었다.
- MCC 데이터셋에서 평균, 풀드, 가중 평균 예측 설정을 포함한 모든 평가 환경에서 최신 기술 수준의 성능을 달성하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.