Skip to main content
QUICK REVIEW

[논문 리뷰] FNeVR: Neural Volume Rendering for Face Animation

Bohan Zeng, Boyu Liu|arXiv (Cornell University)|2022. 09. 21.
Face recognition and analysis인용 수 12
한 줄 요약

FNeVR는 정확한 표정 전달을 위한 2D 운동 왜곡과 고해상도 얼굴 세부 정보 합성을 위한 3D 볼륨 렌더링을 통합한 통합 신경 볼륨 렌더링 프레임워크를 제안한다. 정사영 적응 사선 샘플링을 갖춘 3D 얼굴 볼륨 렌더링(FVR) 모듈과 오일러 각도를 사용하는 경량 자세 편집기 도입으로, 표준 벤치마크에서 우수한 세부 정보 유지 및 효율성을 바탕으로 사진 수준의 현실감 있는 얼굴 애니메이션 분야에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Face animation, one of the hottest topics in computer vision, has achieved a promising performance with the help of generative models. However, it remains a critical challenge to generate identity preserving and photo-realistic images due to the sophisticated motion deformation and complex facial detail modeling. To address these problems, we propose a Face Neural Volume Rendering (FNeVR) network to fully explore the potential of 2D motion warping and 3D volume rendering in a unified framework. In FNeVR, we design a 3D Face Volume Rendering (FVR) module to enhance the facial details for image rendering. Specifically, we first extract 3D information with a well-designed architecture, and then introduce an orthogonal adaptive ray-sampling module for efficient rendering. We also design a lightweight pose editor, enabling FNeVR to edit the facial pose in a simple yet effective way. Extensive experiments show that our FNeVR obtains the best overall quality and performance on widely used talking-head benchmarks.

연구 동기 및 목표

  • 복잡한 변형과 세밀한 얼굴 모델링 조건에서 신원을 유지하면서 사진 수준의 현실감 있는 얼굴 애니메이션을 생성하는 도전 과제를 해결하기 위해.
  • 2D 운동 왜곡의 강점(정확한 표정 전달)과 3D 볼륨 렌더링의 강점(고해상도 세부 정보 합성)을 하나의 프레임워크에서 통합하기 위해.
  • 학습 중에만 3D 복원을 감독으로 사용하고 추론 시에는 3D 복원을 사용하지 않음으로써 계산 오버헤드를 줄이기 위해.
  • 오직 오일러 각도만을 입력으로 사용하여 단순하고 효과적인 얼굴 자세 편집을 가능하게 하기 위해.

제안 방법

  • 2D 왜곡 특징에서 3D 색상 및 형상 특징을 추출하기 위해 두 개의 CNN을 사용하는 3D 얼굴 볼륨 렌더링(FVR) 모듈을 도입하며, 이는 3D 복원 결과에 의해 안내된다.
  • 단일 MLP를 직접 3D 특징에 처리하여 계층적 샘플링을 회피함으로써 효율성을 높이는 정사영 적응 사선 샘플링 모듈을 활용한다.
  • 렌더링된 특징 맵의 품질을 향상시키고 현실감을 높이기 위해 지각 손실을 적용한다.
  • 오일러 각도를 입력으로 받아 직접적이고 효율적인 얼굴 자세 편집을 가능하게 하는 경량 자세 편집기(LPE)를 설계한다.
  • 학습 중에 신뢰할 수 있는 3D 형상 정보가 학습되도록 보장하기 위해 3D 감독 손실($\mathcal{L}_{\sigma}$)을 사용한다.
  • 2D 왜곡 기반 얼굴 애니메이션 파이프라인에 FVR 모듈을 통합하여, 운동 전달을 위한 2D 왜곡과 세부 정보 향상을 위한 3D 렌더링을 결합한다.

실험 결과

연구 질문

  • RQ1통합 프레임워크는 2D 운동 왜곡과 3D 볼륨 렌더링을 효과적으로 융합하여 얼굴 애니메이션의 운동 정확도와 영상 현실감을 향상시킬 수 있는가?
  • RQ23D 형상 감독는 추론 비용 없이 학습 중에 어떻게 활용될 수 있는가?
  • RQ3오직 오일러 각도만을 입력으로 사용하는 단순한 자세 편집 모듈이 효과적이고 제어 가능한 얼굴 재정렬을 달성할 수 있는가?
  • RQ43D 특징 학습과 사선 샘플링 설계는 얼굴 세부 정보 품질에 어떤 기여를 하는가?
  • RQ5실제 성능, 신원 유지, 계산 효율성 측면에서 제안된 FNeVR은 최신 기술 수준(SOTA) 방법보다 어떻게 비교되는가?

주요 결과

  • FNeVR는 표준 대화형 헤드 벤치마크에서 최고의 종합 성능을 달성하여, 동일 신원 및 교차 신원 얼굴 애니메이션 작업 모두에서 최신 기술 수준(SOTA) 방법을 능가한다.
  • VoxCeleb 테스트 세트에서 FNeVR은 FID 8.443을 기록하여 기준 모델인 FOMM(11.56)과 Face vid2vid-S(9.024)보다 유의미하게 낮아, 뛰어난 영상 품질과 다양성을 나타낸다.
  • 제거 실험 결과 $F_w$ 또는 $\mathcal{L}_\sigma$를 제거할 경우 성능 저하가 발생함을 확인하여, 세부 정보 유지에 있어 운동 특징 입력과 3D 감독의 필수성을 입증한다.
  • qualitative 시각화 결과에 따르면 LPE 모듈은 오일러 각도를 기반으로 실제적인 얼굴 회전을 성공적으로 생성하여 효과적이고 직관적인 자세 편집을 가능하게 한다.
  • FNeVR는 Face vid2vid-S보다 훨씬 낮은 FLOPs와 파라미터를 기록하여 뛰어난 계산 효율성을 입증한다.
  • 정사영 적응 사선 샘플링을 갖춘 FVR 모듈은 효율적인 렌더링을 가능하게 하며, 기준 2D 왜곡 및 3D 기반 방법 대비 향상된 얼굴 세부 정보 품질 기여를 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.