Skip to main content
QUICK REVIEW

[논문 리뷰] CelebV-HQ: A Large-Scale Video Facial Attributes Dataset

Hao Zhu, Wayne Wu|arXiv (Cornell University)|2022. 07. 25.
Face recognition and analysis인용 수 8
한 줄 요약

이 논문은 35,666개의 클립, 15,653명의 개별 인물로 구성된 대규모 고해상도 비디오 얼굴 특성 데이터셋인 CelebV-HQ를 소개한다. 각 클립은 외관, 동작, 감정의 83개의 얼굴 특성에 대해 수작업으로 주석 처리되어 있으며, 이는 비디오 생성 및 얼굴 특성 편집 작업에서 뛰어난 성능 향상을 가능하게 하여 시간적 모델링과 시공간 학습에 있어 얼굴 관련 비디오 응용 분야에서의 가치를 입증한다.

ABSTRACT

Large-scale datasets have played indispensable roles in the recent success of face generation/editing and significantly facilitated the advances of emerging research fields. However, the academic community still lacks a video dataset with diverse facial attribute annotations, which is crucial for the research on face-related videos. In this work, we propose a large-scale, high-quality, and diverse video dataset with rich facial attribute annotations, named the High-Quality Celebrity Video Dataset (CelebV-HQ). CelebV-HQ contains 35,666 video clips with the resolution of 512x512 at least, involving 15,653 identities. All clips are labeled manually with 83 facial attributes, covering appearance, action, and emotion. We conduct a comprehensive analysis in terms of age, ethnicity, brightness stability, motion smoothness, head pose diversity, and data quality to demonstrate the diversity and temporal coherence of CelebV-HQ. Besides, its versatility and potential are validated on two representative tasks, i.e., unconditional video generation and video facial attribute editing. Furthermore, we envision the future potential of CelebV-HQ, as well as the new opportunities and challenges it would bring to related research directions. Data, code, and models are publicly available. Project page: https://celebv-hq.github.io.

연구 동기 및 목표

  • 얼굴 관련 비디오 작업을 위한 풍부한 얼굴 특성 주석이 있는 대규모 고해상도 비디오 데이터셋의 부족을 보완하기 위해.
  • 스케일, 품질, 종합적인 특성 주석 처리와 관련된 비디오 데이터셋 제작 과제를 극복하기 위해.
  • 고도화된 연구를 지원하기 위해 다양하고 시간적으로 일관된 비디오 데이터셋을 제공하기 위해.
  • 무조건적 생성 및 얼굴 특성 편집과 같은 비디오 전용 작업의 벤치마킹과 발전을 가능하게 하기 위해.
  • 자연스러운 얼굴 운동과 다양한 3D 기하학적 특성을 통해 신경 렌더링 및 동적 3D 얼굴 모델링 분야의 향후 연구를 촉진하기 위해.

제안 방법

  • 다양성과 스케일 확보를 위해 8,376개의 실체와 3,717개의 동작을 포함하는 多국어 위키백과 기반 검색어를 활용해 대규모 원시 데이터 풀을 구축하였다.
  • 고해상도(최소 512×512), 정밀도, 시간적 일관성 확보를 위해 얼굴 검출 및 정렬 도구를 활용한 자동 전처리 파이프라인을 구현하였다.
  • 정확성과 효율성 확보를 위해 훈련된 주석자, 자동 판단, 품질 검사를 포함한 체계적인 주석 처리 파이프라인을 설계하였다.
  • 시간에 따라 변하지 않는 특성과 변하는 특성을 모두 포함하기 위해 특성들을 40개의 외관, 35개의 동작, 8개의 감정 특성으로 분류하였다.
  • 실제 세계의 데이터 분포를 유지하면서도 고화질과 다양성을 확보하기 위해 데이터 필터링 및 품질 제어를 적용하였다.
  • 시간 모델링 기법을 사용한 무조건적 비디오 생성 및 비디오 얼굴 특성 편집에 대한 기준 벤치마크를 통해 데이터셋의 유용성을 검증하였다.

실험 결과

연구 질문

  • RQ1풍부한 얼굴 특성 주석이 있는 대규모 고해상도 비디오 데이터셋이 비디오 생성 및 편집 작업의 성능 향상에 기여할 수 있는가?
  • RQ2CelebV-HQ의 시간적 일관성과 특성 다양성은 기존의 이미지 및 비디오 데이터셋과 비교해 어떻게 다른가?
  • RQ3비디오 생성에서 시간 모델링이 CelebV-HQ와 같은 특성 기반 주석으로부터 얼마나 많은 이점을 얻을 수 있는가?
  • RQ4세밀한 특성 주석이 포함된 대규모 비디오 데이터셋을 구축할 때 발생하는 주요 과제는 무엇이며, 이를 체계적으로 해결할 수 있는가?
  • RQ5CelebV-HQ는 신경 렌더링 및 동적 3D 얼굴 모델링 분야에서 어떤 새로운 연구 방향을 가능하게 하는가?

주요 결과

  • CelebV-HQ는 15,653명의 고유 인물로부터 유래한 35,666개의 고해상도 비디오 클립(최소 512×512)을 포함하며, 83개의 얼굴 특성에 대해 종합적인 수작업 주석이 처리되어 있다.
  • 통계 분석을 통해 연령, 민족, 밝기, 운동의 부드러움, 머리 자세, 데이터 품질 등에서 강력한 다양성이 확인되었으며, 시간적 일관성과 분포의 풍부함에서 기존의 이미지 및 비디오 데이터셋을 뛰어넘었다.
  • 기준 실험 결과, 비디오 생성에 시간 모델링을 통합할 경우 성능 향상이 이루어졌으며, 이는 시공간 동역학을 학습하는 데 데이터셋의 효과성을 입증한다.
  • CelebV-HQ를 활용한 비디오 얼굴 특성 편집 작업에서 뚜렷한 성능 향상이 관측되었으며, 이는 분리 가능하고 제어 가능한 비디오 편집에 있어 데이터셋의 유용성을 보여준다.
  • 시간 정보를 활용할 경우, 이미지 기반 기준 모델보다 우수한 성능을 기록하며 무조건적 비디오 생성 및 특성 편집 등의 작업에서 최신 기술 수준의 성능을 달성한다.
  • 자연스러운 얼굴 운동과 다양한 3D 기하학적 형태를 제공함으로써, 동적 NeRF, 가동 가능한 NeRF, 다중 모odal 얼굴 분석 분야의 향후 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.