Skip to main content
QUICK REVIEW

[논문 리뷰] PAniC-3D: Stylized Single-view 3D Reconstruction from Portraits of Anime Characters

Shuhong Chen, Kevin Zhang|arXiv (Cornell University)|2023. 03. 25.
Advanced Vision and Imaging인용 수 4
한 줄 요약

PAniC-3D는 선 기반 포트레이트 일러스트에서 애니메이션 캐릭터의 스타일리시한 단일 시점 3D 재구성에 대한 새로운 시스템을 제안한다. 선 채우기 모델을 통해 일러스트에서 3D로의 도메인 갭을 해소하고, 고해상도 기하학적 구조와 텍스처를 위한 부피형 렌디언스 필드를 사용한다. 새로운 AnimeRecon 벤치마크에서 최신 기술 수준의 성능을 달성하여, 인지적 및 기하학적 충실도 측면에서 기존 기준들보다 뚜렷이 뛰어나다.

ABSTRACT

We propose PAniC-3D, a system to reconstruct stylized 3D character heads directly from illustrated (p)ortraits of (ani)me (c)haracters. Our anime-style domain poses unique challenges to single-view reconstruction; compared to natural images of human heads, character portrait illustrations have hair and accessories with more complex and diverse geometry, and are shaded with non-photorealistic contour lines. In addition, there is a lack of both 3D model and portrait illustration data suitable to train and evaluate this ambiguous stylized reconstruction task. Facing these challenges, our proposed PAniC-3D architecture crosses the illustration-to-3D domain gap with a line-filling model, and represents sophisticated geometries with a volumetric radiance field. We train our system with two large new datasets (11.2k Vroid 3D models, 1k Vtuber portrait illustrations), and evaluate on a novel AnimeRecon benchmark of illustration-to-3D pairs. PAniC-3D significantly outperforms baseline methods, and provides data to establish the task of stylized reconstruction from portrait illustrations.

연구 동기 및 목표

  • 단일 선 기반 포트레이트 일러스트에서 스타일리시한 3D 애니메이션 캐릭터 헤드를 재구성하는 데 도전하는 것. 이는 모호하고 사진처럼 사실적인 조명이 없는 특징을 가진다.
  • 스타일리시한 일러스트와 3D 렌더링 사이의 도메인 갭을 해소하는 것. 특히 비사진적 윤곽선과 머리카락, 액세서리 등 복잡한 기하학적 구조로 인해 어려움이 있다.
  • 일러스트와 3D 데이터가 짝지어지지 않은 상황에서, 애니메이션 도메인 내에서 스타일리시한 단일 시점 3D 재구성에 대한 새로운 벤치마크와 데이터셋을 구축하는 것.
  • 다중 시점 감독 없이 2D 일러스트에서 직접 고품질의 텍스처가 구현된 3D 렌디언스 필드를 생성하는 종량형이고 견고한 종단 간 시스템을 개발하는 것.
  • 아티스트가 제작한 포트레이트에서 수동 3D 모델링에 의존하지 않고 자동으로 고해상도 3D 아바타를 생성할 수 있도록 하는 것.

제안 방법

  • 시스템은 다중 시점 3D 렌더링에서 2.5차원 감독을 통해 재구성에 적합하게 조정된 EG3D 기반의 조건부 생성 프레임워크를 사용한다.
  • 선 기반 일러스트를 깔끔하고 렌더링된 이미지처럼 보이게 하는 새로운 선 채우기 모델을 훈련시켜 윤곽선을 제거하면서도 얼굴 정체성과 구조를 유지한다.
  • 삼면체 표현 방식을 사용하며, 삼면체 축을 따라 다층 특징 융합과 특징 풀링을 적용해 기하학적 세부 사항과 모호함 해소를 향상시킨다.
  • 고정된 측면/뒷면 감독 신호를 적용해 기하학적 일관성을 향상시키고, 가려진 영역에서의 잡음과 오류를 줄인다.
  • 픽셀 수준과 의미 수준의 충실도를 최적화하기 위해 L1, LPIPS, CLIP 기반 손실을 조합하여 사용한다.
  • 시스템은 1,000장의 전면 시점, 중립 표정의 포트레이트 일러스트로 구성된 새로운 Vtuber 데이터셋과, 다중 시점 렌더링가 포함된 11,200개의 3D 캐릭터 모델로 구성된 Vroid 데이터셋에서 훈련된다.
Figure 1 : Overview of contributions. Our (A) PAniC-3D system is able to reconstruct a 3D radiance field directly from a line-based portrait illustration. We gather a new (B) Vtuber illustration dataset and (C) Vroid 3D models dataset in order to cross the illustration-render domain gap and supervis
Figure 1 : Overview of contributions. Our (A) PAniC-3D system is able to reconstruct a 3D radiance field directly from a line-based portrait illustration. We gather a new (B) Vtuber illustration dataset and (C) Vroid 3D models dataset in order to cross the illustration-render domain gap and supervis

실험 결과

연구 질문

  • RQ1단일 선 기반 포트레이트 일러스트로 애니메이션 캐릭터의 고해상도 스타일리시한 3D 렌디언스 필드를 재구성할 수 있는가?
  • RQ2스타일리시한 일러스트와 3D 렌더링 사이의 도메인 갭을 효과적으로 해소하여 재구성 품질을 향상시킬 수 있는가?
  • RQ3스타일리시한 3D 재구성에서 복잡한 기하학적 구조와 정체성을 유지하는 데 가장 효과적인 아키텍처 구성 요소는 무엇인가?
  • RQ4선 제거 모델이 일러스트에서의 후속 3D 재구성 품질을 얼마나 향상시킬 수 있는가?
  • RQ5제안된 시스템은 기존의 암시적 재구성 및 이미지 간 번역 기준과 비교해 정량적·정성적으로 어떻게 성능을 내는가?

주요 결과

  • PAniC-3D는 AnimeRecon 벤치마크에서 LPIPS 점수 18.26을 기록하여, Telea(23.91)와 CycleGAN(21.39)과 같은 기준 방법들을 뚜렷이 앞서간다.
  • 시스템은 CLIP 점수 94.97을 기록하여 강력한 의미적 및 정체성 유지 능력을 보이며, UGATIT(85.48)와 CycleGAN(93.81)을 초월한다.
  • 고정된 측면/뒷면 감독 신호의 추가로 기하학적 및 텍스처 충실도가 향상되어 어깨 부위의 추가 윤곽선과 밴딩 현상 등의 잡음이 감소한다.
  • 단절 실험을 통해 특징 풀링과 다층 삼면체 특징가 기하학적 세부 사항 향상과 특징의 모호함 해소에 기여하는 것으로 확인되었다.
  • 선 채우기 모델은 비사진적 윤곽선을 효과적으로 제거하면서도 얼굴 구조를 유지하며, 정체성 유지 측면에서 단순 인painting 및 상용 GAN보다 뛰어난 성능을 보였다.
  • 강력한 성능에도 불구하고, 가려진 영역과 귀 접합부에서 실제 3D 자산 수준의 재현 품질에 미치지 못하는 점이 확인되어, 개체 중심 또는 부품 인식 기반 생성 기법의 향상 여지가 있다.
Figure 2 : (a) No-line diffuse render, (b) real-lined illustration, (c) Blender Freestyle [ 14 ] , (d) RTSC suggestive contours [ 9 ] . Toon shaders over-draw (c, cheeks) or miss lines (d, bowtie); it is non-trivial to model the artistic line placement in real drawings (b). Thus, we train our Illust
Figure 2 : (a) No-line diffuse render, (b) real-lined illustration, (c) Blender Freestyle [ 14 ] , (d) RTSC suggestive contours [ 9 ] . Toon shaders over-draw (c, cheeks) or miss lines (d, bowtie); it is non-trivial to model the artistic line placement in real drawings (b). Thus, we train our Illust

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.