Skip to main content
QUICK REVIEW

[논문 리뷰] Full-body High-resolution Anime Generation with Progressive Structure-conditional Generative Adversarial Networks

Koichi Hamada, Kentaro Tachibana|arXiv (Cornell University)|2018. 09. 06.
Generative Adversarial Networks and Image Synthesis참고 문헌 22인용 수 8
한 줄 요약

이 논문은 훈련 중에 다중 해상도 자세 관건 지도를 점진적으로 조건화함으로써 고해상도(1024×1024) 전체 신체 애니메이션 캐릭터를 정밀한 자세 제어로 생성하는 프로그레시브 구조 조건 GAN(PSGAN)을 제안한다. 이 방법은 이전의 GAN들과 비교해 우수한 구조 일관성과 영상 품질을 달성하여 잠재 변수와 자세 시퀀스를 기반으로 제어 가능하고 고해상도의 애니메이션 생성을 가능하게 한다.

ABSTRACT

We propose Progressive Structure-conditional Generative Adversarial Networks (PSGAN), a new framework that can generate full-body and high-resolution character images based on structural information. Recent progress in generative adversarial networks with progressive training has made it possible to generate high-resolution images. However, existing approaches have limitations in achieving both high image quality and structural consistency at the same time. Our method tackles the limitations by progressively increasing the resolution of both generated images and structural conditions during training. In this paper, we empirically demonstrate the effectiveness of this method by showing the comparison with existing approaches and video generation results of diverse anime characters at 1024x1024 based on target pose sequences. We also create a novel dataset containing full-body 1024x1024 high-resolution images and exact 2D pose keypoints using Unity 3D Avatar models.

연구 동기 및 목표

  • 고해상도, 구조적으로 일관된 전체 신체 애니메이션 캐릭터를 정밀한 자세 제어로 생성하는 데 도전하는 것.
  • 기존 GAN이 캐릭터 생성 시 고해상도 영상 품질과 전반적인 구조적 정합성 모두에서 어려움을 겪는 한계를 극복하는 것.
  • 각 해상도 수준에서 자세 관건 지도를 조건화하면서 점진적으로 해상도를 높이는 훈련 프레임워크를 개발하는 것.
  • 훈련 및 평가를 위한 1024×1024 해상도의 애니메이션 이미지와 정확한 2D 자세 관건 지도 애너테이션을 포함한 새로운 대규모 데이터셋을 구축하는 것.
  • 학습된 잠재 변수를 사용해 연속적인 자세 시퀀스를 조건화함으로써 제어 가능한 애니메이션 생성을 가능하게 하는 것.

제안 방법

  • PSGAN은 다중 해상도 구조 조건을 도입함으로써 프로그레시브 GAN을 확장한다: 각 해상도 수준에서 자세 관건 지도가 다운샘플링되어 생성자와 판별자에 모두 입력된다.
  • 생성자는 각 해상도 단계에서 잠재 벡터와 자세 지도로부터 영상을 생성하고, 판별자는 동일한 자세 지도를 사용하여 현실성과 구조 일관성을 평가한다.
  • 자세 관건 지도는 유니티 3D 애자트 모델에서 직접 좌표를 추출함으로써 생성되며, 추정 오차가 없고 높은 정밀도를 보장한다.
  • 네트워크는 점진적 성장 방식으로 훈련되며, 4×4에서 시작하여 1024×1024로 점차 증가하고, 배치 크기와 초기 학습률을 점차 줄여 GPU 메모리 사용을 관리한다.
  • 훈련 안정성을 높이기 위해 n_critic=1인 WGAN-GP 손실을 사용하고, 생성자는 단계 간에 감소하는 적응형 학습률로 훈련된다.
  • 구조 조건은 관건 지점 위치에 1, 나머지 위치에 -1인 히트맵으로 표현되며, 다운샘플링은 최대池除를 통해 각 해상도 수준에서 수행된다.

실험 결과

연구 질문

  • RQ1GAN 프레임워크가 자세 조건을 사용하여 1024×1024 전체 신체 애니메이션 영상을 높은 구조 일관성과 영상 품질로 생성할 수 있는가?
  • RQ2단일 해상도 조건화에 비해 다중 해상도 자세 관건 지도를 점진적으로 조건화함으로써 구조 일관성이 향상되는가?
  • RQ3PSGAN은 프로그레시브 GAN과 PG2와 같은 기준 GAN에 비해 자세 조건 영상 생성에서 영상 품질과 구조 정확도 면에서 어떻게 비교되는가?
  • RQ4고정된 잠재 코드를 유지하면서 연속적인 자세 시퀀스를 조건화함으로써 PSGAN은 매끄럽고 제어 가능한 애니메이션을 생성할 수 있는가?
  • RQ5유니티 3D 모델에서 추출한 합성적이고 정확한 자세 관건 지도 데이터의 사용이 훈련 안정성과 생성 품질 향상에 얼마나 기여하는가?

주요 결과

  • PSGAN은 정성적 결과를 통해 고해상도의 시각적 품질이 뛰어나고 강력한 구조 일관성을 보이는 1024×1024 전체 신체 애니메이션 캐릭터 영상을 성공적으로 생성하였다.
  • 프로그레시브 GAN과 비교해 PSGAN은 전반적인 자세 구조에 더 잘 맞는 더 현실적인 영상을 생성하여 다리 등이 잘못 연결되는 아티팩트를 피하는 데 성공했다.
  • PG2보다 이미지 품질 면에서 뛰어나며, 블러링이 적고 더 세밀한 결과를 생성했다. 이는 PG2가 쌍방향 이미지 영상 번역을 요구하는 데 비해도 성능이 뛰어나다는 것을 의미한다.
  • 이 방법은 제어 가능한 애니메이션 생성을 가능하게 한다: 고정된 잠재 코드를 유지하면서 연속적인 자세 시퀀스를 입력하면 재학습 없이도 매끄러운 애니메이션이 생성된다.
  • 유니티 3D를 사용해 정확한 자세 관건 지도를 추출한 새로운 애니메이션 캐릭터 데이터셋(Avatar Anime-Character)은 향후 애니메이션 생성 연구를 위한 고품질이고 확장 가능한 자원을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.