Skip to main content
QUICK REVIEW

[논문 리뷰] AnimeDiffusion: Anime Face Line Drawing Colorization via Diffusion Models

Yu Cao, Xiangqiao Meng|arXiv (Cornell University)|2023. 03. 20.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 애니메이션 얼굴 선 그리기 색칠하기를 위한 전용으로 설계된 최초의 확산 모델인 AnimeDiffusion을 제안한다. 분류기 없는 가이던스 사전 훈련과 이미지 복원 미세조정을 결합함으로써, 새로운 고해상도 애니메이션 데이터셋에서 최신 기술 수준의 성능을 달성하며 수동 색칠 작업을 크게 줄이고, 이전의 GAN 기반 방법들을 능가한다.

ABSTRACT

It is a time-consuming and tedious work for manually colorizing anime line drawing images, which is an essential stage in cartoon animation creation pipeline. Reference-based line drawing colorization is a challenging task that relies on the precise cross-domain long-range dependency modelling between the line drawing and reference image. Existing learning methods still utilize generative adversarial networks (GANs) as one key module of their model architecture. In this paper, we propose a novel method called AnimeDiffusion using diffusion models that performs anime face line drawing colorization automatically. To the best of our knowledge, this is the first diffusion model tailored for anime content creation. In order to solve the huge training consumption problem of diffusion models, we design a hybrid training strategy, first pre-training a diffusion model with classifier-free guidance and then fine-tuning it with image reconstruction guidance. We find that with a few iterations of fine-tuning, the model shows wonderful colorization performance, as illustrated in Fig. 1. For training AnimeDiffusion, we conduct an anime face line drawing colorization benchmark dataset, which contains 31696 training data and 579 testing data. We hope this dataset can fill the gap of no available high resolution anime face dataset for colorization method evaluation. Through multiple quantitative metrics evaluated on our dataset and a user study, we demonstrate AnimeDiffusion outperforms state-of-the-art GANs-based models for anime face line drawing colorization. We also collaborate with professional artists to test and apply our AnimeDiffusion for their creation work. We release our code on https://github.com/xq-meng/AnimeDiffusion.

연구 동기 및 목표

  • 애니메이션 제작 파이프라인에서 애니메이션 선 그림의 수작업 색칠 작업이 시간과 노력이 많이 들기 때문에 이를 해결하고자 한다.
  • 기존의 GAN 기반 방법들이 선 그림과 기준 이미지 간의 장거리 다중 도메인 간 의존성을 모델링하는 데 한계가 있음을 극복하고자 한다.
  • 확산 아키텍처가 아직 탐색하지 않은 도메인인 애니메이션 콘텐츠 제작을 위한 특화된 확산 모델을 개발하고자 한다.
  • 향후 연구를 지원하기 위해 고해상도 애니메이션 얼굴 선 그림 색칠을 위한 벤치마크 데이터셋을 구축하고자 한다.
  • 이 특정 예술적 이미지 생성 작업에서 확산 모델이 GAN보다 실현 가능하고 우수한 성능을 보임을 입증하고자 한다.

제안 방법

  • 하이브리드 훈련 전략을 적용한다: 먼저 분류기 없는 가이던스를 사용해 일반적인 색칠 사전 지식을 학습하는 확산 모델을 사전 훈련한다.
  • 사전 훈련된 모델은 이미지 복원 가이던스를 사용해 특정 애니메이션 얼굴 색칠 작업에 맞게 미세조정된다.
  • 모델은 선 그림과 기준 이미지를 입력으로 받아 장거리 도메인 간 의존성을 모델링하는 색칠된 출력을 생성한다.
  • 모델은 고해상도 애니메이션 얼굴 31,696개의 훈련 샘플과 579개의 테스트 샘플로 구성된 새로 구축한 데이터셋을 엔드 투 엔드로 훈련한다.
  • 분류기 없는 가이던스는 별도의 판별기 없이 조건부 생성을 가능하게 하여 훈련 안정성과 샘플 품질을 향상시킨다.
  • 성능을 검증하기 위해 다수의 정량적 지표와 사용자 연구를 평가에 활용한다.

실험 결과

연구 질문

  • RQ1기존에 GAN이 지배하던 작업인 애니메이션 얼굴 선 그림 색칠에 대해 확산 모델이 효과적으로 적용될 수 있는가?
  • RQ2분류기 없는 가이던스를 사용한 사전 훈련과 복원 손실을 사용한 미세조정을 조합한 하이브리드 훈련 전략이 기존의 표준 GAN 기반 접근 방식보다 더 나은 성능을 낼 수 있는가?
  • RQ3새로운 고해상도 애니메이션 얼굴 데이터셋이 색칠 모델의 평가 및 벤치마크 향상에 기여할 수 있는가?
  • RQ4제안된 확산 모델의 성능이 정량적 지표와 인간 평가 모두에서 최신 기술 수준의 GAN 기반 모델과 비교해 어떻게 되는가?
  • RQ5전문 예술가들의 검증을 통해 모델이 실제 애니메이션 워크플로우에서 실용적으로 유용한가?

주요 결과

  • AnimeDiffusion는 정량적 지표와 사용자 연구 모두에서 최신 기술 수준의 GAN 기반 모델을 능가하며, 뛰어난 색칠 품질을 입증한다.
  • 사전 훈련 후 몇 차례의 미세조정만으로도 뛰어난 성능을 달성하여 목표 작업에 대한 효율적인 적응 능력을 보인다.
  • 제안된 하이브리드 훈련 전략은 생성 품질과 훈련 효율성을 효과적으로 균형 잡아, 전체 확산 훈련 대비 계산 비용을 줄였다.
  • 31,696개의 훈련 샘플과 579개의 테스트 샘플로 구성된 새로운 벤치마크 데이터셋은 고해상도 애니메이션 얼굴 데이터 평가의 핵심적인 격차를 메운다.
  • 전문 예술가들이 모델의 실용적 유용성을 확인하여 애니메이션 제작 파이프라인에서의 실제 적용 가능성을 검증했다.
  • 결과적으로 확산 모델이 애니메이션 전용 색칠 작업에 대해 유망할 뿐 아니라, GAN의 지배를 뛰어넘는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.