Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Chinese Landscape Painting Creation Using Generative Adversarial Networks

Alice Xue|arXiv (Cornell University)|2020. 11. 11.
Generative Adversarial Networks and Image Synthesis참고 문헌 32인용 수 13
한 줄 요약

이 논문은 조건 입력 없이 잠재 노이즈에서 고품질의 원본 중국 풍경화를 생성하는 최초의 엔드 투 엔드 생성적 적대적 네트워크인 Sketch-And-Paint GAN(SAPGAN)을 소개한다. 이는 두 단계 과정을 통해 작동하며, 먼저 SketchGAN이 엣지 맵을 생성하고, 그 다음 PaintGAN이 엣지 맵을 완전한 그림으로 번역한다. 시각적 튜링 테스트에서 인간이 55%의 비율로 생성된 그림을 인간이 그린 것으로 오인했으며, 이는 기준 모델보다 유의미하게 뛰어난 성능을 보였다.

ABSTRACT

Current GAN-based art generation methods produce unoriginal artwork due to their dependence on conditional input. Here, we propose Sketch-And-Paint GAN (SAPGAN), the first model which generates Chinese landscape paintings from end to end, without conditional input. SAPGAN is composed of two GANs: SketchGAN for generation of edge maps, and PaintGAN for subsequent edge-to-painting translation. Our model is trained on a new dataset of traditional Chinese landscape paintings never before used for generative research. A 242-person Visual Turing Test study reveals that SAPGAN paintings are mistaken as human artwork with 55% frequency, significantly outperforming paintings from baseline GANs. Our work lays a groundwork for truly machine-original art generation.

연구 동기 및 목표

  • 조건 입력 없이 원본 중국 풍경화를 생성하는 엔드 투 엔드, 조건 입력이 없는 GAN 모델의 부족을 보완하기 위해.
  • 기본적인 중국 풍경화의 고해상도, 고정밀도, 문화적으로 정확한 데이터셋을 구축하여 생성 연구에 활용하기 위해.
  • 인간 예술가가 스케치를 먼저 한 다음 페인팅하는 과정을 모방하는 프레임워크를 개발하기 위해.
  • 대규모 시각적 튜링 테스트를 통해 생성된 그림의 현실성과 독창성을 평가하기 위해.
  • 기계로 생성된 예술이 대규모로 인간이 그린 것으로 인식될 수 있음을 입증하여, 원본 AI 예술 생성의 최전선을 넓히기 위해.

제안 방법

  • SAPGAN은 두 단계 GAN 프레임워크로 구성된다: SketchGAN은 임의의 잠재 벡터에서 엣지 맵을 생성하고, PaintGAN은 조건부 엣지-이미지 번역을 수행하여 최종 그림을 생성한다.
  • SketchGAN은 새로 구축한 2,192장의 고해상도 전통 중국 풍경화에서 추출한 엣지 맵을 기반으로 훈련된다.
  • PaintGAN은 쌍으로 구성된 엣지 맵과 해당하는 그림을 사용하여 이미지 간 번역을 학습하며, 최종 그림의 해상도는 512×512로 설정된다.
  • 모델은 표준 GAN 손실을 사용하여 훈련되며, 진짜/가짜 식별의 최소 최대화를 목표로 하며, 생성자는 판별자를 속이려는 목표를 가진다.
  • 이 프레임워크는 인간이 제공한 스케치나 이미지에 의존하지 않고, 잠재공간에서부터 엔드 투 엔드 생성을 가능하게 한다.
  • 잠재공간 내부의 보간과 최근접 이웃 분석을 통해 기억의 초월, 다양성 및 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1조건 입력(예: 스케치 또는 사진)이 없는 GAN이 고품질의 원본 중국 풍경화를 생성할 수 있는가?
  • RQ2기계로 생성된 중국 풍경화가 인간 평가자에게 얼마나 자주 인간이 그린 것으로 오인되는가?
  • RQ3제안된 두 단계의 Sketch-And-Paint GAN 프레임워크가 기준 모델보다 더 일관되고 현실적인 그림을 생성하는가?
  • RQ4모델은 훈련 데이터에 과적합되거나 기억하는 것을 피하고, 새로운 콘텐츠에 얼마나 잘 일반화되는가?
  • RQ5모델의 잠재공간이 서로 다른 그림들 사이에서 의미 있고, 구조적으로 일관된 보간을 생성할 수 있는가?

주요 결과

  • 242명의 참가자가 참여한 시각적 튜링 테스트에서 SAPGAN가 생성한 그림들이 55%의 비율로 인간이 그린 것으로 오인되었으며, 이는 기준 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • 중국어 사용자들은 더욱 오인당했으며, SAPGAN 출력물이 인간 예술로 오인된 비율이 70%에 달했으며, 이는 문화적 친밀도가 인식된 진정성에 영향을 주지 않는다는 것을 시사한다.
  • 모델은 기준 모델의 11%보다 높은 55%의 인간 오인율을 기록했으며, p값 < 0.0001로 통계적으로 유의미한 결과를 보였다.
  • 최근접 이웃 분석 결과, SAPGAN 출력물은 훈련 데이터에서 크게 벗어나 있어, 비교적 작은 데이터셋임에도 과적합에 대한 강건성을 보였다.
  • 잠재공간 보간(잠재 보행) 결과, 보간 단계 전반에 걸쳐 일관되고 구조적으로 유의미한 풍경 구조가 유지되었으며, 이는 잠재공간과 생성 과정의 품질을 확인하는 데 기여했다.
  • 정성 평가에서 SAPGAN 그림는 기준 모델 대비 미적 감각, 구성, 명료성, 창의성 측면에서 유의미하게 높은 점수를 받았으며, 모든 p값 < 0.0001이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.