[논문 리뷰] Learning from Multi-domain Artistic Images for Arbitrary Style Transfer
이 논문은 다중 도메인 예술 이미지에서 적대적 훈련을 사용하여 임의의 스타일 전이를 위한 빠른 피드포워드 신경망을 제안한다. 조건부 생성자와 조건부 판별자, 학습 가능한 마스크 모듈을 조합함으로써, 새로운 컨텐츠-스타일 쌍에 대해 고품질이고 다양한 스타일 전이 결과를 도출하고, 대표적인 스타일 전이 이미지의 자동 순위 매기기를 가능하게 한다.
We propose a fast feed-forward network for arbitrary style transfer, which can generate stylized image for previously unseen content and style image pairs. Besides the traditional content and style representation based on deep features and statistics for textures, we use adversarial networks to regularize the generation of stylized images. Our adversarial network learns the intrinsic property of image styles from large-scale multi-domain artistic images. The adversarial training is challenging because both the input and output of our generator are diverse multi-domain images. We use a conditional generator that stylized content by shifting the statistics of deep features, and a conditional discriminator based on the coarse category of styles. Moreover, we propose a mask module to spatially decide the stylization level and stabilize adversarial training by avoiding mode collapse. As a side effect, our trained discriminator can be applied to rank and select representative stylized images. We qualitatively and quantitatively evaluate the proposed method, and compare with recent style transfer methods. We release our code and model at https://github.com/nightldj/behance_release.
연구 동기 및 목표
- 비교적 빠른 피드포워드 신경망을 개발하여, 사전에 보지 못한 컨텐츠 이미지와 스타일 이미지 쌍에 일반화할 수 있도록 한다.
- 다양한 예술 이미지 도메인에서의 적대적 훈련을 활용하여 스타일 전이 품질을 향상시킨다.
- 입력(컨텐츠)과 출력(스타일)이 모두 다양한 도메인에서 온 경우의 다중 도메인 적대적 훈련 문제를 해결한다.
- 훈련된 판별자를 활용하여 각 스타일 카테고리별로 대표적인 스타일 전이 이미지를 자동으로 선별하고 순위를 매긴다.
- 동일한 아키텍처를 사용하여 디스타일리제이션과 사진처럼 사실적인 스타일 전이 기능을 확장한다.
제안 방법
- 스타일 이미지의 특징 통계를 컨텐츠 이미지로 이동시켜 스타일 전이를 수행하기 위해 적응형 인스턴스 정규화(AdaIN) 기반의 조건부 생성자를 사용한다.
- 거친 스타일 카테고리에서 훈련된 조건부 판별자를 활용하여 진짜 이미지와 생성된 이미지를 구분함으로써, 적대적 훈련을 안정화시킨다.
- 공간적으로 스타일 전이 수준을 제어하는 학습 가능한 마스크 모듈을 도입하여, 컨텐츠와 스타일 전이 특징을 혼합함으로써 잡음과 모드 붕괴를 줄인다.
- 조건부 판별자로부터의 적대적 손실과 함께, 깊이 있는 특징과 그람 행렬을 통한 컨텐츠 및 스타일 재구성 손실을 조합하여 생성자를 훈련시킨다.
- 훈련된 판별자를 스타일 분류기로 활용하여, 각 스타일 카테고리별로 고품질이며 대표적인 스타일 전이 이미지를 순위 매기고 선별한다.
- 다양한 도메인(예: 만화, 유화, 수채화, 벡터 아트 등)을 포함하는 대규모이고 다양한 예술 이미지 데이터셋에서 훈련한다.
실험 결과
연구 질문
- RQ1적대적 훈련은 컨텐츠 및 스타일 재구성 손실을 넘어서 시각적 품질과 다양성을 향상시킬 수 있는가?
- RQ2입력(컨텐츠)과 출력(스타일) 이미지가 모두 다수의 다양한 도메인에서 올 경우, 적대적 훈련을 어떻게 안정화할 수 있는가?
- RQ3한 번의 훈련된 생성자 네트워크가 여러 예술 도메인에 걸쳐 새로운 컨텐츠와 스타일 이미지 쌍에 일반화될 수 있는가?
- RQ4훈련된 판별자를 재사용하여 각 스타일 카테고리에서 가장 대표적인 스타일 전이 이미지를 순위 매기고 식별할 수 있는가?
- RQ5동일한 아키텍처가 예술 이미지에서만 훈련되었음에도 불구하고, 사진처럼 사실적인 이미지에서의 스타일 전이와 디스타일리제이션을 수행할 수 있는가?
주요 결과
- 기존 방법과 비교해 본 논문에서 제안한 방법은 배경 세부 정보 유지 및 잡음 감소 측면에서 더 뛰어난 시각적 품질과 다양성을 확보한다.
- 다양한 예술 이미지 도메인에서 훈련된 판별자는 스타일 전이 이미지를 성공적으로 순위 매겼으며, 사용자 연구 결과 기준 강력한 베이스라인 분류기 대비 선호 비율 0.5068를 기록했다.
- 텍스처가 풍부한 스타일 이미지를 포함한 표준 스타일 전이 벤치마크에서 잘 일반화되며, 최신 기술 대비 결과가 유사하거나 더 우수하다.
- 동일한 아키텍처를 사용하여 디스타일리제이션을 수행할 수 있으며, 예술 이미지에서만 훈련되었음에도 불구하고 베이스라인 대비 더 사실적인 이미지를 생성한다.
- 마스크 모듈은 적대적 훈련을 효과적으로 안정화시키며, 스타일 전이의 공간적 제어를 가능하게 하여 모드 붕괴를 줄이고 특징 혼합을 향상시킨다.
- qualitative 결과를 통해 모델이 사진처럼 사실적인 스타일 전이로의 이식 가능성도 입증되었으며, 실제 이미지에서의 스타일 전이를 성공적으로 수행한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.