Skip to main content
QUICK REVIEW

[논문 리뷰] Stroke Controllable Fast Style Transfer with Adaptive Receptive Fields

Yongcheng Jing, Yang Liu|arXiv (Cornell University)|2018. 02. 20.
Generative Adversarial Networks and Image Synthesis참고 문헌 37인용 수 16
한 줄 요약

이 논문은 적응형 수용장역할을 사용하고 두 가지 새로운 훈련 전략을 도입함으로써 연속적이고 공간적으로 변화하는 랜드마크 크기 제어가 가능한 빠른 스타일 전이 네트워크를 제안한다. 수용장역할과 스타일 이미지 스케일을 명시적으로 모델링함으로써, 하나의 이미지 내에서 서로 다른 영역에서 뚜렷한 랜드마크 크기를 갖는 실시간 스타일 전이를 달성하며, 품질을 희생시키지 않은 채 유연성과 효율성 면에서 이전 방법들을 능가한다.

ABSTRACT

The Fast Style Transfer methods have been recently proposed to transfer a photograph to an artistic style in real-time. This task involves controlling the stroke size in the stylized results, which remains an open challenge. In this paper, we present a stroke controllable style transfer network that can achieve continuous and spatial stroke size control. By analyzing the factors that influence the stroke size, we propose to explicitly account for the receptive field and the style image scales. We propose a StrokePyramid module to endow the network with adaptive receptive fields, and two training strategies to achieve faster convergence and augment new stroke sizes upon a trained model respectively. By combining the proposed runtime control strategies, our network can achieve continuous changes in stroke sizes and produce distinct stroke sizes in different spatial regions within the same output image.

연구 동기 및 목표

  • 빠른 스타일 전이에서 랜드마크 크기 제어의 미세 조절 부족 문제를 해결하기 위해, 특히 예술적 스타일 전이에 초점을 맞춘다.
  • 재훈련 없이도 단일 모델에서 연속적이고 공간적으로 변화하는 랜드마크 크기 제어를 가능하게 한다.
  • 훈련 효율성을 향상시키고, 훈련 후 새로운 랜드마크 크기의 점진적 학습을 가능하게 한다.
  • 수용장역할과 스타일 이미지 스케일이 스타일 전이 결과의 랜드마크 크기에 미치는 영향을 분석한다.
  • 높은 스타일 전이 품질과 속도를 유지하면서도 영리한 예술적 제어를 지원하는 통합 프레임워크를 개발한다.

제안 방법

  • 다양한 수용장역할 크기를 통해 다른 랜드마크 크기를 학습할 수 있도록 적응형 수용장역할을 갖춘 StrokePyramid 모듈을 제안한다.
  • 각 랜드마크 크기를 순차적으로 훈련함으로써 수렴 속도를 향상시키고, 브랜치 간 지식 전이를 활용하는 점진적 훈련 전략을 도입한다.
  • 기존에 훈련된 모델에서 재훈련 없이도 새로운 랜드마크 크기를 추가할 수 있도록 점진적 훈련 전략을 개발한다.
  • 런타임 제어 메커니즘을 활용하여 단일 출력 이미지 내에서 연속적인 랜드마크 크기 변화와 공간적으로 변화하는 랜드마크 크기를 가능하게 한다.
  • 스타일 전이 결과의 랜드마크 크기에 영향을 주는 핵심 요소로 수용장역할 크기와 스타일 이미지 스케일을 명시적으로 고려한다.
  • 각 브랜치가 고유한 수용장역할 구성으로 특정 랜드마크 크기를 학습하는 다중 브랜치 네트워크 아키텍처를 사용한다.

실험 결과

연구 질문

  • RQ1수용장역할 크기와 스타일 이미지 스케일이 신경 기반 스타일 전이 출력의 랜드마크 크기에 공동으로 어떤 영향을 미치는가?
  • RQ2재훈련 없이도 단일 모델이 연속적이고 공간적으로 변화하는 랜드마크 크기 제어를 달성할 수 있는가?
  • RQ3여러 랜드마크 크기를 학습할 때 수렴 속도를 어떻게 가속화할 수 있는가?
  • RQ4완전한 재훈련 없이도 훈련된 모델에 새로운 랜드마크 크기를 추가할 수 있는가?
  • RQ5적응형 수용장역할이 랜드마크 크기 제어와 스타일 전이 품질에 어떤 영향을 미치는가?

주요 결과

  • 점진적 훈련 전략은 각 랜드마크 크기를 개별적으로 훈련하는 것보다 수렴 시간을 단축시키며, 브랜치 간 지식 전이 덕분에 더 빠른 학습을 가능하게 한다.
  • 점진적 훈련 전략은 재훈련에서부터 시작하는 것에 비해 훨씬 줄어든 훈련 시간으로 새로운 랜드마크 크기를 추가할 수 있도록 한다.
  • 제안된 방법의 평균 스타일 손실은 [35]와 같은 최첨단 방법과 유사하지만, 평균 콘텐츠 손실은 略로 낮아진다.
  • 단일 NVIDIA Quadro M6000에서 1024×1024 이미지당 평균 0.09초의 실시간 추론을 달성한다.
  • 모델 크기는 단지 0.99 MB로 자원이 제한된 환경에서의 배포에 적합하다.
  • 이 방법은 단일 모델에서 연속적이고 공간적으로 랜드마크 크기 제어를 동시에 달성한 최초의 방법으로, 동일한 출력 이미지의 서로 다른 영역에서 뚜렷한 랜드마크 크기를 구현할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.