Skip to main content
QUICK REVIEW

[논문 리뷰] Auto-Encoder Guided GAN for Chinese Calligraphy Synthesis

Pengyuan Lyu, Xiang Bai|arXiv (Cornell University)|2017. 06. 27.
Handwritten Text Recognition Techniques인용 수 12
한 줄 요약

이 논문은 표준 글꼴(헤이) 이미지를 직접 스타일화된 서예로 변환하는 엔드 투 엔드 중국 서예 합성용 자동에코더 유도 GAN을 제안한다. 스트로크 추출 없이도 구현된다. 스타일 전이 인코더-디코더 네트워크와 저수준 스트로크 특징을 유도하는 지도형 자동에코더를 조합함으로써, 네 가지 스타일로 구성된 새로 구축한 28,000장의 서예 이미지 벤치마크에서 최신 기술 수준의 현실성과 세부 사항 충실도를 달성한다.

ABSTRACT

In this paper, we investigate the Chinese calligraphy synthesis problem: synthesizing Chinese calligraphy images with specified style from standard font(eg. Hei font) images (Fig. 1(a)). Recent works mostly follow the stroke extraction and assemble pipeline which is complex in the process and limited by the effect of stroke extraction. We treat the calligraphy synthesis problem as an image-to-image translation problem and propose a deep neural network based model which can generate calligraphy images from standard font images directly. Besides, we also construct a large scale benchmark that contains various styles for Chinese calligraphy synthesis. We evaluate our method as well as some baseline methods on the proposed dataset, and the experimental results demonstrate the effectiveness of our proposed model.

연구 동기 및 목표

  • 복잡하거나 캐리커처체 문자에서 불완전한 스트로크 추출에 의존하는 스트로크 기반 서예 합성 방법의 한계를 해결하기 위해.
  • 중국 서예 합성을 스트로크 추출 없이도 직접 표준 글꼴에서 스타일화된 서예로의 이미지 간 번역 문제로 간주하여, 직접 생성을 가능하게 하기 위해.
  • 전반적인 문자 레이아웃을 유지하면서도 세밀한 스트로크 스타일과 변형을 학습할 수 있는 딥 생성 모델을 개발하기 위해.
  • 신뢰할 수 있는 평가를 가능하게 하기 위해 대규모이고 다양한 데이터셋을 구축하기 위해.

제안 방법

  • 모델은 이중 하위 네트워크 아키텍처를 사용한다: 이미지 간 번역을 위한 전이 네트워크와 특징 유도를 위한 지도 네트워크(자동에코더).
  • 지도 네트워크는 실제 서예 이미지에서 사전 훈련된 후, 훈련 중에 전이 네트워크의 디코더에서 저수준 특징을 유도하는 데 사용된다.
  • 전이 네트워크는 내용 보존과 지각적 현실성을 확보하기 위해 L1 재구성 손실과 적대적 손실을 함께 훈련한다.
  • 전체 모델은 재구성 및 적대적 목표를 조합하여 엔드 투 엔드로 훈련되며, 사진 수준의 현실적인 서예 이미지를 생성한다.
  • 중간 단계의 스트로크 추출이나 조립 없이도 표준 글꼴 이미지(예: 헤이)를 직접 목표 서예 스타일로 매핑한다.
  • 지도 네트워크는 저수준 특징에 대해 세밀한 감독을 제공하여 스트로크 수준의 정확도와 텍스처의 현실성을 향상시킨다.

실험 결과

연구 질문

  • RQ1딥 생성 모델이 스트로크 추출 없이도 표준 글꼴 이미지에서 직접 현실적인 중국 서예를 합성할 수 있는가?
  • RQ2자동에코더 유도 감독 메커니즘이 이미지 간 번역에서 세밀한 스트로크 세부 사항 학습에 얼마나 효과적인가?
  • RQ3L1 손실만 사용하는 것과 비교해 복잡한 적대적 훈련이 생성된 서예 이미지의 지각적 품질과 선명도를 얼마나 향상시키는가?
  • RQ4입력 글꼴 스타일(예: 헤이 대비 카이)이 목표 서예 스타일과 크게 다를 경우, 제안된 방법의 성능은 얼마나 견고한가?
  • RQ5구조적·스타일적 다양성이 높은 다양한 서예 스타일 간에 모델은 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 방법은 모든 네 가지 서예 스타일(Mi Fu, Zhao Zhiqian, Liu Gongquan, Shen Yinmo)에서 최고의 정성 있는 결과를 달성하며, UNet, Encoder-Decoder, Rewrite와 같은 베이스라인 방법들을 능가한다.
  • 지도 네트워크가 포함된 모델은 스트로크 수준의 세부 사항을 크게 향상시켜, 감독 없이 사용한 경우에 비해 잘못된 또는 흐릿한 스트로크를 줄였다.
  • 적대적 손실의 포함으로 뿌연 현상이 감소하고 텍스처의 선명도가 향상되어 더 현실적이고 세밀한 문자 이미지를 생성했다.
  • 헤이 글꼴 대신 카이 글꼴을 입력으로 사용하더라도 모델은 강력한 성능을 유지하여 입력 글꼴의 변동성에 대한 견고성을 보였다.
  • 스트로크 레이아웃과 구조가 표준 글꼴과 크게 다를 수 있는 Mi Fu와 같은 매우 스타일리시하고 변형된 서예 스타일에도 잘 일반화되었다.
  • 제거 실험 결과, 지도 네트워크와 적대적 손실이 모두 고정밀도, 현실적인 서예 합성을 달성하기 위해 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.