Skip to main content
QUICK REVIEW

[논문 리뷰] Pyramid Embedded Generative Adversarial Network for Automated Font Generation

Donghui Sun, Qing Zhang|arXiv (Cornell University)|2018. 11. 20.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 다중 척도 특징 피라미드를 통합하여 중국 문자 생성을 향상시키기 위해 캐스케이드 리파인먼트 및 미러 스위프 커넥션을 갖춘 U-Net 기반 모델인 피라미드 임bedded 생성적 적대 신경망(PEGAN)을 제안한다. PEGAN은 PSNR(17.52 대 17.45), SSIM(0.84 대 0.83), UQI(0.27 대 0.26), 문자 인식 정확도(96% 대 95%)에서 기준 모델인 zi2zi를 능가하지만, 시각적 튜링 테스트에서 인간 분류 정확도는 65%로 zi2zi의 73%보다 낮아 더 현실적인 출력을 생성함을 시사한다.

ABSTRACT

In this paper, we investigate the Chinese font synthesis problem and propose a Pyramid Embedded Generative Adversarial Network (PEGAN) to automatically generate Chinese character images. The PEGAN consists of one generator and one discriminator. The generator is built using one encoder-decoder structure with cascaded refinement connections and mirror skip connections. The cascaded refinement connections embed a multiscale pyramid of downsampled original input into the encoder feature maps of different layers, and multi-scale feature maps from the encoder are connected to the corresponding feature maps in the decoder to make the mirror skip connections. Through combining the generative adversarial loss, pixel-wise loss, category loss and perceptual loss, the generator and discriminator can be trained alternately to synthesize character images. In order to verify the effectiveness of our proposed PEGAN, we first build one evaluation set, in which the characters are selected according to their stroke number and frequency of use, and then use both qualitative and quantitative metrics to measure the performance of our model comparing with the baseline method. The experimental results demonstrate the effectiveness of our proposed model, it shows the potential to automatically extend small font banks into complete ones.

연구 동기 및 목표

  • 대규모 문자 집합에 대해 수작업으로 중국 문자를 디자인하는 데 드는 높은 비용과 시간 소모 문제를 해결하기 위해.
  • 작은 폰트 뱅크를 완전하고 스타일이 일관된 폰트 라이브러리로 확장할 수 있는 자동화된 방법을 개발하기 위해.
  • 다중 척도 특징과 다중 손실 함수 통합을 통해 문자 생성의 이미지 품질과 현실성 향상시키기 위해.
  • 스토크 수와 문자 빈도 기반으로 정제된 데이터셋을 활용해 균형 잡히고 대표적인 테스트 케이스를 확보함으로써 모델 성능 평가하기 위해.

제안 방법

  • 생성자는 다중 척도의 다운샘플된 입력 특징을 인코더 레이어의 다양한 깊이에 통합하는 캐스케이드 리파인먼트 연결을 갖춘 U-Net 아키텍처를 사용한다.
  • 미러 스위프 커넥션은 다중 척도의 인코더 특징을 해당되는 디코더 레이어로 전달하여 공간적 및 구조적 세부 정보를 유지한다.
  • 네 가지 손실 함수를 사용한다: 현실성 확보를 위한 적대적 손실, 픽셀 수준 정확도를 위한 픽셀 기반 손실, 구조 유사성 확보를 위한 지각 손실, 사전 훈련 동안 다중 스타일 학습을 위한 카테고리 손실.
  • 훈련은 카테고리 손실을 사용하는 사전 훈련 단계와 모든 네 가지 손실 함수를 포함하는 튜닝 단계로 나뉘어 안정화 및 정교화를 도모한다.
  • 생성자와 판별자가 번갈아가며 업데이트되는 minmax 정책을 사용해 엔드 투 엔드로 모델을 훈련한다.
  • 균형 잡히고 대표적인 테스트를 확보하기 위해 스트로크 수와 문자 빈도 기반으로 고유한 평가 세트를 구성한다.

실험 결과

연구 질문

  • RQ1다중 척도 특징 임베딩을 갖춘 GAN 기반 모델은 목표 폰트 스타일을 정확히 반영하는 고품질이고 현실적인 중국 문자 이미지를 생성할 수 있는가?
  • RQ2캐스케이드 리파인먼트와 미러 스위프 커넥션의 통합은 표준 U-Net 대비 미세한 스트로크 세부 정보 생성에 어떻게 기여하는가?
  • RQ3적대적, 픽셀 기반, 지각 및 카테고리 손실을 통합함으로써 문자 생성의 시각적 품질과 구조적 정밀도는 어느 정도 향상되는가?
  • RQ4모델은 미리 보지 않은 문자에 대해 일반화할 수 있으며, 작은 폰트 뱅크를 완전하고 사용 가능한 폰트 라이브러리로 확장할 수 있는가?

주요 결과

  • PEGAN은 PSNR 17.52를 기록하여 기준 모델인 zi2zi의 17.45를 초월해 더 높은 픽셀 수준 재구성 정확도를 보였다.
  • PEGAN의 SSIM 점수인 0.84는 zi2zi의 0.83를 초월해 생성된 이미지의 구조적 유사성 향상을 시사한다.
  • PEGAN은 지각 품질 점수(UQI) 0.27을 기록하여 zi2zi의 0.26보다 약간 높아 지각적 특징의 보존이 더 우수함을 나타낸다.
  • 문자 인식 모델은 PEGAN이 생성한 이미지의 96%를 정확히 분류했으며, zi2zi의 경우 95%였고, 이는 더 높은 독해성과 스타일 일관성을 의미한다.
  • 시각적 튜링 테스트에서 인간 평가자는 PEGAN이 생성한 이미지를 65%의 비율로 잘못 분류했고, zi2zi의 경우 73%였으며, 이는 PEGAN이 더 현실적이고 구별하기 어려운 출력을 생성함을 시사한다.
  • PEGAN은 Baizhou KaiTi(670자), ZhaoHeTi(2000자), ZCool KuHei(3563자)의 세 가지 작은 폰트 뱅크를 활용해 훈련 데이터에 포함되지 않은 고품질의 스타일 일관성 있는 문자들을 성공적으로 확장하여 완전한 폰트 세트로 생성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.