Skip to main content
QUICK REVIEW

[논문 리뷰] Few-shot Font Generation by Learning Style Difference and Similarity

Xiao He, Mingrui Zhu|arXiv (Cornell University)|2023. 01. 24.
Video Analysis and Summarization인용 수 4
한 줄 요약

이 논문은 대tr-Font을 제안하며, 대비 학습을 통해 글꼴 간 스타일 차이와 동일 글꼴 내 유사성을 학습하는 few-shot 글꼴 생성 방법이다. 다층 스타일 프로젝터와 클러스터 수준의 대비 스타일 손실을 도입함으로써 기존 최고 성능(SOTA) 방법에 비해 스타일 일관성은 향상되고 잡음은 감소하여 FID 및 스타일 정확도와 같은 핵심 지표에서 슈퍼리어한 성능을 달성한다.

ABSTRACT

Few-shot font generation (FFG) aims to preserve the underlying global structure of the original character while generating target fonts by referring to a few samples. It has been applied to font library creation, a personalized signature, and other scenarios. Existing FFG methods explicitly disentangle content and style of reference glyphs universally or component-wisely. However, they ignore the difference between glyphs in different styles and the similarity of glyphs in the same style, which results in artifacts such as local distortions and style inconsistency. To address this issue, we propose a novel font generation approach by learning the Difference between different styles and the Similarity of the same style (DS-Font). We introduce contrastive learning to consider the positive and negative relationship between styles. Specifically, we propose a multi-layer style projector for style encoding and realize a distinctive style representation via our proposed Cluster-level Contrastive Style (CCS) loss. In addition, we design a multi-task patch discriminator, which comprehensively considers different areas of the image and ensures that each style can be distinguished independently. We conduct qualitative and quantitative evaluations comprehensively to demonstrate that our approach achieves significantly better results than state-of-the-art methods.

연구 동기 및 목표

  • 명시적 분리에 의존하지 않고 스타일 관계를 모델링함으로써 few-shot 글꼴 생성에서 국소적 왜곡과 스타일 일관성 결여 등의 잡음 문제를 해결하고자 한다.
  • 대비 학습을 통해 글꼴 간 상호 스타일 차이와 동일 글꼴 내 내재적 유사성을 모두 포착함으로써 스타일 표현을 향상시키고자 한다.
  • 소수의 참조 샘플에서 세밀한 스타일 패턴을 전달하면서도 글자 전체의 구조를 유지하는 강력한 생성기 개발을 목표로 한다.
  • 다중 작업 패치 판별기를 설계하여 이미지 영역별로 독립적으로 스타일을 구분함으로써 판별 능력을 향상시키고자 한다.

제안 방법

  • 다층 스타일 프로젝터(MSP)를 사용하여 참조 글리프에서 스타일 표현을 인코딩함으로써 계층적 스타일 특징 학습을 가능하게 한다.
  • 잠재 공간에서 동일 스타일 샘플 간 유사성을 극대화하고, 다른 스타일 샘플 간 유사성을 극소화하기 위해 클러스터 수준의 대비 스타일(CC) 손실을 제안한다.
  • 생성기는 주의 기반 아키텍처를 사용하여 글자 전체의 구조를 유지하면서도 소수의 참조 이미지에서 스타일을 전달한다.
  • 다중 작업 패치 판별기는 다중 공간 영역에서 콘텐츠와 스타일을 동시에 평가하여 국소적 및 전반적 일관성을 보장한다.
  • 모델 학습 프레임워크는 적대적 손실, L1 손실, 그리고 제안된 대비 스타일 손실을 조합하여 이미지 품질과 스타일 충실도를 최적화한다.
  • 스타일 코드의 클래스 중심을 저장하는 메모리 딕셔너리를 사용하여 학습 중 효율적인 검색과 대비 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1스타일 간 상호 차이와 동일 스타일 내 유사성을 모델링하면 few-shot 글꼴 생성 품질 향상과 잡음 감소에 기여하는가?
  • RQ2스타일 표현에 대한 대비 학습이 생성된 글꼴에서 스타일 일관성 향상과 국소적 왜곡 감소에 어떻게 기여하는가?
  • RQ3표준 판별기 대비 다중 작업 패치 판별기는 이미지 영역별로 스타일을 구분하는 데 얼마나 더 뛰어난가?
  • RQ4명시적 분리가 아닌 스타일 관계를 학습하는 것이 소수의 참조 샘플로도 더 나은 일반화를 이끌어내는가?
  • RQ5제안된 클러스터 수준의 대비 스타일 손실은 다른 손실 함수에 비해 스타일 표현 품질과 생성 충실도 측면에서 어떻게 비교되는가?

주요 결과

  • DS-Font는 UFSC 데이터셋에서 대부분의 지표에서 최고 성능을 기록하였으며, 스타일 분류 정확도(Acc (S))가 가장 높고 FID 점수가 가장 낮았다.
  • UCSF 데이터셋에서 DS-Font는 FID(S)와 Acc(S) 모두에서 모든 베이스라인을 앞서며, 특징 분포 정렬과 스타일 인식 능력이 뛰어나다는 것을 입증했다.
  • CCS 손실을 적용한 모델는 CCS 손실이 없는 아블레이션 버전 대비 스타일 분류 정확도가 상당히 향상되었고(일부 분할에서 최대 95%까지), FID 점수는 12% 감소했다.
  • 정성적 결과에서는 DS-Font가 세밀한 획 세부 정보와 전체 구조를 성공적으로 유지하는 반면, LF-Font 및 MX-Font와 같은 방법들은 구조적 일관성을 유지하지 못하거나 복잡한 스타일을 생성하지 못했다.
  • 다중 작업 패치 판별기는 표준 패치 판별기 및 단일 작업 판별기 모두를 능가했으며, 특히 콘텐츠 인식 지표와 시각적 품질 측면에서 뛰어난 성능을 보였다(그림 5 참조).
  • 아블레이션 연구를 통해 CCS 손실이 독특한 스타일 표현을 학습하는 데 핵심적임을 확인하였으며, 이 손실을 제거할 경우 눈에 띄는 잡음과 스타일 충실도 저하가 발생했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.