[논문 리뷰] VQ-Font: Few-Shot Font Generation with Structure-Aware Enhancement and Quantization
VQ-Font는 사전 훈련된 코드북을 사용한 토큰 사전 보정과 구성 요소 수준의 스타일 재조정을 통한 구조 인식 향상 기반으로 소수의 예시로 글꼴 생성을 향상시키는 VQGAN 기반 프레임워크를 제안한다. 중국어 문자의 구조적 디자인 원칙을 활용하고 합성된 출력을 이산 토큰 공간에서 보정함으로써, 특히 복잡한 세리프체 및 예술적 글꼴에서 잡음과 기하학적 왜곡을 크게 줄이고 시각적 품질을 향상시킨다. 이는 정량적·정성적 측면에서 기존 방법을 뛰어넘는 성능을 보인다.
Few-shot font generation is challenging, as it needs to capture the fine-grained stroke styles from a limited set of reference glyphs, and then transfer to other characters, which are expected to have similar styles. However, due to the diversity and complexity of Chinese font styles, the synthesized glyphs of existing methods usually exhibit visible artifacts, such as missing details and distorted strokes. In this paper, we propose a VQGAN-based framework (i.e., VQ-Font) to enhance glyph fidelity through token prior refinement and structure-aware enhancement. Specifically, we pre-train a VQGAN to encapsulate font token prior within a codebook. Subsequently, VQ-Font refines the synthesized glyphs with the codebook to eliminate the domain gap between synthesized and real-world strokes. Furthermore, our VQ-Font leverages the inherent design of Chinese characters, where structure components such as radicals and character components are combined in specific arrangements, to recalibrate fine-grained styles based on references. This process improves the matching and fusion of styles at the structure level. Both modules collaborate to enhance the fidelity of the generated fonts. Experiments on a collected font dataset show that our VQ-Font outperforms the competing methods both quantitatively and qualitatively, especially in generating challenging styles.
연구 동기 및 목표
- 소수의 예시로 복잡한 중국어 문자 스타일에서 고해상도 글꼴 생성에 도전하는 데 목적이 있다.
- 기존 방법에서 도메인 갭과 패치 수준의 어텐션만으로 인해 흔히 발생하는 상세 정보 누락 및 왜곡된 획 등의 잡음을 줄이는 데 목적이 있다.
- 중국어 문자의 구조적 디자인 원칙을 통합함으로써 구성 요소 수준에서 스타일 전이의 정확도를 향상시키기 위해 라디칼과 구성 요소를 고립된 패치가 아닌 통합된 실체로 간주하는 데 목적이 있다.
- 사전 훈련된 VQGAN 코드북에서 유도된 학습된 이산 토큰 공간 내에서 합성된 출력을 보정함으로써 출력 품질을 향상시키는 데 목적이 있다.
- 콘텐츠 글꼴과 참조 글꼴 간의 구조 수준 대응을 명시적으로 모델링하여 더 나은 시각적 품질과 구조적 일관성을 달성하는 데 목적이 있다.
제안 방법
- 사전 훈련된 VQGAN을 사용하여 실제 글꼴의 획과 스타일 사전 지식를 압축한 글꼴 코드북을 학습함으로써, 합성된 글꼴을 이산 코드북 공간으로 매핑함으로써 보정할 수 있도록 한다.
- Transformer 기반 모듈이 합성된 글꼴 이미지의 코드북 인덱스를 예측함으로써, 학습된 토큰 사전 지식을 활용해 고해상도 출력을 재구성할 수 있도록 한다.
- 구조 수준의 스타일 향상 모듈(SSEM)은 콘텐츠 글꼴과 참조 글꼴의 구조적 구성 요소(예: 라디칼) 간의 대응 관계를 설정하여 세밀한 스타일 특징을 재조정한다.
- 교차 어텐션 메커니즘은 콘텐츠와 참조 글꼴 간의 패치 수준 어텐션을 계산하며, 이를 SSEM을 통해 재가중하여 구조 수준의 정렬을 강조한다.
- 프레임워크는 콘텐츠 인코더, 스타일 인코더, 교차 어텐션 모듈, SSEM, 디코더를 포함하며, 스타일 전이 및 재구성 최적화를 위해 엔드 투 엔드로 훈련된다.
- 사전 훈련된 글꼴 디코더를 미세 조정하여 합성과 실제 글꼴 분포 간의 도메인 갭을 줄여 현실감과 일관성을 향상시킨다.

실험 결과
연구 질문
- RQ1글꼴 토큰의 사전 훈련된 코드북이 소수의 예시로 글꼴 생성 시 상세 정보 누락 및 왜곡된 획 등의 잡음을 효과적으로 줄일 수 있는가?
- RQ2중국어 문자의 구조적 디자인 원칙을 통합할 경우 구성 요소 수준에서 스타일 전이의 정확도는 어떻게 향상되는가?
- RQ3패치 수준 어텐션만으로는 부족하고, 구조 인식 향상 기법이 획 일관성과 윤곽 세부 정보 유지에 얼마나 효과적인가?
- RQ4토큰 사전 지식 보정과 구조 수준의 스타일 재조정을 결합할 경우 PSNR, SSIM, LPIPS와 같은 정량적 지표에서 유의미한 향상이 이루어지는가?
- RQ5모델이 세리프체 및 예술적 글꼴과 같은 복잡한 글꼴 스타일로 일반화되면서도 고해상도의 시각적 품질을 유지할 수 있는가?
주요 결과
- VQ-Font 모델은 UFUC 데이터셋에서 PSNR 20.249, SSIM 0.812를 기록하여 베이스라인 및 아블레이션 버전을 모두 초월한다.
- 사전 훈련된 코드북(+C)을 추가함으로써 베이스라인 대비 PSNR는 0.851 향상되고 LPIPS는 0.012 감소한다.
- 코드북과 구조 수준의 스타일 향상 모듈을 결합한 (+CS) 경우 PSNR는 20.249로 유지되며 LPIPS는 0.103으로 감소하여 상호보완적 성능 향상을 입증한다.
- 인간 평가 결과 VQ-Font는 콘텐츠 정확도와 스타일 일관성에서 뛰어난 성능을 보이며, 사용자들이 참조 글꼴과 가장 유사하다고 평가한 결과를 더 자주 선택한다.
- 시각화 결과 SSEM이 관련 없는 영역에 대한 어텐션을 줄이고 대응되는 구조적 구성 요소에 집중함으로써 스타일 정렬을 향상시킴을 확인했다.
- 사전 훈련된 디코더의 미세 조정은 도메인 적응을 향상시켜 PSNR를 고정된 경우 20.069에서 미세 조정된 경우 20.249로 향상시켰으며, 합성과 실제 글꼴 분포 간 갭을 메우는 데 효과적임을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.