Skip to main content
QUICK REVIEW

[論文レビュー] Pyramid Embedded Generative Adversarial Network for Automated Font Generation

Donghui Sun, Qing Zhang|arXiv (Cornell University)|Nov 20, 2018
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本稿では、多スケール特徴マップを統合することで中国フォント生成を向上させる、U-Netベースのモデルであるピラミッド埋め込み生成的対抗ネットワーク(PEGAN)を提案する。PEGANは、zi2ziなどのベースライン手法と比較してPSNR(17.52 対 17.45)、SSIM(0.84 対 0.83)、UQI(0.27 対 0.26)、および文字認識精度(96% 対 95%)で優れた性能を示す一方で、視覚的チューリングテストでは人間の分類精度が低く(65% 対 73%)あり、より現実的な出力が得られていることを示している。

ABSTRACT

In this paper, we investigate the Chinese font synthesis problem and propose a Pyramid Embedded Generative Adversarial Network (PEGAN) to automatically generate Chinese character images. The PEGAN consists of one generator and one discriminator. The generator is built using one encoder-decoder structure with cascaded refinement connections and mirror skip connections. The cascaded refinement connections embed a multiscale pyramid of downsampled original input into the encoder feature maps of different layers, and multi-scale feature maps from the encoder are connected to the corresponding feature maps in the decoder to make the mirror skip connections. Through combining the generative adversarial loss, pixel-wise loss, category loss and perceptual loss, the generator and discriminator can be trained alternately to synthesize character images. In order to verify the effectiveness of our proposed PEGAN, we first build one evaluation set, in which the characters are selected according to their stroke number and frequency of use, and then use both qualitative and quantitative metrics to measure the performance of our model comparing with the baseline method. The experimental results demonstrate the effectiveness of our proposed model, it shows the potential to automatically extend small font banks into complete ones.

研究の動機と目的

  • 大規模な文字セットにおいて手作業による中国フォント設計にかかる高コストと時間消費を軽減すること。
  • 小規模なフォントバンクを完全でスタイル一貫性のあるフォントライブラリに拡張できる自動化手法を開発すること。
  • 多スケール特徴と複数の損失関数を統合することで、フォント生成における画像品質と現実性を向上させること。
  • ストローク数と文字頻度に基づく洗練されたデータセットを用いてモデルの性能を評価し、現実的で多様なテストケースを保証すること。

提案手法

  • 生成器は、エンコーダー層の異なる深さに多スケールのダウンサンプル入力特徴を埋め込む、段階的リファインメント接続を備えたU-Netアーキテクチャを採用している。
  • ミラースキップ接続により、多スケールのエンコーダー特徴が対応するデコーダー層に転送され、空間的および構造的詳細が保持される。
  • 4つの損失関数が使用される:現実性のための対抗損失、ピクセル単位の正確性のためのピクセル単位損失、構造的類似性のための知覚損失、および事前学習中のマルチスタイル学習のためのカテゴリ損失。
  • 訓練はカテゴリ損失を用いた事前学習ステージと、すべての4つの損失関数を用いたチューニングステージに分けられ、生成の安定化と精錬が図られる。
  • 生成器とディスクラミネーターが交互に更新されるミニマックス方策を用いて、エンドツーエンドでモデルを訓練する。
  • ストローク数と文字頻度に基づいてカスタム評価セットを構築し、バランスの取れた代表的なテストを保証する。

実験結果

リサーチクエスチョン

  • RQ1多スケール特徴埋め込みを備えたGANベースのモデルは、ターゲットフォントスタイルに一致する高品質で現実的な中国文字画像を生成できるか?
  • RQ2段階的リファインメントとミラースキップ接続を統合することで、標準的なU-Netと比較して、微細なストロークディテールの生成がどの程度向上するか?
  • RQ3対抗損失、ピクセル単位損失、知覚損失、およびカテゴリ損失を組み合わせることで、フォント生成における視覚的品質と構造的忠実度はどの程度向上するか?
  • RQ4モデルは未観測の文字に一般化可能であり、小規模なフォントバンクを完全で使用可能なフォントライブラリに拡張できるか?

主な発見

  • PEGANはPSNRが17.52に達し、ベースラインのzi2zi(17.45)を上回り、ピクセル単位の再構成精度が向上していることが示された。
  • PEGANのSSIMスコアは0.84であり、zi2ziの0.83を上回り、生成画像における構造的類似性の向上が確認された。
  • PEGANは知覚品質スコア(UQI)を0.27に達し、zi2ziの0.26をわずかに上回り、知覚的特徴の保持が良好であることが示された。
  • 文字認識モデルはPEGANが生成した画像の96%を正しく分類したが、zi2ziの場合は95%であったため、可読性およびスタイルの一貫性が向上していることが示された。
  • 視覚的チューリングテストでは、人間のレーティングがPEGANが生成した画像を65%の割合で誤分類したが、zi2ziでは73%であったため、PEGANはより現実的で区別がつかない出力を生成していることが示された。
  • PEGANは、3つの小規模フォントバンク(百舟楷体:670文字、趙和体:2000文字、ZCool活黒:3563文字)を完全なセットに拡張し、訓練データに含まれない高品質でスタイル一貫性のある文字を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。