Skip to main content
QUICK REVIEW

[論文レビュー] GlyphGAN: Style-Consistent Font Generation Based on Generative Adversarial Networks

Hideaki Hayashi, Kohtaro Abe|arXiv (Cornell University)|May 29, 2019
Generative Adversarial Networks and Image Synthesis参考文献 36被引用数 12
ひとこと要約

GlyphGANは、分離された文字クラスベクトルとスタイルベクトルを用いたGANベースの手法を提案し、制御可能で多様性に富み、識別可能なフォント生成を実現する。従来手法(Deep-fontsなど)と比較して、識別精度(83.90%)が向上し、多様性(C_d = 0.61)も向上している一方で、すべての文字にわたる一貫性あるスタイルを維持している。

ABSTRACT

In this paper, we propose GlyphGAN: style-consistent font generation based on generative adversarial networks (GANs). GANs are a framework for learning a generative model using a system of two neural networks competing with each other. One network generates synthetic images from random input vectors, and the other discriminates between synthetic and real images. The motivation of this study is to create new fonts using the GAN framework while maintaining style consistency over all characters. In GlyphGAN, the input vector for the generator network consists of two vectors: character class vector and style vector. The former is a one-hot vector and is associated with the character class of each sample image during training. The latter is a uniform random vector without supervised information. In this way, GlyphGAN can generate an infinite variety of fonts with the character and style independently controlled. Experimental results showed that fonts generated by GlyphGAN have style consistency and diversity different from the training images without losing their legibility.

研究の動機と目的

  • 複雑な script(例:日本語)においても、一貫性のある文字セットを手動で作成する際の作業負荷を軽減し、フォントデザインの自動化を図ること。
  • 機械学習を用いてフォント作成におけるデザイナーの内的な知識を捉え、再現すること。
  • 深層生成モデルを用いて、一貫性のあるスタイルを保ちつつ、新規で多様性に富み、識別可能なフォントを生成すること。
  • フォント生成における文字の識別子と視覚的スタイルを独立して制御できること。
  • 既存のGANベースのフォント生成手法を改善し、識別性とスタイルの一貫性を向上させるとともに、モード崩壊を回避すること。

提案手法

  • 生成器ネットワークは、1-of-K 文字クラスベクトルとランダムなスタイルベクトルの2つの入力を受取り、文字とスタイルの分離制御を可能にする。
  • 識別器は、実際のフォント画像と生成されたフォント画像を評価し、生成器が現実的でスタイルの一貫性を持つ出力を生成するように訓練する。
  • 生成器と識別器の両方で、複雑な画像多様体をモデル化するため、深層畳み込みニューラルネットワーク(DCNN)アーキテクチャが用いられる。
  • 訓練は、文字クラスとスタイルを条件として与えた画像の条件付き分布を学習する条件付きGANフレームワークを用いる。
  • スタイルベクトルに明示的な教師信号を用いず、敵対的損失を用いてエンドツーエンドでモデルを訓練する。
  • 十分に多様なスタイルをカバーする訓練データのおかげで、スタイルの一貫性が暗黙的に学習される。

実験結果

リサーチクエスチョン

  • RQ1GANベースのモデルは、すべての文字にわたって一貫した視覚的スタイルを保ちつつ、識別可能なフォントを生成できるか?
  • RQ2文字クラスとスタイルベクトルに対する分離された条件付けが、生成されたフォントの多様性と現実性に与える影響は何か?
  • RQ3GANフレームワークにおける教師なしスタイルベクトルは、モード崩壊を伴わず、安定的かつ高品質なフォント生成を可能にするか?
  • RQ4本手法は、既存の深層学習ベースのフォント生成手法と比較して、識別性とスタイルの多様性の面で優れているか?
  • RQ5スタイルベクトルの潜在空間は、意味的で制御可能なフォントスタイル生成をどの程度可能にするか?

主な発見

  • GlyphGANは、生成されたフォントで83.90%の認識精度を達成し、Deep-fonts(72.51%)を顕著に上回り、識別性の優位性が示された。
  • GlyphGANの多様性指標(C_d)は0.61であり、Deep-fonts(0.33)を上回り、生成フォントのばらつきが大きいことが示された。
  • 分離された条件付け機構のおかげで、ランダムなスタイルベクトルでさえも、すべての文字にわたってスタイルの一貫性を維持した。
  • DCGANおよびWGAN-Clippingベースのベースラインで観察されたモード崩壊を回避し、繰り返し的または識別不能な出力を生成しなかった。
  • スタイルの一貫性は訓練データの多様性に敏感であり、スタイルカバレッジが限られていた場合、出力が一貫性を欠いた。これは、データ依存性を示している。
  • スタイルベクトルの潜在空間は、意味的なスタイル変化をエンコードしていることが判明したが、特定のスタイルに対する明示的制御は依然として困難である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。