Skip to main content
QUICK REVIEW

[論文レビュー] CoSE: Compositional Stroke Embeddings

Emre Aksan, Thomas Deselaers|arXiv (Cornell University)|Jun 17, 2020
Handwritten Text Recognition Techniques参考文献 38被引用数 12
ひとこと要約

CoSEは、スチルの順序に依存しない可変長スティルの集合として描画を扱い、局所的なスティル外観とグローバル構造的構成を分離するための学習可能な潜在空間を用いて、複雑なスタイリッシュドローイングの構成的生成モデルを提案する。このモデルは、DiDi、QuickDraw、IAM-OnDBデータセットにおいて、エンドツーエンドでトレーニング可能なオートエンコーダーと潜在空間内での関係的予測子を用いて、複雑な図表やフローチャートの予測において、従来のシーケンスベースのアプローチを上回り、再構成と予測の両方の精度が優れている。

ABSTRACT

We present a generative model for complex free-form structures such as stroke-based drawing tasks. While previous approaches rely on sequence-based models for drawings of basic objects or handwritten text, we propose a model that treats drawings as a collection of strokes that can be composed into complex structures such as diagrams (e.g., flow-charts). At the core of the approach lies a novel autoencoder that projects variable-length strokes into a latent space of fixed dimension. This representation space allows a relational model, operating in latent space, to better capture the relationship between strokes and to predict subsequent strokes. We demonstrate qualitatively and quantitatively that our proposed approach is able to model the appearance of individual strokes, as well as the compositional structure of larger diagram drawings. Our approach is suitable for interactive use cases such as auto-completing diagrams. We make code and models publicly available at https://eth-ait.github.io/cose.

研究の動機と目的

  • フローチャートや図表のような複雑な構成的ドローイングの生成において、シーケンスベースのモデルの限界を克服すること。
  • スティルベースのデータにおいて、局所的スティル外観とグローバル構造的構成を分離することで、より優れた生成モデリングを実現すること。
  • 固定次元の潜在空間における関係的モデルを用いて、スパースな初期スティルから対話的かつ自動補完可能な図表の生成を可能にすること。
  • 再構成と構成的推論の両方を支援するバランスの取れた分離された潜在表現を学習することで、より優れた予測性能が達成可能であることを示すこと。

提案手法

  • モデルは、スティルの順序に依存しないように、描画を可変長のスティルの集合として扱う。各スティルは2次元座標のシーケンスとして定義される。
  • ディープオートエンコーダーは、可変長スティルを固定次元の潜在空間にマップし、局所的外観と構造的文脈を保持する。
  • 関係的モデルは潜在空間で動作し、現在のスティル集合に基づいて将来のスティル埋め込みを予測する。不確実性モデリングにはGMMに基づく多モード分布が用いられる。
  • デコーダーは予測された潜在埋め込みからスティルを再構成する。全モデルは、エンコーダ-デコーダー間での再構成損失のみを用いてエンドツーエンドでトレーニングされ、勾配は関係的モデルに逆伝播されない。
  • 関係的モデルにおける確率的要因として、10成分のGMMが主に用いられ、予測の多様性と精度が向上する。
  • モデルはDiDi(複雑な図表)、QuickDraw(自由なスケッチ)、IAM-OnDB(筆跡)で評価され、GMMの成分数と勾配フローに関するアブレーションスタディが実施された。

実験結果

リサーチクエスチョン

  • RQ1スティルの順序に依存しないスティル集合として描画を扱う生成モデルは、複雑な図表構造の予測において、従来のシーケンスベースのモデルを上回ることができるか?
  • RQ2局所的スティル外観とグローバル構造的構成を分離することで、再構成と予測性能が向上するか?
  • RQ3潜在空間表現の選択が、図表、スケッチ、筆跡など多様なスティルベースのデータにわたる一般化能力に与える影響は何か?
  • RQ4勾配フローとGMMの成分数といったアーキテクチャ的選択が、関係的モデルにおける予測性能に与える影響は何か?

主な発見

  • 提案されたCoSEモデルは、DiDiデータセットにおいて再構成誤差(Recon. CD)0.0136および予測誤差(Pred. CD)0.0442を達成し、ベースラインモデルを上回った。
  • 関係的モデルにおけるGMM成分数が10以上であると予測性能が著しく向上し、最終モデルでは10成分が使用された。
  • エンコーダーに勾配を逆伝播させると、再構成誤差と予測誤差がそれぞれ0.0162および0.0470に上昇し、関係的モデルを分離することでより良い分離が維持されていることが示された。
  • 定性的な結果では、CoSEはスパースな初期スティルからも一貫性があり文脈的に適切な図表の継続を生成するが、SketchRNNのようなベースラインは複雑な構造で失敗する。
  • CoSEが学習した潜在空間は、DiDi、QuickDraw、IAM-OnDBなど多様なデータセットでの優れた性能を示し、より良い一般化と構成的推論を可能にしている。
  • モデルは強力な対話的潜在能力を示しており、プロトタイプデモにより、ユーザー入力に基づくリアルタイムの図表自動補完が可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。