Skip to main content
QUICK REVIEW

[論文レビュー] Generative Neurosymbolic Machines

Jindong Jiang, Sungjin Ahn|arXiv (Cornell University)|Oct 23, 2020
Generative Adversarial Networks and Image Synthesis参考文献 41被引用数 9
ひとこと要約

本論文では、柔軟な密度モデリングを可能にする分散型潜在変数と、解釈可能性と合成可能性を実現する記号的・構造的表現を組み合わせた階層的生成モデル、Generative Neurosymbolic Machines (GNM) を提案する。2層の潜在階層と、構造的DRAW(StructDRAW)と呼ばれる自己回帰的事前分布を導入することで、ARROWおよびMNIST-10ベンチマークにおいて、構造表現の正確さと画像生成品質の両面で、従来のモデルを顕著に上回る最先端の性能を達成した。

ABSTRACT

Reconciling symbolic and distributed representations is a crucial challenge that can potentially resolve the limitations of current deep learning. Remarkable advances in this direction have been achieved recently via generative object-centric representation models. While learning a recognition model that infers object-centric symbolic representations like bounding boxes from raw images in an unsupervised way, no such model can provide another important ability of a generative model, i.e., generating (sampling) according to the structure of learned world density. In this paper, we propose Generative Neurosymbolic Machines, a generative model that combines the benefits of distributed and symbolic representations to support both structured representations of symbolic components and density-based generation. These two crucial properties are achieved by a two-layer latent hierarchy with the global distributed latent for flexible density modeling and the structured symbolic latent map. To increase the model flexibility in this hierarchical structure, we also propose the StructDRAW prior. In experiments, we show that the proposed model significantly outperforms the previous structured representation models as well as the state-of-the-art non-structured generative models in terms of both structure accuracy and image generation quality. Our code, datasets, and trained models are available at https://github.com/JindongJiang/GNM

研究の動機と目的

  • 現在のディープラーニングモデルが、同時に構造的で解釈可能な表現と密度ベースの画像生成をサポートする点に限界を示しているのを是正すること。
  • 記号的表現と分散表現を統合した生成フレームワークにおいて、複雑なシーンの認識と想像を両立させること。
  • 教師なしでエンドツーエンド学習可能な階層的潜在構造を設計し、グローバルな密度モデリングとローカルな記号的合成性の両方を支援すること。
  • 構造的特徴の描画を可能にする、新たな自己回帰的事前分布「StructDRAW」を用いて、構造的表現の表現力を向上させること。
  • 提案モデルが、最先端のベースラインと比較して、構造の正確さと画像生成品質の両面で優れた性能を示すことを実証すること。

提案手法

  • モデルは2層の潜在階層を採用する:グローバルな分散型潜在変数 $\mathbf{z}^g$ は柔軟な密度モデリングに、構造的記号的潜在マップ $\mathbf{z}^s$ はエンティティベースの表現に使用される。
  • グローバルな潜在変数 $\mathbf{z}^g$ は、条件付き事前分布を通じて構造的記号的表現 $\mathbf{z}^s$ の生成を条件づけ、密度ベースのサンプリングを可能にする。
  • 構造的DRAW(StructDRAW)事前分布を導入し、構造的潜在マップ上での自己回帰的特徴の順次描画を可能にし、表現力の向上を図る。
  • 記号的コンポーネント間の依存関係をモデル化するため、StructDRAW内にMLPインタラクション層を統合し、表現能力を強化する。
  • 変分推論の目的関数にKLダイバージェンス項を組み込み、再構成と事前分布の尤度の両方を最適化することで、エンドツーエンドで学習する。
  • モデルは、$\mathbf{x}$ から $\mathbf{z}^s$ を推論する認識(inference)と、$\mathbf{z}^g$ と $\mathbf{z}^s$ から $\mathbf{x}$ をサンプリングする生成(generation)の両方をサポートし、新しいシーン合成を可能にする。

実験結果

リサーチクエスチョン

  • RQ1生成モデルは、同時に解釈可能で記号的・オブジェクト中心の表現を学習し、元のデータ密度に従って画像を生成できるか?
  • RQ2グローバルな密度モデリングとローカルな記号的合成性の両方を支えるために、どのように階層的潜在構造を設計できるか?
  • RQ3StructDRAWのような自己回帰的事前分布は、構造的潜在表現の表現力と正確さをどのように向上させるか?
  • RQ4提案モデルは、構造の正確さと画像品質の両面で、既存の構造的および非構造的生成モデルをどの程度上回るか?
  • RQ5グローバル事前分布やMLPインタラクション層といったアーキテクチャ的要素は、モデルの性能にどのように寄与するか?

主な発見

  • ARROWデータセットでは、GNM-Structは構造的正確度0.976を達成し、ConvDRAW(0.176)とGNM-Gaussian(0.784)を顕著に上回った。
  • MNIST-10データセットでは、GNM-Structは構造的正確度0.824を達成し、ConvDRAW(0.000)とGNM-Gaussian(0.096)を大幅に上回った。
  • GNM-StructはARROWで33,809、MNIST-10で10,450のログ尤度を達成し、両指標ですべてのベースラインを上回った。
  • アブレーションスタディの結果、StructDRAW事前分布とMLPインタラクション層の両方が重要な構成要素であることが判明し、それらを除去すると性能が著しく低下した。
  • KL項の $\beta$ が増加するに従って、ログ尤度が滑らかに低下する傾向を示したが、構造的正確度は高い水準を維持した。これに対して、ベースラインは深刻な性能低下を示した。
  • 潜在変数のトレース可視化により、GNMがオブジェクトの位置や方向といった記号的コンポーネントを独立して制御することで、一貫性のある構造的シーンを生成できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。