[論文レビュー] Learning Neurosymbolic Generative Models via Program Synthesis
本稿では、画像内の全体的な構造的パターン(たとえば繰り返し配置された窓の配置など)を捉えるために、知覚的要素を含むスケッチを組み合わせた神経記号的プログラムを統合する、プログラム合成誘導型生成モデル(PS-GM)を提案する。訓練データからプログラムを合成し、それを深層生成モデルを誘導する手段として用いることで、特に複雑な空間的構造を持つデータにおいて、最先端のベースラインを大きく上回る画像生成および補完性能を達成する。
Significant strides have been made toward designing better generative models in recent years. Despite this progress, however, state-of-the-art approaches are still largely unable to capture complex global structure in data. For example, images of buildings typically contain spatial patterns such as windows repeating at regular intervals; state-of-the-art generative methods can't easily reproduce these structures. We propose to address this problem by incorporating programs representing global structure into the generative model---e.g., a 2D for-loop may represent a configuration of windows. Furthermore, we propose a framework for learning these models by leveraging program synthesis to generate training data. On both synthetic and real-world data, we demonstrate that our approach is substantially better than the state-of-the-art at both generating and completing images that contain global structure.
研究の動機と目的
- 画像内の繰り返しパターンのような複雑なグローバル構造を捉えることのできない最先端の深層生成モデルの限界を解消すること。
- プログラム合成と深層生成モデルを組み合わせ、知覚的データにおける高レベルの構造的事前知識をモデル化する手法を開発すること。
- 合成されたプログラムを構造的事前知識として活用することで、画像の完全生成と補完の両方を可能にすること。
- 訓練データに真のグローバル構造が欠落している課題を、ドメイン固有のプログラム合成を用いて監督信号を生成することで克服すること。
- プログラム的構造を組み込むことで、特にデータが少ない状況においても、より正確で構造的な画像生成および補完が可能になることを実証すること。
提案手法
- グローバル構造を、穴あきのスケッチ(s)と知覚的要素(c)に分解し、神経記号的プログラム P = (s, c) を構築する。
- ドメイン固有のプログラム合成アルゴリズムを用いて、訓練画像から2次元の繰り返しパターンを表すネストされたforループを抽出する。
- 入力データの知覚的要素に基づいて、合成されたプログラム P を実行し、構造レンダリング x_struct を生成する。
- 構造的事前知識を生成を誘導するために用いることで、VAE、GAN、またはVEDなどの深層生成モデルを、x_struct を完全な画像に補完するように訓練する。
- 画像補完の際には、部分的な画像からプログラムを合成し、それを拡張して完全な構造を予測し、事前学習済みモデルを用いてその構造を誘導して補完を行う。
- 強化学習や弱い監督信号を避けるために、合成されたプログラムから導出された教師信号を用いて、エンドツーエンドのシステムを訓練する。
実験結果
リサーチクエスチョン
- RQ1神経記号的プログラムは、画像内の複雑なグローバル構造(例:2次元の繰り返しパターン)を効果的に捉えることができるか?
- RQ2プログラム合成を用いてプログラム的構造を組み込むことで、画像生成および補完タスクにおける深層生成モデルの性能が向上するか?
- RQ3構造的忠実度および定量的指標の観点から、PS-GMフレームワークは、GLCIC、CycleGAN、VAEなどの最先端モデルと比較してどの程度優れているか?
- RQ4データが限られている実世界のデータセット(例:facadesデータセット)において、本手法は一般化可能であり、ベースラインモデルが失敗する状況でも有効か?
- RQ5合成されたプログラムを構造的事前知識として用いることで、データが少ない状況における一般化性能とサンプル品質はどの程度向上するか?
主な発見
- 合成データでは、PS-GMはCycleGANでFID 91.8、GLCICで106.8を達成し、それぞれベースラインの218.7および163.66を顕著に上回った。
- facadesデータセットでは、PS-GMはCycleGANでFID 124.4、GLCICで141.8を達成し、ベースラインの251.4および195.9を下回り、データ不足に強く対応した。
- VEDベースの補完では、PS-GMはfacadesデータセットで負の対数尤度(NLL)8755.4を達成し、ベースラインの8636.3よりわずかに劣ったが、両モデルとも構造学習が不十分であったため、性能に差は限定的だった。
- 画像生成においては、VEDを用いたPS-GMは、ベースラインのVAEよりも一貫性があり、構造的なパターンを有する画像を生成したことが、定性的な比較で示された。
- PS-GMフレームワークは、繰り返し窓配置を持つ建物のような複雑な空間的構造を持つ画像において、補完品質を顕著に向上させ、ベースラインはグローバルレイアウトを再構築できなかった。
- 本手法は、真のグローバル構造が入手できない状況においても、プログラム合成が意味のある監督信号を生成できることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。