Skip to main content
QUICK REVIEW

[論文レビュー] TreeGAN: Syntax-Aware Sequence Generation with Generative Adversarial Networks

Xinyue Liu, Xiangnan Kong|arXiv (Cornell University)|Aug 22, 2018
Natural Language Processing Techniques参考文献 25被引用数 6
ひとこと要約

TreeGAN は、再帰ニューラルネットワーク(RNN)を用いた生成器と木構造の RNN を用いたディスクラミネータで解析木をモデル化することにより、文法的に有効なシーケンスを生成する新規な GAN フレームワークである。これは、与えられた文脈自由文法(CFG)に完全に従うように生成されたすべてのシーケンスを保証し、特に文法エラーの低減と意味的類似性の向上という点で、文法に制約のない GAN である SeqGAN よりも顕著に生成品質を向上させる。

ABSTRACT

Generative Adversarial Networks (GANs) have shown great capacity on image generation, in which a discriminative model guides the training of a generative model to construct images that resemble real images. Recently, GANs have been extended from generating images to generating sequences (e.g., poems, music and codes). Existing GANs on sequence generation mainly focus on general sequences, which are grammar-free. In many real-world applications, however, we need to generate sequences in a formal language with the constraint of its corresponding grammar. For example, to test the performance of a database, one may want to generate a collection of SQL queries, which are not only similar to the queries of real users, but also follow the SQL syntax of the target database. Generating such sequences is highly challenging because both the generator and discriminator of GANs need to consider the structure of the sequences and the given grammar in the formal language. To address these issues, we study the problem of syntax-aware sequence generation with GANs, in which a collection of real sequences and a set of pre-defined grammatical rules are given to both discriminator and generator. We propose a novel GAN framework, namely TreeGAN, to incorporate a given Context-Free Grammar (CFG) into the sequence generation process. In TreeGAN, the generator employs a recurrent neural network (RNN) to construct a parse tree. Each generated parse tree can then be translated to a valid sequence of the given grammar. The discriminator uses a tree-structured RNN to distinguish the generated trees from real trees. We show that TreeGAN can generate sequences for any CFG and its generation fully conforms with the given syntax. Experiments on synthetic and real data sets demonstrated that TreeGAN significantly improves the quality of the sequence generation in context-free languages.

研究の動機と目的

  • 文法的に有効な出力を生成するが、既存の GAN がしばしば文法的に無効な出力を生成する可能性がある、SQL や Python などの形式的言語における高品質で文法的に正しいシーケンスの生成という課題に対処すること。
  • 生成器とディスクラミネータの両方が有効で構造的なシーケンス生成を指向できるように、事前に定義された文脈自由文法(CFG)規則を GAN の学習プロセスに統合すること。
  • 最大尤度推定(MLE)に基づくモデルを凌駆えるために、文法制約を組み込んだ敵対的学習を活用して、シーケンス生成の品質を向上させること。
  • 意味的類似性が実シーケンスに近いだけでなく、形式的文法規則に厳密に従うという点でも、両方を満たす統合的フレームワークを構築すること。

提案手法

  • 生成器は、与えられた CFG の開始記号をルートとする解析木を再帰的に構築するために RNN を使用し、各ノードは非終端記号を、各リーフは終端記号トークンを表す。
  • 生成された各解析木は、中序走査によって走査され、文法に完全に従う有効なシーケンスが生成される。これにより、構造的構築の過程で文法的正しさが保証される。
  • ディスクラミネータは、生成された解析木の真正性を評価するために木構造の RNN を使用し、訓練シーケンスから抽出された実際の木と区別する。
  • 生成器とディスクラミネータは、ミニマックスゲームとして敵対的に学習され、生成器はディスクラミネータが「本物」と分類するような木を生成することを目的とし、ディスクラミネータは偽の木を検出するように学習する。
  • 学習プロセスでは、実シーケンスとそれに対応する解析木の両方が使用され、生成器はディスクラミネータからの強化学習信号によって誘導される。
  • このフレームワークは任意の CFG に一般化可能であり、SQL や Python、あるいはドメイン固有のクエリ言語を含む多様な形式的言語への応用が可能である。

実験結果

リサーチクエスチョン

  • RQ1TreeGAN は、SeqGAN 及びその変種と比較して、シーケンス生成においてより優れた GAN モデルであると言えるか?
  • RQ2TreeGAN は、非敵対的で文法に配慮したモデル(例:TreeGen)と比較して、シーケンス生成においてより優れた文法に配慮したモデルであると言えるか?
  • RQ3TreeGAN は、合成データおよび実世界のデータセットの両方において、文法エラーを効果的に低減しながら、実シーケンスとの高い意味的類似性を維持できるか?
  • RQ4解析木による文法構造の統合は、構造的制約なしのシーケンスレベル生成と比較して、生成されたシーケンスの品質と妥当性を向上させるか?

主な発見

  • TreeGAN は、生成されたシーケンスにおける文法エラーを顕著に低減し、文法が厳密に適用される合成データセットでは、文法違反がゼロとなった。
  • 実世界のデータセット(例:Python コード生成の Django)において、TreeGAN は文法エラーのないコードを生成したが、SeqGAN は出力に複数の赤色ハイライトの文法エラーを含んでいた。
  • BLEU スコアおよび ROUGE スコアの両方で、TreeGAN は SeqGAN を上回り、生成されたシーケンスの意味的類似性とスムーズさが向上していることを示している。
  • 合成研究において、TreeGAN は生成されたシーケンスの有効性率が 100% に達したが、SeqGAN の有効性は文法違反のため著しく低下した。
  • ディスクラミネータが本物の木と偽の木を区別する能力が学習を重ねるごとに向上した。これは、文法の構造的パターンを効果的に学習していることを示している。
  • アブレーションスタディの結果、敵対的学習や木構造のディスクラミネータを削除すると性能が低下した。これは、最適な結果を得るには両方のコンponents が不可欠であることを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。