Skip to main content
QUICK REVIEW

[論文レビュー] Provably Stable Interpretable Encodings of Context Free Grammars in RNNs with a Differentiable Stack.

John Stogin, Ankur Mali|arXiv (Cornell University)|Jun 5, 2020
Machine Learning and Algorithms参考文献 66被引用数 4
ひとこと要約

この論文では、文脈自由文法(CFG)の規則を直接符号化することで、プッシュダウンオートマトン(PDA)の挙動を学習・近似できる、微分可能で証明可能な軌道安定性を持つRNNを提案する。このモデルは、長期間のシーケンス処理を安定化させるとともに、学習済み重みからPDA遷移およびスタック操作を解釈可能に抽出可能である。

ABSTRACT

Given a collection of strings belonging to a context free grammar (CFG) and another collection of strings not belonging to the CFG, how might one infer the grammar? This is the problem of grammatical inference. Since CFGs are the languages recognized by pushdown automata (PDA), it suffices to determine the state transition rules and stack action rules of the corresponding PDA. An approach would be to train a recurrent neural network (RNN) to classify the sample data and attempt to extract these PDA rules. But neural networks are not a priori aware of the structure of a PDA and would likely require many samples to infer this structure. Furthermore, extracting the PDA rules from the RNN is nontrivial. We build a RNN specifically structured like a PDA, where weights correspond directly to the PDA rules. This requires a stack architecture that is somehow differentiable (to enable gradient-based learning) and stable (an unstable stack will show deteriorating performance with longer strings). We propose a stack architecture that is differentiable and that provably exhibits orbital stability. Using this stack, we construct a neural network that provably approximates a PDA for strings of arbitrary length. Moreover, our model and method of proof can easily be generalized to other state machines, such as a Turing Machine.

研究の動機と目的

  • 肯定的および否定的な文字列サンプルから文法的推論を行う課題に取り組むこと。その目的は、背後にある文脈自由文法(CFG)を学習することにある。
  • 再帰的ニューラルネットワーク(RNN)アーキテクチャを設計し、プッシュダウンオートマトン(PDA)の構造を明示的にモデル化することで、学習済みルールの解釈可能性を保証すること。
  • 勾配ベースの学習に適した微分可能で、かつ証明可能な軌道安定性を持つスタック機構を開発することにより、長期間のシーケンス処理においても性能を維持すること。
  • 学習済みネットワーク重みから、解釈可能なPDA遷移およびスタック操作ルールを抽出可能にすること。

提案手法

  • モデルは、軌道安定性を介して状態安定性を維持する微分可能な操作を備えたカスタムスタックアーキテクチャを用いる。これにより、時間の経過に伴う誤差増大が有界に保たれる。
  • RNNは、ネットワーク重みがPDA遷移およびスタック操作ルールに対応するように、PDAを直接エミュレートする構造となっている。
  • スタックは、標準的なRNNで一般的な離散的で微分不能な操作を避ける、連続的で微分可能な更新ルールを採用している。
  • 軌道安定性はリャプノフ解析を用いて証明され、入力や隠れ状態の小さな摂動が発散的挙動を引き起こさないことを保証する。
  • モデルは標準的な誤差逆伝播法を用いて訓練され、文字列が目的のCFGに属するかどうかを分類する。
  • 同じスタックおよび安定性原理を拡張することで、このアーキテクチャは、チューリングマシンなどの他のステートマシンに対しても一般化可能である。

実験結果

リサーチクエスチョン

  • RQ1微分可能でスタック構造が安定なRNNは、文法的推論のためのプッシュダウンオートマトン(PDA)の遷移およびスタック操作を学習・表現できるか?
  • RQ2ニューラルネットワークは、その重みが解釈可能なPDAルールに対応するようにどのように設計できるか?
  • RQ3長期間のシーケンス処理中に、スタック機構が安定を保つために満たすべき条件は何か?特に、学習時に見られなかった長さの文字列に対しても同様に有効か?
  • RQ4モデルの内部構造は、学習済み重みから解釈可能な文法的ルールを抽出可能にできるか?
  • RQ5このフレームワークは、チューリングマシンなどの他の計算モデルへどの程度一般化可能か?

主な発見

  • 提案されたスタックアーキテクチャは、証明可能な軌道安定性を有しており、シーケンス長が増加してもモデルの挙動が一貫して保たれることを保証する。
  • 微分可能なスタックを備えたRNNは、任意長の文字列についてPDAを近似可能であり、標準的なRNNが有する一般的な一般化限界を克服できる。
  • モデルの重みは、解釈可能なPDA遷移およびスタック操作ルールを直接符号化しており、学習済みネットワークからルール抽出が可能である。
  • この方法により、肯定的および否定的な文字列サンプルからの効果的な文法的推論が可能となり、背後にあるCFG構造を学習できる。
  • スタックおよび安定性メカニズムを拡張することで、このフレームワークは、チューリングマシンなどの他のステートマシンに対しても一般化可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。