Skip to main content
QUICK REVIEW

[論文レビュー] Verification of Recurrent Neural Networks Through Rule Extraction

Qinglong Wang, Kaixuan Zhang|arXiv (Cornell University)|Nov 14, 2018
Adversarial Robustness in Machine Learning参考文献 23被引用数 13
ひとこと要約

本稿では、再帰的ニューラルネットワーク(RNN)の検証フレームワークを提案する。このフレームワークでは、RNNから抽出した決定的有限オートマトン(DFA)を、逐次データにおける敵対的摂動を検出するための代替オラクルとして用いる。平均編集距離を摂動のスケールを測る指標として導入し、2次RNN(2次隠れ層相互作用を有する)が、DFA抽出の面で最も安定的かつ正確であることを示した。この結果、トミータ文法(Tomita grammars)において、MI-RNN や2次RNN などの少数のモデルのみが敵対的サンプルに対して耐性を示すことが明らかになった。

ABSTRACT

The verification problem for neural networks is verifying whether a neural network will suffer from adversarial samples, or approximating the maximal allowed scale of adversarial perturbation that can be endured. While most prior work contributes to verifying feed-forward networks, little has been explored for verifying recurrent networks. This is due to the existence of a more rigorous constraint on the perturbation space for sequential data, and the lack of a proper metric for measuring the perturbation. In this work, we address these challenges by proposing a metric which measures the distance between strings, and use deterministic finite automata (DFA) to represent a rigorous oracle which examines if the generated adversarial samples violate certain constraints on a perturbation. More specifically, we empirically show that certain recurrent networks allow relatively stable DFA extraction. As such, DFAs extracted from these recurrent networks can serve as a surrogate oracle for when the ground truth DFA is unknown. We apply our verification mechanism to several widely used recurrent networks on a set of the Tomita grammars. The results demonstrate that only a few models remain robust against adversarial samples. In addition, we show that for grammars with different levels of complexity, there is also a difference in the difficulty of robust learning of these grammars.

研究の動機と目的

  • 逐次データ応用における再帰的ニューラルネットワーク(RNN)の検証手法の欠如に取り組むこと。ここでは、従来の指標やオラクルでは不十分である。
  • 真のDFAが不明な状況においても、抽出されたDFAを代替オラクルとして用いる、厳密で自動化されたRNN検証フレームワークを構築すること。
  • 文字列ベースの逐次データにおける敵対的摂動のための適切な距離指標を定義し、標準的なLpノルムの限界を克服すること。
  • 提案されたフレームワークを用いて、正則文法上での敵対的サンプルに対するさまざまなRNNアーキテクチャの耐性を実証的に評価すること。
  • 文法の複雑さとRNNの耐性学習の難易度との関係を調査すること。

提案手法

  • 訓練済みRNNから決定的有限オートマトン(DFA)を抽出し、RNNの意思決定論理の形式的かつ解釈可能な代替として用いる。
  • 文字列ベースの逐次データにおける敵対的摂動のスケールを測るための新規指標として、平均編集距離を提案する。
  • 抽出されたDFAを形式的オラクルとして用い、摂動を加えた文字列が元の文法の言語に含まれるかどうかを検証する。
  • 制約付き最適化問題として検証問題を定式化し、MILPまたはSMTソルバを活用して摂動下での耐性を確認する。
  • トミータ文法(Tomita grammars)—正則言語のベンチマークセット—を用い、複数のRNNアーキテクチャにおける敵対的耐性を評価する。
  • 各文字列長に対して30回の試行を実施し、正の文字列および負の文字列の平均敵対的耐性スコア(γ̄₊, γ̄₋)を算出する。

実験結果

リサーチクエスチョン

  • RQ1RNNから抽出されたDFAは、敵対的耐性の検証において真のオラクルの代替として信頼できるか?
  • RQ2RNNアーキテクチャの選択が、逐次データ検証におけるDFA抽出の安定性および正確性にどのように影響するか?
  • RQ3文法の複雑さ(複雑さの度合い)が、RNNの敵対的摂動に対する耐性にどの程度影響を及えるか?
  • RQ4平均編集距離は、言語的妥当性を保ちつつ、文字列ベースのデータにおける敵対的摂動の測定と制限に効果的か?
  • RQ5どのRNNアーキテクチャが、長大なシーケンスにおいても敵対的攻撃に耐えうるか、一般化性能が最も優れているか?

主な発見

  • 2次RNN(2次隠れ層相互作用、または近似2次相互作用を有する)は、全トミータ文法において一貫して最も正確で安定したDFA抽出を達成した。
  • 敵対的耐性が完全に保証されたのは、2次RNNおよびMI-RNN のみであり、全テスト文法でγ̄₊ = 1.00を達成し、敵対的サンプルは一切検出されなかった。
  • Elman-RNNは敵対的正答率が最低であり、特に文法3において顕著に劣化し、文字列長が増加するにつれて性能が著しく低下した。これは、長大なシーケンスへの一般化能力に欠けることを示唆している。
  • 文法7は複雑さが最低であったが、訓練データのクラス不均衡のため、敵対的サンプルに対して極めて脆弱であった。これは過学習の兆候である。
  • 文法3と同程度の複雑さであるにもかかわらず、文法4は文法3よりも優れた耐性学習を示した。これは、文法構造自体が単なる複雑さを超えて耐性に影響を与えることを示している。
  • 平均編集距離指標は、摂動のスケールを効果的に捉え、耐性学習の難易度と相関を示した。これにより、RNNや文法間での意味のある比較が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。