Skip to main content
QUICK REVIEW

[論文レビュー] Learning with Interpretable Structure from Gated RNN

Bojian Hou, Zhi‐Hua Zhou|arXiv (Cornell University)|Oct 25, 2018
Machine Learning and Algorithms参考文献 47被引用数 6
ひとこと要約

本稿では、クラスタリングに基づく手法を用いてゲート付きRNNから解釈可能な有限状態オートマトン(FSA)を学習することにより、モデルの透明性を向上させる手法を提案する。MGU、GRU、LSTMモデルからFSA構造を抽出することで、著者らは、得られたFSAがRNNの性能を模倣しつつ、完全に人間がシミュレート可能な意思決定経路を提供することを示した。これにより、テキスト分類における意味的パターンが明らかになり、ゲート数を減らすことでRNNの性能が向上する可能性が示唆された。

ABSTRACT

The interpretability of deep learning models has raised extended attention these years. It will be beneficial if we can learn an interpretable structure from deep learning models. In this paper, we focus on Recurrent Neural Networks~(RNNs) especially gated RNNs whose inner mechanism is still not clearly understood. We find that Finite State Automaton~(FSA) that processes sequential data has more interpretable inner mechanism according to the definition of interpretability and can be learned from RNNs as the interpretable structure. We propose two methods to learn FSA from RNN based on two different clustering methods. With the learned FSA and via experiments on artificial and real datasets, we find that FSA is more trustable than the RNN from which it learned, which gives FSA a chance to substitute RNNs in applications involving humans' lives or dangerous facilities. Besides, we analyze how the number of gates affects the performance of RNN. Our result suggests that gate in RNN is important but the less the better, which could be a guidance to design other RNNs. Finally, we observe that the FSA learned from RNN gives semantic aggregated states and its transition graph shows us a very interesting vision of how RNNs intrinsically handle text classification tasks.

研究の動機と目的

  • ゲート付きRNNの解釈性を向上させること。これらは、重要な応用分野で広く使用されているが、依然として透過性に欠ける。
  • 有限状態オートマトン(FSA)が人間がシミュレート可能な動作を示すことが知られているが、そのFSAがRNNの隠れ状態から学習可能かどうかを調査すること。
  • RNNのゲート数が性能に与える影響を分析し、単純なアーキテクチャ(例:1ゲートのMGU)がより効果的かどうかを検証すること。
  • FSA遷移グラフと状態の意味的解釈を可視化することで、RNNの内在的意味的構造を解明すること。
  • 安全性が求められる分野において、FSAのような解釈可能なモデルが、複雑なディープラーニングモデルの置換または説明に有効かどうかを検討すること。

提案手法

  • k-meansおよびスペクトルクラスタリングを用いて、ゲート付きRNNの隠れ状態を離散的状態にグループ化し、FSA構造を構築する。
  • 学習シーケンス上の推論中に観察された状態遷移に基づき、FSAの遷移ルールを構築する。
  • 同じRNNから学習した複数のFSAモデルの予測を多数決で統合することで、耐性性と性能を向上させる。
  • 感情分類タスクにおいてFSAを訓練・評価し、元のRNNとの性能を比較する。
  • 特に状態0から状態1への遷移を引き起こす語の特定を通じて、FSAの遷移の意味的解釈を分析する。
  • MGU、GRU、LSTM、SRNなどの異なるRNNタイプ間でFSAの性能を比較し、一般化性とゲート数の影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1ゲート付きRNNの隠れ状態から、解釈可能な有限状態オートマトン(FSA)を効果的に学習できるか?
  • RQ2学習されたFSAは、元のRNNの分類性能をどれほど正確に再現できるか?
  • RQ3FSAの状態と遷移の意味的解釈は何か。特に、肯定的・否定的センチメント語がどのように関連しているか。
  • RQ4RNNのゲート数が性能や学習されたFSAの品質に与える影響は何か?
  • RQ5FSAは、安全性が求められる応用分野において、信頼できる人間がシミュレート可能なRNNの代替手段として機能できるか?

主な発見

  • MGUから学習したFSAは、他のRNN由来のFSAよりも競争力のある性能を示し、特にLISOR-x設定では顕著な優位性を示した。
  • 複数のFSAを組み合わせたアンサンブル手法により、単一のFSAよりも性能が向上した。LISOR-xでは、異なるRNNタイプにおいて一貫した向上が観察された。
  • MGUから学習したFSAにおいて、状態0から状態1への遷移は、肯定的センチメント語(例:'wonderful'、'spectacular')によって引き起こされた。
  • 否定的センチメント語(例:'dullest'、'confusing')は、拒否状態への遷移に関連しており、FSAにおける意味的クラスタリングが示された。
  • 複数のFSAは相補的な意味的カバレッジを示した。個々のFSAは部分的なセンチメント語彙を捉えていたが、アンサンブルではより広範な意味を捉えた。
  • 本研究では、RNNのゲート数が極めて重要であることが判明した。少ないゲート数(例:1ゲートのMGU)が優れた性能を示し、最小限のゲート設計が好ましい可能性を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。