Skip to main content
QUICK REVIEW

[論文レビュー] Explaining Black Boxes on Sequential Data using Weighted Automata

Stéphane Ayache, Rémi Eyraud|arXiv (Cornell University)|Oct 12, 2018
Machine Learning and Algorithms参考文献 10被引用数 17
ひとこと要約

本稿では、訓練データや内部表現にアクセスせずに、逐次的記号データに対して実数出力を割り当てるブラックボックスモデルから重み付きオートマトン(WAs)を抽出するスペクトル的手法を提案する。ブラックボックスをオракルとして問い合わせることで、モデルの挙動を高い忠実度で近似するWAを同定する。48個の合成データおよび2つの実データで訓練されたRNNに対して、少数の状態数でもほぼ最適な性能を達成することが実証された。

ABSTRACT

Understanding how a learned black box works is of crucial interest for the future of Machine Learning. In this paper, we pioneer the question of the global interpretability of learned black box models that assign numerical values to symbolic sequential data. To tackle that task, we propose a spectral algorithm for the extraction of weighted automata (WA) from such black boxes. This algorithm does not require the access to a dataset or to the inner representation of the black box: the inferred model can be obtained solely by querying the black box, feeding it with inputs and analyzing its outputs. Experiments using Recurrent Neural Networks (RNN) trained on a wide collection of 48 synthetic datasets and 2 real datasets show that the obtained approximation is of great quality.

研究の動機と目的

  • 逐次的記号データを処理するブラックボックスモデルのグローバルな解釈可能性を向上させること。
  • 訓練データや内部モデル構造にアクセスせずに、ブラックボックスから重み付きオートマトン(WA)を抽出する手法を開発すること。
  • RNNのような複雑で非線形なモデルを、より単純で解釈可能なWAsで近似可能にする。
  • 合成および実世界の逐次データセット上でWA抽出の品質を評価すること。
  • WA近似が少数の状態数で高い性能を達成できることを示し、解釈可能性と効率性を向上させること。

提案手法

  • 本手法はブラックボックスをオラクルとして扱い、入力シーケンスを入力し、その実数出力を分析することでWAを推定する。
  • 前駆と接尾語の基底ベクトルに基づく線形代数的枠組みを活用し、スペクトルアルゴリズムを用いてWAを抽出する。
  • 入力シーケンスから前駆と接尾語の基底を構築し、それらの内積を用いて遷移および出力重みを推定する。
  • 得られた低ランク近似のランクが、抽出されたWAの複雑さと正確さを制御する。
  • ブラックボックス関数が基底上での双線形形式として表現可能であることに着目し、スペクトル分解を可能にする。
  • 最終的なWAは、元のブラックボックス出力への忠実度を測る perplexity や NDCG スコアを最小化するように訓練される。

実験結果

リサーチクエスチョン

  • RQ1訓練データや内部構造にアクセスせずに、シーケンスを実数にマッピングするブラックボックスモデルから重み付きオートマトンを効果的に抽出できるか?
  • RQ2抽出されたWAは、逐次データにおける再帰的ニューラルネットワーク(RNN)の挙動をどれほど正確に近似できるか?
  • RQ3ランクおよび基底サイズがWA近似の品質に与える影響は何か?
  • RQ4抽出されたWAは、ブラックボックスモデルの意思決定プロセスを意味的に解釈可能な形で表現できるか?
  • RQ5スペクトルWA抽出手法は、元のブラックボックスモデルと比較して競争力のある性能を達成できるか?

主な発見

  • 抽出された重み付きオートマトンは、RNN自身のエントロピーに非常に近いパープレキシティスコアを達成し、実データセット PAutomaC Nat. 2 ではパープレキシティ1.35(最適値1.25)を記録した。
  • わずか25の状態でも、WA近似はほぼ最適な性能を達成しており、低複雑性でも優れた一般化性能を示している。
  • 基底サイズを増やす(例:300から400に)ことでNDCG@5スコアが顕著に向上し、より大きな基底が近似品質を向上させることを示唆している。
  • ランクが高くなるほどWAの品質が向上するが、低ランクでも十分な性能が得られるため、コンactで解釈可能なモデルの使用が有効である。
  • 本手法は、合成シーケンス生成タスクやSPiCeやPAutomaCといった実際のNLPデータセットを含む多様なタスクで、堅牢性を示した。
  • WAの計算は各記号に対して行列積のみを必要とし、RNNの非線形演算とは異なり、効率的な推論が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。