Skip to main content
QUICK REVIEW

[論文レビュー] Input-Cell Attention Reduces Vanishing Saliency of Recurrent Neural Networks

Aya Abdelsalam Ismail, Mohamed K. Gunady|arXiv (Cornell University)|Oct 27, 2019
Cell Image Analysis Techniques参考文献 35被引用数 19
ひとこと要約

本稿では、現在および過去の時刻ステップからの入力ベクトルに対する注目を可能にすることで、勾配消失問題を緩和する新規なRNNセルアーキテクチャ、入力セル注目(input-cell attention)を提案する。学習可能な注目行列を通じて関連する歴史的入力を注目することで、時間経過に伴う重要度(salience)を保持でき、特徴の時間的位置にかかわらず重要な特徴を正確に検出可能となる。この有効性は合成データおよびfMRI時系列データにおいて実証されており、標準的なRNNでは初期に現れる重要な特徴を検出できないことを示している。

ABSTRACT

Recent efforts to improve the interpretability of deep neural networks use saliency to characterize the importance of input features to predictions made by models. Work on interpretability using saliency-based methods on Recurrent Neural Networks (RNNs) has mostly targeted language tasks, and their applicability to time series data is less understood. In this work we analyze saliency-based methods for RNNs, both classical and gated cell architectures. We show that RNN saliency vanishes over time, biasing detection of salient features only to later time steps and are, therefore, incapable of reliably detecting important features at arbitrary time intervals. To address this vanishing saliency problem, we propose a novel RNN cell structure (input-cell attention), which can extend any RNN cell architecture. At each time step, instead of only looking at the current input vector, input-cell attention uses a fixed-size matrix embedding, each row of the matrix attending to different inputs from current or previous time steps. Using synthetic data, we show that the saliency map produced by the input-cell attention RNN is able to faithfully detect important features regardless of their occurrence in time. We also apply the input-cell attention RNN on a neuroscience task analyzing functional Magnetic Resonance Imaging (fMRI) data for human subjects performing a variety of tasks. In this case, we use saliency to characterize brain regions (input features) for which activity is important to distinguish between tasks. We show that standard RNN architectures are only capable of detecting important brain regions in the last few time steps of the fMRI data, while the input-cell attention model is able to detect important brain region activity across time without latter time step biases.

研究の動機と目的

  • RNN、特にLSTMにおける重要度マップが時間経過とともに消失する理由を解明し、後続の時刻ステップに偏った検出を引き起こす要因を特定すること。
  • 時系列データにおける既存の重要度ベースの解釈可能性手法の限界を是正するため、すべての時間間隔にわたり特徴の重要度を維持するメカニズムを提案すること。
  • 提案された入力セル注目メカニズムを合成時系列データおよび実世界のfMRIデータに対して評価し、神経科学分野における解釈可能性の向上を実証すること。
  • 標準RNNでは初期時刻ステップにおける重要特徴を検出できないが、本手法では全系列にわたり一貫した重要度検出が可能であることを示すこと。

提案手法

  • 現在および過去の時刻ステップからの入力ベクトルに注目できるように、学習可能な注目行列を組み込んだ改良型LSTMセルを導入する。
  • 各時刻ステップで、入力系列が固定サイズの行列に投影され、その入力に対して注目重みが計算され、重み付き表現が形成される。
  • その重み付き入力行列が標準LSTMセルの入力として使用され、ネットワークが時間経過に伴い動的に重要特徴に注目できるようになる。
  • 注目メカニズムは微分可能であり、エンド・トゥ・エンドで学習可能であり、RNNと注目部の両方を同時に最適化可能である。
  • 本手法はアーキテクチャに依存せず、任意のRNNまたはLSTMバリアントに対して、入力処理ステップを注目メカニズムに置き換えることで適用可能である。
  • 特徴の重要度は勾配ベースの手法(例:統合勾配)により計算され、時間経過にわたる特徴の重要度の解釈が可能となる。

実験結果

リサーチクエスチョン

  • RQ1標準RNN、特にLSTMでは、重要度が時間経過とともに消失し、後続の時刻ステップに偏った重要な特徴の検出が生じるか?
  • RQ2時刻ステップにわたる入力ベクトルに注目するメカニズムを適用することで、RNNにおける消失する重要度問題を緩和できるか?
  • RQ3入力セル注目は、自己注意や他の注目メカニズムと比較して、時系列データにおける重要度の時間的保持にどの程度優れているか?
  • RQ4入力セル注目は、fMRIを用いたタスク分類のような実世界の神経科学的応用において、解釈可能性を向上させられるか?

主な発見

  • 標準LSTMでは、時間経過に伴い重要度が著しく低下し、後続の時刻ステップでの特徴の重要度スコアが顕著に高くなるため、偏った特徴検出が生じる。
  • 提案された入力セル注目メカニズムは、合成時系列データにおいて全時間ステップにわたり重要度を効果的に保持し、特徴の時間的位置にかかわらず重要な特徴を信頼性高く検出可能である。
  • MNISTを時系列として扱うタスクでは、入力セル注目により全時間ステップでの重要度値が回復される一方、ヴァニラLSTMでは時間経過に伴い重要度が一貫して低下する。
  • ヒューマン・コンネクトーム・プロジェクトのfMRIデータにおいて、標準LSTMでは最終時刻ステップでのみ重要な脳領域が検出されるが、入力セル注目では全タスク期間にわたり重要な脳領域を同定可能である。
  • 重要特徴を除去した際、標準LSTMでは上位10%の重要特徴を除去しても精度がたった2%低下するため、信頼性が低いことが示され、一方入力セル注目では9.5%低下し、より正確な重要度検出が確認された。
  • 標準LSTMが同定する上位10%の重要特徴の70%以上が、タスク外の期間に由来しており、後続で非情報的な時刻ステップに偏ったバイアスが顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。