Skip to main content
QUICK REVIEW

[論文レビュー] Surprisal-Triggered Conditional Computation with Neural Networks

Loren Lugosch, Derek Nowrouzezahrai|arXiv (Cornell University)|Jun 2, 2020
Neural Networks and Applications参考文献 84被引用数 5
ひとこと要約

本稿では、自己回帰的ニューラルネットワークを用いて入力の難易度を負の対数尤度で測定し、高速で小さなネットワークと遅く大きなネットワークの間で動的に切り替える、驚きに起因する条件付き計算フレームワークを提案する。2つの音声認識タスクにおいて、性能に低下を来さずにFLOPsを15%削減した。驚きは、効率的で適応的な推論のための有効な誘導的バイアスであることが示された。

ABSTRACT

Autoregressive neural network models have been used successfully for sequence generation, feature extraction, and hypothesis scoring. This paper presents yet another use for these models: allocating more computation to more difficult inputs. In our model, an autoregressive model is used both to extract features and to predict observations in a stream of input observations. The surprisal of the input, measured as the negative log-likelihood of the current observation according to the autoregressive model, is used as a measure of input difficulty. This in turn determines whether a small, fast network, or a big, slow network, is used. Experiments on two speech recognition tasks show that our model can match the performance of a baseline in which the big network is always used with 15% fewer FLOPs.

研究の動機と目的

  • 入力の難易度に基づいて、人間の認知モード(システム1:高速で低計算量、システム2:遅く高計算量)を模倣することで、ニューラルネットワークの計算効率を向上させること。
  • 自己回帰モデルからの負の対数尤度として測定される驚きが、条件付き計算をトリガーするための信頼性があり効果的な誘導的バイアスとして機能するかどうかを調査すること。
  • 常に大きなネットワークを使用するか、学習されたコントローラーを使用するのと比較して、このアプローチが計算コストとモデル性能の間でより良いトレードオフを達成できるかどうかを評価すること。
  • 自己回帰モデルが特徴抽出と入力難易度推定の両方の役割を果たすという、以前に実証されていなかった新しい応用を探索すること。

提案手法

  • 自己回帰モデル(例:RNN)が入力観測のストリームを処理し、同時に特徴を抽出し、次の観測を予測する。
  • 各入力の驚きは、自己回帰モデルにおける現在の観測の負の対数尤度として計算され、入力難易度の代理指標として機能する。
  • 低驚き(簡単)な入力には小さな高速ネットワークが使用され、驚きが学習されたしきい値を超えると、大きな遅いネットワークが起動される。
  • しきい値は検証セットを用いて決定され、強化学習や訓練が難しいコントローラーを必要とせず、入力の複雑さに応じた動的切り替えが可能になる。
  • ハード選択の決定をソフトな近似で行い、逆誤差伝搬が切り替え機構を通り抜けるように、エンド・ツー・エンドで学習される。
  • 本フレームワークは、TIMITとMini-LibriSpeechの2つの音声認識タスクで評価され、小さなネットワークと大きなネットワークを用い、さまざまなハイパーパrameterを変更して評価された。

実験結果

リサーチクエスチョン

  • RQ1自己回帰モデルからの負の対数尤度として測定される驚きは、入力難易度を信頼性高く示し、条件付き計算を誘導するのに適しているか?
  • RQ2難易度の高い入力でのみ大きなネットワークを起動する驚きを用いたアプローチは、常に大きなネットワークを使用するのと比較して、FLOPsと性能のトレードオフを改善するか?
  • RQ3学習されたコントローラーを用いたネットワーク選択モデルと比較して、驚きを用いたモデルの性能はどの程度か?
  • RQ4自己回帰モデルを特徴抽出と難易度推定の両方の目的に使用することは、実際の応用において有効で有益か?
  • RQ5驚きに基づくサンプリングを訓練段階で用いることで、さまざまなハイパーパrameter設定において一般化性能とロバストネスが向上するか?

主な発見

  • 驚きに起因する条件付き計算モデルは、TIMITデータセットにおいて、常に大きなネットワークを使用するベースラインと比較して15%のFLOPs削減を達成したが、性能に低下は見られなかった。
  • Mini-LibriSpeechでは、FLOPsを7.54M(常に大きなネットワーク)から6.43M(驚きに基づくサンプリング)に削減した一方で、WERは25.69%から25.80%に改善した。
  • 訓練時と推論時の両方で驚きに基づくサンプリングを用いたモデルはパレート最適な結果を達成し、FLOPsコストを低く抑えつつ、常に大きなネットワークを使用するモデルと同等またはそれを上回る性能を示した。
  • 学習済みコントローラーを用いたモデルと比較して、本モデルは分散が低く、ハイパーパrameterに依存しにくく、一般化性能に優れ、スケーリングが容易であることが示された。
  • 訓練時に驚きを使用しなかった場合でも、推論時に驚きを使用したモデルはわずかな改善(例:Mini-LibriSpeechでは26.16% vs. 26.04%のWER)を示し、ロバストネスが確認された。
  • アブレーションスタディにより、推論時の驚きに基づくサンプリングが、訓練時のものよりもより顕著な効果をもたらすことが確認され、両段階で驚きを用いることで最良の結果が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。