Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Inference with Neural Interpreters

Nasim Rahaman, Muhammad Waleed Gondal|arXiv (Cornell University)|Oct 12, 2021
Topic Modeling参考文献 47被引用数 9
ひとこと要約

この論文では、自己注意機構に基づくアーキテクチャであるNeural Interpretersを提案する。このアーキテクチャは、推論を動的にルーティングされ、再利用可能な計算モジュールである「関数」として因子分解する。これらの関数をエンド・ツー・エンドで学習することで、強力な体系的一般化とサンプル効率の良い少数ショット適応が達成され、視覚的推論タスクにおける分布外一般化においてビジョントランスフォーマーを上回る性能を示す。また、推論時に計算量と精度の動的トレードオフを可能にする。

ABSTRACT

Modern neural network architectures can leverage large amounts of data to generalize well within the training distribution. However, they are less capable of systematic generalization to data drawn from unseen but related distributions, a feat that is hypothesized to require compositional reasoning and reuse of knowledge. In this work, we present Neural Interpreters, an architecture that factorizes inference in a self-attention network as a system of modules, which we call \emph{functions}. Inputs to the model are routed through a sequence of functions in a way that is end-to-end learned. The proposed architecture can flexibly compose computation along width and depth, and lends itself well to capacity extension after training. To demonstrate the versatility of Neural Interpreters, we evaluate it in two distinct settings: image classification and visual abstract reasoning on Raven Progressive Matrices. In the former, we show that Neural Interpreters perform on par with the vision transformer using fewer parameters, while being transferrable to a new task in a sample efficient manner. In the latter, we find that Neural Interpreters are competitive with respect to the state-of-the-art in terms of systematic generalization

研究の動機と目的

  • 深層ニューラルネットワークが分布外データに対する体系的一般化に限界を示す問題に対処すること。特に構成的推論タスクにおいて。
  • 自己注意機構やCNN/RNNアーキテクチャにおける硬直的な計算再利用パターンを緩和し、モジュラーで関数ベースの推論メカニズムを導入すること。
  • 再利用可能で合成可能な計算ユニットを通じて、サンプル効率の良い少数ショット適応と訓練後容量拡張を可能にすること。
  • 学習されたモジュラー計算が、視覚的および抽象的推論における分布内および分布外一般化を両立できることを示すこと。
  • アブレーションと可視化を通じて、再利用可能な計算プリミティブの解釈可能性と学習可能性を検討すること。

提案手法

  • 自己注意ネットワークを学習可能な関数の集合に因子分解し、それぞれが計算モジュールとして機能する。
  • 入力はトークンの集合として処理され、微分可能ルーティング機構が順番に異なる関数を選択・合成する。
  • 関数の適用は微分可能でエンド・ツー・エンドで訓練可能であり、モデルが入力コンテキストに応じてどの関数を適用し、どの順序で適用するかを学習できる。
  • アーキテクチャは入力セットのサイズや関数の数に依存しないため、事前学習後に新しい関数を追加することで、非破壊的な容量拡張が可能である。
  • 関数の反復回数を変更することで、いつでも推論(anytime inference)を可能とし、推論時にパフォーマンスと計算量のトレードオフを実現できる。
  • 本手法は画像分類および視覚的抽象的推論(Raven’s Progressive Matrices)のベンチマークで評価され、ViTや他のSOTAモデルと比較されている。

実験結果

リサーチクエスチョン

  • RQ1ニューラルアーキテクチャは、再利用可能でモジュラーな関数のシーケンスを動的にルーティングすることで、体系的一般化を向上させることができるか?
  • RQ2Neural Interpretersのモジュラーなインダクティブバイアスは、標準的な自己注意機構と比較して、より優れた少数ショット適応および分布外一般化を実現できるか?
  • RQ3関数の反復回数を変更することで、パフォーマンスと計算量のトレードオフを滑らかに行い、いつでも予測が可能なアーキテクチャとして機能できるか?
  • RQ4学習された関数は、解釈可能で再利用可能な計算プリミティブとして対応可能であり、構成的推論を支援できるか?
  • RQ5事前学習後に追加された容量(例:より多くの関数)に伴い、モデルのパフォーマンスはどのようにスケーリングするか?

主な発見

  • Neural InterpretersはPGMデータセットで77.0%のテスト精度を達成し、ビジョントランスフォーマー(分布内:72.7%、テスト:70.5%)および6つのデータセットのうち4つで前人最高(SOTA)を上回った分布外一般化性能を示した。
  • 計算量を半分にした場合でも、元の性能の80%以上を維持したため、強力ないつでも推論(anytime inference)能力を示した。
  • 視覚的推論ベンチマークでは、'Extra.'レジームで91.8%の精度を達成し、ビジョントランスフォーマー(分布内:92.2%、テスト:16.4%)を上回った分布外一般化性能を示した。
  • 少数ショット画像分類では、パrameter数を減らしてもViTと同等のパフォーマンスを達成し、強いサンプル効率の高い転移学習性能を示した。
  • アブレーションスタディでは、広範なハイパーパramータの範囲で効果的なルーティングが得られ、可視化により一貫性があり解釈可能な関数使用パターンが確認された。
  • モデルは非破壊的な容量拡張を示した:新しい関数を追加し、再訓練なしに微調整可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。