Skip to main content
QUICK REVIEW

[論文レビュー] Controlling Computation versus Quality for Neural Sequence Models

Ankur Bapna, Naveen Arivazhagan|arXiv (Cornell University)|Feb 17, 2020
Topic Modeling参考文献 33被引用数 13
ひとこと要約

本稿では、学習可能な制御ネットワークを用いて推論時計算を動的に制御する、条件付き計算Transformer(CCT)を提案する。多タスク学習により異なる計算予算で訓練することで、全予算下でも競争力のある性能を達成するとともに、制限された予算下ではベースラインを著しく上回り、入力の複雑さやリソース制限に応じた効率的で適応的な推論を可能にする。

ABSTRACT

Most neural networks utilize the same amount of compute for every example independent of the inherent complexity of the input. Further, methods that adapt the amount of computation to the example focus on finding a fixed inference-time computational graph per example, ignoring any external computational budgets or varying inference time limitations. In this work, we utilize conditional computation to make neural sequence models (Transformer) more efficient and computation-aware during inference. We first modify the Transformer architecture, making each set of operations conditionally executable depending on the output of a learned control network. We then train this model in a multi-task setting, where each task corresponds to a particular computation budget. This allows us to train a single model that can be controlled to operate on different points of the computation-quality trade-off curve, depending on the available computation budget at inference time. We evaluate our approach on two tasks: (i) WMT English-French Translation and (ii) Unsupervised representation learning (BERT). Our experiments demonstrate that the proposed Conditional Computation Transformer (CCT) is competitive with vanilla Transformers when allowed to utilize its full computational budget, while improving significantly over computationally equivalent baselines when operating on smaller computational budgets.

研究の動機と目的

  • 標準Transformerが入力の複雑さや利用可能なリソースにかかわらず固定の計算量を使用するという柔軟性の欠如に対処すること。
  • 推論時に入力の難易度と利用可能な計算リソースに基づいて、例ごとに動的に計算量を調整できる、リアルタイムでの調整を可能にすること。
  • 各予算に対して再訓練を必要とせず、複数の計算-品質トレードオフにわたって効率的に動作できる1つのモデルを訓練すること。
  • ソフトゲーティングの訓練と離散的な推論時の意思決定の間のギャップを埋める微分可能訓練方式を開発すること。
  • 条件付き計算をデコーダ層にとどめず、エンコーダーおよびアテンションサブネットワークにも拡張し、適用範囲を広げること。

提案手法

  • 各Transformer層に、訓練中は0〜1の連続値を出力する制御ネットワークを導入し、シグモイド活性化関数を用いたゲート関数を採用する。
  • 訓練中に確率的ソフトゲーティングを適用:各層の出力は、完全な計算と残差の重み付き和で構成され、ゲート値によって制御される。
  • ゲートネットワークの事前活性化に平均0のガウスノイズを適用し、離散的動作を促進し、一般化性能を向上させる。
  • 推論時、ゲート値を0.5でしきい値処理する:ゲート値が0.5以上ならサブネットワークを実行し、そうでなければスキップする。
  • 各タスクが異なるターゲット計算予算に対応する多タスク目的関数を用いて、モデル全体をエンドツーエンドで訓練する。
  • エンコーダーおよびデコーダーのサブネットワークにこのフレームワークを適用し、自己アテンション内のキー・バリュー投影を含め、計算に対する細かい制御を可能にする。

実験結果

リサーチクエスチョン

  • RQ1入力の複雑さと利用可能な予算に基づいて、1つのTransformerモデルが入力ごとに計算量を動的に調整できるか?
  • RQ2学習可能な制御ネットワークによる条件付き計算は、異なる計算予算下でモデルの品質と効率にどのように影響を与えるか?
  • RQ3微分可能なソフトゲーティングを用いてエンドツーエンドで訓練できるが、依然として離散的な推論時の意思決定を可能にするか?
  • RQ4モデルは、難易度の異なる入力に対して計算を効率的に割り当てることを学習するか?
  • RQ5提案手法は、デコーダ層にとどまらず、アテンション投影やエンコーダー層などの他のコンponentsに対しても適用可能か?

主な発見

  • 条件付き計算Transformer(CCT)は、全計算予算が与えられた場合、標準Transformerと同等の性能を達成する。
  • より小さい計算予算下では、WMT英仏翻訳およびBERT風の自己教師付き表現学習の両方において、計算量が同等のベースラインを著しく上回る。
  • 制御ネットワークの出力から、モデルが難しい入力に対してより複雑なサブネットワークを活性化していることが明らかになり、知的な計算割り当てを実現していることが示された。
  • モデルは、簡単な入力に対して不要な計算をスキップすることで、品質の著しい損失を伴わずに推論コストを削減することが有効に学習されている。
  • 多タスク訓練目的関数により、1つのモデルが複数の計算予算に一般化可能であり、オンデマンド推論をサポートしている。
  • 可視化から、キーやバリューのサブネットワークが、翻訳における構造的に複雑な部分に対応するトークンに対して選択的に活性化されていることが示され、意味のある計算制御が実現していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。