Skip to main content
QUICK REVIEW

[論文レビュー] Fraternal Dropout

Konrad Żołna, Devansh Arpit|arXiv (Cornell University)|Oct 31, 2017
Topic Modeling参考文献 13被引用数 8
ひとこと要約

この論文では、同じ重みを持つ2つの同一のRNNを、異なるドロップアウトマスクを用いて学習させつつ、その前ソフトマックス出力の差を最小化することで、ドロップアウトの変動に対してより頑健になるように正則化する、新しいRNN正則化手法である『 fraternal dropout 』を提案する。この手法は、言語理解タスク(Penn Treebank や Wikitext-2)において最先端の性能を達成し、画像キャプション生成や半教師あり学習において顕著な向上を示す。

ABSTRACT

Recurrent neural networks (RNNs) are important class of architectures among neural networks useful for language modeling and sequential prediction. However, optimizing RNNs is known to be harder compared to feed-forward neural networks. A number of techniques have been proposed in literature to address this problem. In this paper we propose a simple technique called fraternal dropout that takes advantage of dropout to achieve this goal. Specifically, we propose to train two identical copies of an RNN (that share parameters) with different dropout masks while minimizing the difference between their (pre-softmax) predictions. In this way our regularization encourages the representations of RNNs to be invariant to dropout mask, thus being robust. We show that our regularization term is upper bounded by the expectation-linear dropout objective which has been shown to address the gap due to the difference between the train and inference phases of dropout. We evaluate our model and achieve state-of-the-art results in sequence modeling tasks on two benchmark datasets - Penn Treebank and Wikitext-2. We also show that our approach leads to performance improvement by a significant margin in image captioning (Microsoft COCO) and semi-supervised (CIFAR-10) tasks.

研究の動機と目的

  • フィードフォワードネットワークと比較して、再帰的ニューラルネットワーク(RNN)の最適化が難しいという問題に取り組む。
  • ドロップアウトに基づく正則化における、学習段階と推論段階の乖離を軽減する。
  • 異なるドロップアウトマスク下での不変表現を促進することで、RNNの一般化性能と頑健性を向上させる。
  • 標準的なシーケンスモデリングベンチマークおよびトランスファータスクで最先端の結果を達成する。

提案手法

  • 学習中に同じパラメータを持つが異なるドロップアウトマスクを用いた2つの同一のRNNを訓練する。
  • 2つのRNNの前ソフトマックス出力のL2差を最小化することで、頑健性を促進する。
  • 正則化を期待線形ドロップアウト目的関数の上界を保証する制約として定式化する。
  • 得られた損失関数を用いて学習を安定化させ、学習と推論のギャップを低減する。
  • 言語モデリング、画像キャプション生成、半教師あり学習タスクにこの手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1異なるドロップアウトマスクを用いて2つの同一のRNNを学習させることで、一般化性能と頑健性が向上するか?
  • RQ2このアプローチは、ドロップアウトベースのモデルにおける学習段階と推論段階の乖離を軽減するか?
  • RQ3『 fraternal dropout 』は、シーケンスモデリングベンチマークで最先端の性能を達成できるか?
  • RQ4この手法は、言語タスク以外のタスク(例:画像キャプション生成や半教師あり学習)にも一般化可能か?

主な発見

  • 『 fraternal dropout 』は、Penn Treebank および Wikitext-2 の言語モデリングベンチマークで最先端の結果を達成した。
  • この手法は、Microsoft COCO 画像キャプションタスクの性能を顕著に向上させた。
  • CIFAR-10 における半教師あり学習タスクでも、顕著な性能向上を示した。
  • 正則化項は期待線形ドロップアウト目的関数によって上界で抑えられ、理論的安定性が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。