Skip to main content
QUICK REVIEW

[論文レビュー] Low-Cost Recurrent Neural Network Expected Performance Evaluation

Andrés Camero, Jamal Toutouh|arXiv (Cornell University)|May 18, 2018
Machine Learning and Data Classification参考文献 22被引用数 11
ひとこと要約

この論文では、ランダムな重み初期化をサンプリングし、得られた平均絶対誤差(MAE)に切り捨て正規分布をフィッティングすることで、再帰的ニューラルネットワーク(RNN)アーキテクチャの期待性能を訓練なしで低コストで推定する手法を提案する。主な貢献は、推定された低MAEを達成する確率と、訓練後の実際のMAEとの間に強い負の相関(r ≈ -0.7 から -0.9)が存在することであり、これにより、完全な訓練を伴わずに効率的なハイパーパramータ探索が可能になる。

ABSTRACT

Recurrent neural networks are a powerful tool, but they are very sensitive to their hyper-parameter configuration. Moreover, training properly a recurrent neural network is a tough task, therefore selecting an appropriate configuration is critical. Varied strategies have been proposed to tackle this issue. However, most of them are still impractical because of the time/resources needed. In this study, we propose a low computational cost model to evaluate the expected performance of a given architecture based on the distribution of the error of random samples of the weights. We empirically validate our proposal using three use cases. The results suggest that this is a promising alternative to reduce the cost of exploration for hyper-parameter optimization.

研究の動機と目的

  • ハイパーパramータ探索におけるRNNの訓練にかかる計算コストの高い問題に対処すること。
  • RNNアーキテクチャの期待性能を推定する高速で訓練を要しない手法を開発すること。
  • 完全な訓練に依存することを減らすことで、大規模なハイパーパramータ空間の効率的探索を可能にすること。
  • エネルギー消費やパーキング空き状況といった実世界の時系列データセットを用いて、手法の妥当性を検証すること。
  • ランダムな重み初期化のサンプリングが、アーキテクチャの順位付けや初期化のヒューリスティックとしての可能性を検討すること。

提案手法

  • 指定されたRNNアーキテクチャに対して、複数回の試行で正規分布からランダムに重みを初期化する。
  • 各ランダムな重み設定に対して、検証セットにおける平均絶対誤差(MAE)を計算する。
  • 観測されたMAE値に切り捨て正規分布をフィッティングし、目的のMAE閾値を下回る確率を推定する。
  • 閾値における推定された累積分布関数(CDF)の値を、アーキテクチャの性能代理指標として用いる。
  • 完全な訓練を避けて、低誤差を達成する確率に基づいてアーキテクチャを順位付けする。
  • Adam最適化子を用いた訓練後の実際のMAEと比較することで、推定確率の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1完全な訓練を伴わずに、ランダムな重み初期化のサンプリングがRNN性能の信頼できる推定を可能にするか?
  • RQ2推定された低誤差を達成する確率と、訓練後の実際のMAEとの間に強い相関が存在するか?
  • RQ3提案手法が、期待性能の観点から異なるRNNアーキテクチャをどの程度うまく順位付けできるか?
  • RQ4この手法は、RNNを越えた他のディープラーニングアーキテクチャにも一般化可能か?
  • RQ5推定された確率は、ニューロン数やアーキテクチャの深さと相関するか?

主な発見

  • 3つのデータセットすべてにおいて、推定された低MAEを達成する確率と、訓練後の実際のMAEとの間に中程度から強い負の相関(r ≈ -0.7 から -0.9)が観察された。
  • 1つの隠れ層と最大100個のLSTMセルを備えたスタックドRNNアーキテクチャの相対的性能を、この手法が的確に予測した。
  • ランダムサンプリングからの推定確率は、最終的な訓練誤差を予測可能であり、訓練なしでアーキテクチャの順位付けが可能になった。
  • サンプリング手法に基づく最良のアーキテクチャは、完全な訓練後も常に上位に位置づけられた。
  • 完全な訓練の必要性が著しく減少し、ハイパーパramータ探索における計算コストが大幅に低減された。
  • 自動ニューラルアーキテクチャサーチにおけるヒューリスティックとしての応用が有望であり、より深くまたは異なるネットワークタイプへの応用も可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。