Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Hyperparameter Optimization in Deep Learning Using a Variable Length Genetic Algorithm

Xueli Xiao, Ming Yan|arXiv (Cornell University)|Jun 23, 2020
Machine Learning and Data Classification参考文献 25被引用数 80
ひとこと要約

本論文では、CNNのハイパーパラメータ最適化のための可変長遺伝アルゴリズム(GA)を提案し、モデルの深さをフェーズごとに拡大し、クロスオーバーとウェイト移動を用いて、固定長GA・ランダム探索・大規模進化と比較して時間・リソース制約の下で優れた性能を示します。

ABSTRACT

Convolutional Neural Networks (CNN) have gained great success in many artificial intelligence tasks. However, finding a good set of hyperparameters for a CNN remains a challenging task. It usually takes an expert with deep knowledge, and trials and errors. Genetic algorithms have been used in hyperparameter optimizations. However, traditional genetic algorithms with fixed-length chromosomes may not be a good fit for optimizing deep learning hyperparameters, because deep learning models have variable number of hyperparameters depending on the model depth. As the depth increases, the number of hyperparameters grows exponentially, and searching becomes exponentially harder. It is important to have an efficient algorithm that can find a good model in reasonable time. In this article, we propose to use a variable length genetic algorithm (GA) to systematically and automatically tune the hyperparameters of a CNN to improve its performance. Experimental results show that our algorithm can find good CNN hyperparameters efficiently. It is clear from our experiments that if more time is spent on optimizing the hyperparameters, better results could be achieved. Theoretically, if we had unlimited time and CPU power, we could find the optimized hyperparameters and achieve the best results in the future.

研究の動機と目的

  • CNNのハイパーパラメータ最適化の課題と、モデルの深さが変化する場合に効率的な探索の必要性を動機づける。
  • CNNの深さを段階的に拡大して、より大きく固定されていないハイパーパラメータ空間を探索する可変長GAを提案する。
  • 現実的な計算予算の範囲内で高性能なCNN構成を見つけることを実証する。
  • 同様の時間・資源制約の下で、ランダム探索、固定長GA、大規模進化などのベースライン手法と比較する。

提案手法

  • 2つの畳み込み層から始め、フェーズを重ねるにつれて段階的に層を追加する可変長GAを使用する。
  • 各フェーズとともに拡張する染色体にハイパーパラメータを符号化し、最良フェーズの解をより深いモデルへ伝播する。
  • クロスオーバーと突然変異を組み込んで新しいハイパーパラメータ構成を生成し、深さを拡張する際には前の最良モデルからのウェイト移動を行う。
  • 計算資源を節約するため、固定された少数のエポック数(5)後の検証精度を適応度として評価し、深いモデルを初期化する際にはウェイト移動を用いる。
  • 停止基準が満たされた後、各フェーズの最良モデルをさらに収束させるまで訓練する。
  • フェーズ間で最良適応度の0.01低下を超える改善が得られなくなった時点で探索を停止できるようにする。

実験結果

リサーチクエスチョン

  • RQ1可変長染色体GAは事前に最大深さを設定せずにCNNハイパーパラメータを効果的に最適化できるか?
  • RQ2クロスオーバーとウェイト移動は限られた計算資源の下で高性能なCNNアーキテクチャの探索をより効率的に可能にするか?
  • RQ3可変長GAは同様の時間予算の下でランダム探索、固定長GA、および大規模進化と比較してどう性能を発揮するか?
  • RQ4より深いアーキテクチャが意味のある利得を提供しなくなる停止条件は何か?

主な発見

  • 可変長GAはCIFAR-10で約24.55時間以内に88.92%のテスト精度を持つモデルを発見した。
  • 深さを増やすと初期の利得が速く現れ、後のフェーズで改善が鈍化する。
  • 同様の時間制約の下で、提案手法はランダム探索(58.66%)、古典的GA(80.75%)、大規模進化(51.90%)を上回った。
  • 全体の進化は25時間未満で完了し、フェーズ13の最良モデルがさらなる訓練のために選択された。
  • 深さ拡張時のウェイト転送は訓練時間を節約し、より深いアーキテクチャの評価をより効率的にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。