Skip to main content
QUICK REVIEW

[論文レビュー] Transferable Neural Processes for Hyperparameter Optimization

Ying Wei, Peilin Zhao|arXiv (Cornell University)|Sep 7, 2019
Machine Learning and Data Classification参考文献 29被引用数 5
ひとこと要約

本論文は、関連するデータセットにおける履歴的HPO試行から知識を転送することで、ベイズ最適化の速度を向上させるエンドツーエンドのハイパーパramータ最適化(HPO)手法である転送可能ニューラルプロセス(TNP)を提案する。TNPはデータセットに依存するアテンション機構を用いて類似するデータセットを動的に重み付けし、転送可能なモデルパラメータおよび初期ハイパーパramータ設定を学習し、ベースラインと比較して最大10倍少ない試行回数で最先端の性能を達成する。

ABSTRACT

Automated machine learning aims to automate the whole process of machine learning, including model configuration. In this paper, we focus on automated hyperparameter optimization (HPO) based on sequential model-based optimization (SMBO). Though conventional SMBO algorithms work well when abundant HPO trials are available, they are far from satisfactory in practical applications where a trial on a huge dataset may be so costly that an optimal hyperparameter configuration is expected to return in as few trials as possible. Observing that human experts draw on their expertise in a machine learning model by trying configurations that once performed well on other datasets, we are inspired to speed up HPO by transferring knowledge from historical HPO trials on other datasets. We propose an end-to-end and efficient HPO algorithm named as Transfer Neural Processes (TNP), which achieves transfer learning by incorporating trials on other datasets, initializing the model with well-generalized parameters, and learning an initial set of hyperparameters to evaluate. Experiments on extensive OpenML datasets and three computer vision datasets show that the proposed model can achieve state-of-the-art performance in at least one order of magnitude less trials.

研究の動機と目的

  • 極めて少ない試行回数でハイパーパramータ最適化(HPO)を実行する課題に取り組むこと、特に高コストで大規模なデータセットに対して有効であることを目的とする。
  • 収束に多数の試行を要する従来のSMBO手法の非効率性を克服すること。
  • 手動で定義されたメタ特徴量を用いずに、関連するデータセットからの履歴的試行を活用することで、HPOにおける効果的な転移学習を可能にすること。
  • 転送可能なモデル初期化、適応的類似度モデリング、最適化された初期設定を統合したスケーラブルでエンドツーエンドのHPOフレームワークを開発すること。
  • 手動で定義されたメタ特徴量ではなく、学習された表現を用いて動的にデータセット類似度を評価することで、負の転送を低減すること。

提案手法

  • TNPは、関数の分布を定義するためにニューラルプロセス(NPs)を補間モデルとして採用し、ニューラルネットワークの表現力とガウス過程による不確実性評価を統合する。
  • 各ハイパーパramータ-正解率観測値をエンコーダーで潜在表現に埋め込む。
  • データセットに依存するクロスアテンション機構を用いて、集約された観測表現を用いてターゲットデータセットと履歴データセット間の類似度を計算する。
  • アテンション機構からの潜在分布をデコーダーの入力として用い、新しいハイパーパラメータ設定の性能と不確実性を予測する。
  • メタラーニング戦略(MAMLに類似)を用いてエンドツーエンドで訓練し、補間モデルパラメータの転送可能な初期化を学習する。
  • TNPは、学習された転送可能な事前分布から得られる汎用性の高いハイパーパラメータ設定を初期化として採用し、収束を加速する。

実験結果

リサーチクエスチョン

  • RQ1関連するデータセットにおける履歴的HPO試行からの転移学習が、最適なハイパーパラメータを特定するための試行回数を著しく削減できるか?
  • RQ2手動で定義されたメタ特徴量に依存せずに、データセット類似度を効果的にモデリングできるか?
  • RQ3暗黙のカーネル学習を有するニューラルプロセス補間モデルは、多様なデータセットに一般化可能で、効率的にスケーリングできるか?
  • RQ4観測値、モデルパラメータ、初期設定の3つを併用した転送が、単一の情報源からの転送と比較して優れたHPO性能を達成できるか?
  • RQ5類似しないデータセットからの転送において、モデルは負の転送をどのように低減しているか?

主な発見

  • TNPは、OpenMLデータセットおよびCIFAR-10、SVHN、MNISTなどのコンピュータビジョンベンチマークで最先端の性能を達成し、ベースラインと比較して最大10倍少ない試行回数で収束する。
  • CIFAR-10データセットでは、わずか10回の試行で高い分類精度を達成し、GPベースの手法やランダムサーチでさえも上回る。
  • アブレーションスタディの結果、データセットに依存するアテンション、転送可能な初期化、一般化された初期設定の各要素がHPO性能の向上に顕著に寄与することが確認された。
  • モデルは、データセット間の類似度ベクトルを学習することで負の転送を効果的に回避し、関連するデータセット(breast-w)に対して類似度スコア0.5439、類似しないデータセット(mfeat-zernike)に対して0.1174を示した。
  • TNPは、履歴観測値を生成するベースライン手法に依存せず、ノイズが多いまたは最適でない事前データに対しても強力な性能を維持する。
  • 履歴データセット数が50を上回ると性能がわずかに低下する傾向を示しており、知識の多様性とノイズ蓄積のトレードオフがあると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。