Skip to main content
QUICK REVIEW

[論文レビュー] Hyperparameter Learning via Distributional Transfer

Ho Chung Leon Law, Peilin Zhao|arXiv (Cornell University)|Oct 15, 2018
Gaussian Processes and Bayesian Inference参考文献 40被引用数 9
ひとこと要約

本稿では、トレーニングデータの分布を再生カーネルヒルバート空間に埋め込むことで、ハイパーパramータ学習タスク間での知識の転送を可能にするベイジアン最適化手法を提案する。この手法により、ハイパーパramータとデータ表現を統合的にモデリングでき、過去の全評価(最適でないものも含む)を活用することで、数回の評価で最適なハイパーパramータを素早く特定する。

ABSTRACT

Bayesian optimisation is a popular technique for hyperparameter learning but typically requires initial exploration even in cases where similar prior tasks have been solved. We propose to transfer information across tasks using learnt representations of training datasets used in those tasks. This results in a joint Gaussian process model on hyperparameters and data representations. Representations make use of the framework of distribution embeddings into reproducing kernel Hilbert spaces. The developed method has a faster convergence compared to existing baselines, in some cases requiring only a few evaluations of the target objective.

研究の動機と目的

  • ベイジアン最適化における「コールドスタート」問題に対処すること。これは、効果的なハイパーパramータチューニングを開始する前に初期評価が必要となる問題である。
  • 既存の転送学習手法が関数評価にのみ依存し、トレーニングデータセットの構造的情報を無視するという制限を克服すること。
  • ターゲットタスクの評価が一切ない状況でも、データ分布からのタスク固有の表現を学習し、有効な知識転送を可能にする手法を開発すること。
  • ハイパーパramータ、データ表現、サンプルサイズを統合的にモデリングするガウス過程フレームワークを用いて、ハイパーパラメータ最適化の収束速度を向上させること。
  • すべての過去の評価(最適でないものも含む)を活用することで、そのデータを破棄するベースラインと比較して、初期のハイパーパラメータ選定がより優れていることを示すこと。

提案手法

  • 特徴的カーネルを用いるなどして、分布埋め込み(例:特徴的カーネルを用いた)により、トレーニングデータセットを再生カーネルヒルバート空間内の要素として表現し、データ分布の構造的性質を捉える。
  • ハイパーパラメータ θ、データ分布 P_XY、サンプルサイズ s の3つの入力を統合的に扱うガウス過程モデルを構築し、タスク間での統合推論を可能にする。
  • データ分布間のカーネル化された類似度測度を用いてタスクの類似度を定量化し、ソースタスクから新しいターゲットタスクへの情報転送を可能にする。
  • すべての歴史的評価(最適でないハイパーパラメータ設定も含む)をGPモデルに組み込み、一般化性能の向上と探索の削減を図る。
  • 関数評価回数に線形にスケーラブルなハイパーパラメータ転送学習のフレームワークを実装する。
  • 期待改善(例:Expected Improvement)などの獲得関数を、統合入力空間上で用い、ターゲット性能の期待改善を最大化するハイパーパラメータを逐次選択する。

実験結果

リサーチクエスチョン

  • RQ1ターゲットタスクでの初期評価が不要な状況でも、データ分布埋め込みがタスク間での知識転送を可能にし、ハイパーパラメータ最適化を改善できるか?
  • RQ2ハイパーパラメータ、データ分布、サンプルサイズを統合的にモデリングすることで、標準的なベイジアン最適化と比較して収束速度がどのように向上するか?
  • RQ3手作業で設計されたメタ特徴量はハイパーパラメータ転送の性能にどの程度制限をもたらすか? また、学習された表現はこうした制限を克服できるか?
  • RQ4すべての過去の評価(最適でないものも含む)を活用することで、そのデータを破棄する手法と比較して、初期のハイパーパラメータ選定がより優れているか?
  • RQ5提案手法は、ターゲット目的関数の数回の評価でほぼ最適な性能に到達できるか?

主な発見

  • 提案手法 distGP は、一部のケースでワンショット最適化を達成し、ターゲット目的関数の1〜2回の評価で最適なハイパーパラメータ設定を特定している。
  • distGP は、回帰および分類タスクの両方で、multiGP、initGP、manualBO、multiBO といったベースラインと比較して、収束速度が顕著に優れている。
  • Protein データセットでは、distGP は Jaccard カーネル C-SVM およびランダムフォレストの最適値を、すべてのベースラインと比較してより速やかに達成している。
  • 本手法は、周辺統計や対比較統計では検出できないタスクの差異(例:予測変数の三重相互作用)に対しても、頑健であることが示された。
  • 手作業で設計されたメタ特徴量に依存するベースライン(例:manualBO)は、性能が著しく低く、その特徴量がタスクの差異に対して不変であるため、multiBO と同程度の性能にとどまっている。
  • initGP はウォームスタート後も収束が遅く、最良の評価結果のみを活用するのではなく、すべての歴史的評価を活用することが重要であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。