[論文レビュー] YAHPO Gym -- An Efficient Multi-Objective Multi-Fidelity Benchmark for Hyperparameter Optimization
YAHPO Gym は、14 の多様なシナリオと700以上のHPO問題を含む、サーヴィエイントベースで、マルチファシリティかつマルチオブジェクティブなハイパーパラメータ最適化(HPO)のベンチマークライブラリである。本研究では、テーブル型ベンチマークが性能順位付けにバイアスをもたらす可能性があることを示し、代替としてサーヴィエイントモデルが単一およびマルチオブジェクティブな設定においてより忠実で、効率的かつ現実的なHPO手法の評価を可能にすることを示している。
When developing and analyzing new hyperparameter optimization methods, it is vital to empirically evaluate and compare them on well-curated benchmark suites. In this work, we propose a new set of challenging and relevant benchmark problems motivated by desirable properties and requirements for such benchmarks. Our new surrogate-based benchmark collection consists of 14 scenarios that in total constitute over 700 multi-fidelity hyperparameter optimization problems, which all enable multi-objective hyperparameter optimization. Furthermore, we empirically compare surrogate-based benchmarks to the more widely-used tabular benchmarks, and demonstrate that the latter may produce unfaithful results regarding the performance ranking of HPO methods. We examine and compare our benchmark collection with respect to defined requirements and propose a single-objective as well as a multi-objective benchmark suite on which we compare 7 single-objective and 7 multi-objective optimizers in a benchmark experiment. Our software is available at [https://github.com/slds-lmu/yahpo_gym].
研究の動機と目的
- ハイパーパラメータ最適化(HPO)のための標準的で、効率的かつ現実的なベンチマークの不足に取り組むこと。このベンチマークは、現実世界の課題を反映する必要がある。
- グリッドベースのサンプリングに依存するため、テーブル型ベンチマークがHPO手法の性能順位付けにバイアスをもたらす可能性があることを示すこと。
- 高品質でスケーラブルな近似を提供する、サーヴィエイントベースのベンチマークライブラリを構築すること。マルチファシリティおよびマルチオブジェクティブHPOをサポートする。
- 多様な機械学習シナリオにおいてHPOアルゴリズムを評価・比較するための統一的で拡張可能で、コミュニティがアクセス可能なテストベッドを提供すること。
- メタラーニングおよびメタ最適化の応用を可能にするために、大規模で多様で、クエリが安価なベンチマークスイートを提供すること。
提案手法
- ベンチマークは、14の異なるシナリオ(それぞれ異なるアルゴリズムとデータセットを含む)における機械学習パイプラインの事前計算済み評価に基づいて訓練されたサーヴィエイントモデルを用いて構築されている。
- 各シナリオでは、共通の探索空間とパフォーマンス指標が使用され、ハイパーパramータ設定が複数のファシリティレベル(例:5%から100%までのトレーニングサイズ)で評価されている。
- サーヴィエイントモデルは、高性能計算(9.8 CPU年)で収集されたデータにフィットさせられ、リサンプリングを用いて異なるトレーニングセットの割合におけるマルチファシリティ評価を可能にしている。
- ライブラリは単一およびマルチオブジェクティブ最適化をサポートしており、バージョニングされたサーヴィエイントモデルセットが標準化されたAPIを通じて利用可能である。
- ベンチマークは条件付きハイパーパramータ(例:スーパーラーナーのシナリオ)を含み、既存の機械学習パイプラインおよびHPOツールキットと統合されている。
- ベンチマークはApache 2.0ライセンスのもとでリリースされ、GitHubにホスティングされ、包括的なドキュメンテーションが提供されている。
実験結果
リサーチクエスチョン
- RQ1テーブル型ベンチマークは、事前に定義されたグリッドに依存するため、より現実的なサーヴィエイントベースのベンチマークと比較して、HPO手法の性能順位付けにバイアスをもたらすのか?
- RQ2サーヴィエイントベースのベンチマークは、多様な探索空間と目的関数に対して、HPO手法のより忠実で代表的な評価を可能にするのか?
- RQ3異なるHPO手法は、マルチファシリティおよびマルチオブジェクティブ最適化をサポートする大規模で多様で現実的なベンチマークスイートにおいて、どのように性能を発揮するのか?
- RQ4サーヴィエイントモデルは、現実世界のHPOシナリオにおける真の目的関数の形状をどの程度正確に近似できるのか?
- RQ5提案されたベンチマークスイートは、多数の評価と多様な問題インスタンスを必要とするメタラーニングおよびメタ最適化の応用をサポートできるのか?
主な発見
- テーブル型ベンチマークは、固定で事前計算されたグリッドに依存するため、HPO手法の性能順位付けに顕著なバイアスをもたらす。これは、最適化問題の本質を変える要因となる。
- YAHPO Gym のようなサーヴィエイントベースのベンチマークは、単一およびマルチオブジェクティブな設定の両方において、より忠実な性能推定を可能にし、HPO手法の真の順位付けをよりよく反映する。
- YAHPO Gym のサーヴィエイントモデルは、14のすべてのシナリオにわたる広範な評価を通じて、真の目的関数の形状を高品質に近似していることが検証された。
- ベンチマークスイートには、14の異なる機械学習シナリオから導出された700以上のマルチファシリティでマルチオブジェクティブなHPO問題が含まれており、それぞれが多様な探索空間とデータセットを持つ。
- ライブラリは、545万件のハイパーパramータ設定がベンチマークスイート全体で評価された、効率的でスケーラブルで再現可能なHPO手法の評価を可能にしている。
- YAHPO Gym は、条件付きハイパーパラメータやマルチファシリティ評価をサポートしており、メタラーニングおよびメタ最適化の応用に適した、高度なHPOワークロードを処理できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。