[論文レビュー] Multi-objective Asynchronous Successive Halving
本稿では、パラメータ探索のためのParetoフロント幾何学を活用するスケーラブルな多目的ハイパーパramータ最適化(MO-HPO)の拡張である、多目的非同期逐次半分法(MO ASHA)を提案する。神経ネットワークアーキテクチャ探索、フェアネス指向学習、言語モデリングの分野において、壁時計時間の観点でスカラライゼーションに基づく手法を上回る性能を発揮し、EpsNetを用いた選択法が実世界のタスクで最も優れた性能を示した。
Hyperparameter optimization (HPO) is increasingly used to automatically tune the predictive performance (e.g., accuracy) of machine learning models. However, in a plethora of real-world applications, accuracy is only one of the multiple -- often conflicting -- performance criteria, necessitating the adoption of a multi-objective (MO) perspective. While the literature on MO optimization is rich, few prior studies have focused on HPO. In this paper, we propose algorithms that extend asynchronous successive halving (ASHA) to the MO setting. Considering multiple evaluation metrics, we assess the performance of these methods on three real world tasks: (i) Neural architecture search, (ii) algorithmic fairness and (iii) language model optimization. Our empirical analysis shows that MO ASHA enables to perform MO HPO at scale. Further, we observe that that taking the entire Pareto front into account for candidate selection consistently outperforms multi-fidelity HPO based on MO scalarization in terms of wall-clock time. Our algorithms (to be open-sourced) establish new baselines for future research in the area.
研究の動機と目的
- 深層学習におけるスケーラブルで実世界の多目的ハイパーパramータ最適化(MO-HPO)手法の不足を解消すること。
- 非同期逐次半分法(ASHA)を多目的最適化に拡張し、効率的で並列処理可能かつ早期停止が可能なHPOを実現すること。
- 実際の応用において、Paretoフロント近似の幾何構造を意識した戦略がスカラライゼーションに基づくMO-HPOを上回るかを評価すること。
- 精度、フェアネス、待機時間、自己エントロピーなど、対立する目的を含む多様で実世界のタスクにおいて、新しいMO-HPOのベンチマークを確立すること。
- コミュニティの広範な採用と今後の研究を促進するため、AutoGluonに提案手法をオープンソース化すること。
提案手法
- 複数の忠実度レベルにわたりParetoフロント近似を維持することで、非同期逐次半分法(ASHA)を多目的最適化に拡張する。
- 2つの選択戦略を採用する:(1) スカラライゼーションに基づく(例:重み付き和、チコビチェフ)と、(2) EpsNetを用いてParetoフロントのグローバル構造を活用する幾何学的意識型。
- 逐次半分法による早期停止を活用し、性能が低い設定を早期に除外することで、壁時計時間のコストを削減する。
- 非支配順序付けとハイパーボリューム指標を用いて、最適化中のParetoフロント近似の評価と比較を実施する。
- ワーカー間での非同期かつ分散実行をサポートし、大規模なHPO環境におけるリソースの効率的利用を可能にする。
- モデルや目的に特化した変更を必要とせず、既存のMLパイプラインに統合可能であり、広範な適用性を有する。
実験結果
リサーチクエスチョン
- RQ1ASHAは、スケーラビリティと効率性を維持したまま、多目的ハイパーパramータ最適化に効果的に拡張可能か?
- RQ2Paretoフロント近似の全般的な幾何構造を活用することで、スカラライゼーションに基づく手法よりも優れたHPO性能が得られるか?
- RQ3多様な実世界のタスクにおいて、収束速度と最終的なParetoフロント品質の観点から、異なるMO-HPO戦略はどのように比較されるか?
- RQ4EpsNetのような幾何学的意識型選択メカニズムは、スカラライゼーションに基づくアプローチと比較して、著しく壁時計時間を短縮できるか?
- RQ5これらの手法は、ランダムサーチや最先端のフェアネス特化手法と比較して、フェアネス指向学習の分野でどの程度優れているか?
主な発見
- EpsNetを用いた選択戦略を採用したMO ASHAは、すべての3つの実世界タスクにおいて、支配されたハイパーボリュームと壁時計時間の両面でスカラライゼーションに基づく手法を一貫して上回った。
- 幾何学的意識型アプローチは、スカラライゼーション手法よりも高速に高品質なParetoフロントを回復でき、特にWikitext2言語モデリングタスクでEpsNetが最良の最終ハイパーボリュームを達成した。
- スカラライゼーションに基づく手法は、しばしばランダムサーチとほとんど変わらない性能にとどまり、複雑で高次元の探索空間では有効性が限定的であることが示された。
- フェアネス指向学習タスクでは、フェアネス閾値の事前知識を必要とせず、モデル特化型フェアネス手法(例:FERM, Zafar)と同等の結果を達成した。
- 言語モデリングタスクでは、ランダムサーチが生産性のない設定に膨大な計算リソースを費やしていたため、MO-HPOにおける知的探索の利点が顕著に現れた。
- 提案手法は大規模なスケールでも有効であることが実証され、言語モデリング実験では720 GPU時間の計算リソースが使用された。これは実用的妥当性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。