Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-objective Asynchronous Successive Halving

Robin Schmucker, Michele Donini|arXiv (Cornell University)|2021. 06. 23.
Distributed and Parallel Computing Systems참고 문헌 61인용 수 8
한 줄 요약

이 논문은 다중 목적의 하이퍼파ram터 최적화(MO-HPO)를 위한 확장된 ASHA인 다중 목적 비동기 성공 반감법(MO ASHA)을 제안한다. 이는 후보 선택을 위해 파레토(front) 기하학적 구조를 활용하며, 신경망 아키텍처 탐색, 공정성 인식 학습, 언어 모델링 등에서 벽시계 시간 측면에서 스칼라화 기반 방법보다 뛰어난 성능을 보인다. 특히 EpsNet 기반 선택 전략이 실제 작업에서 가장 뛰어난 성능을 보였다.

ABSTRACT

Hyperparameter optimization (HPO) is increasingly used to automatically tune the predictive performance (e.g., accuracy) of machine learning models. However, in a plethora of real-world applications, accuracy is only one of the multiple -- often conflicting -- performance criteria, necessitating the adoption of a multi-objective (MO) perspective. While the literature on MO optimization is rich, few prior studies have focused on HPO. In this paper, we propose algorithms that extend asynchronous successive halving (ASHA) to the MO setting. Considering multiple evaluation metrics, we assess the performance of these methods on three real world tasks: (i) Neural architecture search, (ii) algorithmic fairness and (iii) language model optimization. Our empirical analysis shows that MO ASHA enables to perform MO HPO at scale. Further, we observe that that taking the entire Pareto front into account for candidate selection consistently outperforms multi-fidelity HPO based on MO scalarization in terms of wall-clock time. Our algorithms (to be open-sourced) establish new baselines for future research in the area.

연구 동기 및 목표

  • 딥러닝 분야에서 실용적이고 확장 가능한 다중 목적 하이퍼파ram터 최적화(MO-HPO) 방법의 부족을 해결하기 위해.
  • 비동기 성공 반감법(ASHA)을 다중 목적 최적화 환경으로 확장하여 효율적이고 병렬 처리가 가능하며, 조기 정지 기능을 갖춘 HPO를 가능하게 하기 위해.
  • 실제 환경에서 파레토 프론트 근사 전략의 기하학적 인식이 스칼라화 기반 MO-HPO보다 우수한가를 평가하기 위해.
  • 정확도, 공정성, 지연 시간, 퍼즐리티 등 상충되는 목표를 수반하는 다양한 실제 작업에 대해 MO-HPO의 새로운 기준을 설정하기 위해.
  • 더 넓은 커뮤니티의 채택과 향후 연구를 위해 AutoGluon에 제안된 알고리즘을 오픈소스화하기 위해.

제안 방법

  • 다양한 신뢰도 수준에서 파레토 프론트 근사를 유지함으로써 비동기 성공 반감법(ASHA)을 다중 목적 최적화로 확장한다.
  • 두 가지 선택 전략을 사용한다: (1) 스칼라화 기반(예: 가중합, 티체비체프) 및 (2) EpsNet를 활용해 파레토 프론트의 전반적인 구조를 활용하는 기하학적 인식 전략.
  • 성능이 열 劣한 설정을 조기에 제거하기 위해 성공 반감법을 통한 조기 정지를 사용하여 벽시계 비용을 감소시킨다.
  • 최적화 과정 중 파레토 프론트 근사를 평가하고 비교하기 위해 비지배적 정렬과 초체적량 지표를 적용한다.
  • 작업자 간 비동기적이고 분산된 실행을 지원하여 대규모 HPO 환경에서 자원을 효율적으로 활용할 수 있도록 한다.
  • 모델이나 목표에 특화된 수정 없이 기존의 머신러닝 파ip라인과 통합 가능하여 광범위한 적용 가능성을 확보한다.

실험 결과

연구 질문

  • RQ1확장성과 효율성을 유지하면서 ASHA를 다중 목적 하이퍼파ram터 최적화로 효과적으로 확장할 수 있는가?
  • RQ2파레토 프론트 근사의 전체 기하학적 구조를 활용하면 스칼라화 기반 방법보다 더 나은 HPO 성능을 얻을 수 있는가?
  • RQ3다양한 실제 작업에서 수렴 속도와 최종 파레토 프론트 품질 측면에서 다양한 MO-HPO 전략 간의 성능을 어떻게 비교할 수 있는가?
  • RQ4EpsNet와 같은 기하학적 인식 선택 메커니즘이 스칼라화 기반 접근보다 벽시계 시간을 크게 줄일 수 있는가?
  • RQ5이러한 방법들이 공정성 인식 학습에서 무작위 탐색과 최첨단 공정성 전용 방법보다 얼마나 뛰어나게 성능을 내는가?

주요 결과

  • 모든 세 가지 실제 작업에서 MO ASHA는 EpsNet 기반 선택 전략을 통해 스칼라화 기반 방법보다 더 높은 지배 초체적량과 더 나은 벽시계 시간을 확보했다.
  • 기하학적 인식 접근 전략은 스칼라화 방법보다 더 빨리 고품질의 파레토 프론트를 복원했으며, 특히 Wikitext2 언어 모델링 작업에서 EpsNet가 가장 높은 최종 초체적량을 달성했다.
  • 스칼라화 기반 방법은 종종 무작위 탐색과 비슷한 성능을 보여, 복잡하고 고차원적인 탐색 공간에서의 효과성이 제한됨을 시사했다.
  • 공정성 인식 학습 작업에서 MO ASHA는 공정성 임계치에 대한 사전 지식이 필요 없이도 모델 특화 공정성 방법(FERM, Zafar 등)과 경쟁 가능한 성능을 달성했다.
  • 언어 모델링 작업에서 무작위 탐색은 생산성이 떨어지는 설정에 상당한 계산 자원을 낭비했으며, 이는 MO-HPO에서 지능적인 탐색의 유용성을 강조한다.
  • 제안된 알고리즘은 규모가 큰 환경에서도 효과적임을 입증했으며, 언어 모델링 실험에서 720 GPU 시간을 소비한 것으로 나타나 실용적인 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.