Skip to main content
QUICK REVIEW

[논문 리뷰] Fair and Green Hyperparameter Optimization via Multi-objective and Multiple Information Source Bayesian Optimization

Antonio Candelieri, Andrea Ponti|arXiv (Cornell University)|2022. 05. 18.
Advanced Multi-Objective Optimization Algorithms인용 수 5
한 줄 요약

이 논문은 정확도와 공정성을 근사하기 위해 소규모 데이터 서브셋을 사용하여 공정하고 녹색인 초파rameter 최적화를 가속화하는 다목적, 다중 정보원 베이지안 최적화 프레임워크인 FanG-HPO를 제안한다. 표준 다목적 BO에 비해 훨씬 적은 수의 쿼리로 파레토 효율적인 모델을 달성함으로써, 벤치마크 공정성 데이터셋에서 모델 품질을 희생시키지 않고 계산 비용과 에너지 소비를 감소시킨다.

ABSTRACT

There is a consensus that focusing only on accuracy in searching for optimal machine learning models amplifies biases contained in the data, leading to unfair predictions and decision supports. Recently, multi-objective hyperparameter optimization has been proposed to search for machine learning models which offer equally Pareto-efficient trade-offs between accuracy and fairness. Although these approaches proved to be more versatile than fairness-aware machine learning algorithms -- which optimize accuracy constrained to some threshold on fairness -- they could drastically increase the energy consumption in the case of large datasets. In this paper we propose FanG-HPO, a Fair and Green Hyperparameter Optimization (HPO) approach based on both multi-objective and multiple information source Bayesian optimization. FanG-HPO uses subsets of the large dataset (aka information sources) to obtain cheap approximations of both accuracy and fairness, and multi-objective Bayesian Optimization to efficiently identify Pareto-efficient machine learning models. Experiments consider two benchmark (fairness) datasets and two machine learning algorithms (XGBoost and Multi-Layer Perceptron), and provide an assessment of FanG-HPO against both fairness-aware machine learning algorithms and hyperparameter optimization via a multi-objective single-source optimization algorithm in BoTorch, a state-of-the-art platform for Bayesian Optimization.

연구 동기 및 목표

  • 기계학습 초파라미터 최적화에서 공정성과 에너지 효율성의 이중적 과제를 해결하기 위해.
  • 공정한 기계학습 모델의 초파라미터 튜닝에 따른 계산 비용과 환경 비용을 줄이기 위해.
  • 최소한의 모델 훈련 및 검증 쿼리 수를 유지하면서도 높은 품질의 파레토 프론트를 유지하는 방법을 개발하기 위해.
  • 대규모 데이터셋에서 정확도, 공정성, 쿼리 효율성 간의 상호 상충 관계를 평가하기 위해.
  • BoTorch에서의 단일 정보원 다목적 BO와 비교하여 FanG-HPO의 성능을 평가하기 위해.

제안 방법

  • FanG-HPO는 대규모 데이터셋에서 소규모이고 대표적인 서브셋을 샘플링하여 정확도 및 공정성 지표를 근사함으로써 다중 정보원을 활용한다.
  • 정확도와 공정성을 동시에 최적화하기 위해 다목적 베이지안 최적화를 사용하며, 두 목표를 가우시안 프로세스로 모델링된 확률적 과정으로 간주한다.
  • 탐색과 이용의 균형을 맞추기 위해 다중 정보원을 고려한 이중 단계의 획득 함수를 설계하여 가장 정보가 많은 쿼리를 선택한다.
  • 전체 쿼리 비용을 최소화하기 위해 불확실성과 기대 향상도를 기반으로 쿼리를 동적으로 자원에 할당한다.
  • 쿼리 비용이 데이터 서브셋 크기에 따라 달라지는 비용 인식 모델링을 통합하여 에너지 효율적인 최적화를 가능하게 한다.
  • 기본 데이터셋에서의 실제 평가를 통해 파레토 프론트를 구성하지만, 최적화는 근사된 자원에서 수행된다.

실험 결과

연구 질문

  • RQ1다중 정보원 베이지안 최적화는 공정한 기계학습을 위한 다목적 초파라미터 최적화에서 모델 품질을 희생시키지 않고 쿼리 비용을 줄일 수 있는가?
  • RQ2FanG-HPO는 단일 정보원 다목적 BO(예: BoTorch)와 비교할 때 파레토 프론트 품질과 쿼리 효율성 측면에서 어떻게 다른가?
  • RQ3FanG-HPO는 공정성 인식 기반 기계학습 알고리즘(예: zlrm, fgrrm)에 비해 얼마나 높은 수준의 파레토 효율적인 모델을 식별할 수 있는가?
  • RQ4데이터 서브셋 사용이 초파라미터 튜닝에서 에너지 소비를 크게 줄일 수 있는가? 이는 공정성과 정확도를 유지하면서도 가능한가?
  • RQ5XGBoost와 MLP와 같은 다양한 기계학습 모델과 ADULT, COMPAS와 같은 다양한 공정성 데이터셋에서 FanG-HPO의 성능은 어떻게 변화하는가?

주요 결과

  • FanG-HPO는 BoTorch 기반의 다목적 최적화와 유사한 초체적 부피를 달성하지만, 전체 데이터셋에 대한 쿼리 수가 훨씬 적게 소요된다.
  • ADULT 및 COMPAS 데이터셋 모두에서, 특히 MLP 모델에 대해 고성능 파레토 솔루션을 도출하기 위해 필요한 전체 데이터셋 쿼리 수를 줄였다.
  • XGBoost 모델은 FanG-HPO를 통해 최적화된 결과로 대부분의 MLP 및 공정성 인식 알고리즘 모델을 파레토 측면에서 압도했으며, 정확도와 공정성 간의 더 우수한 트레이드오프를 달성했다.
  • zlrm 및 fgrrm에서 도출된 모델과 비교해 FanG-HPO가 도출한 모델은 파레토 효율성 측면에서 우월하거나 경쟁 가능했으며, 특히 ADULT 데이터셋에서 공정성 인식 알고리즘조차도 FanG-HPO에 뒤지지 않는 성능을 보였다.
  • 정보원 별 쿼리 수는 데이터셋과 모델에 따라 달라졌으며, FanG-HPO는 더 작은 정보가 많은 서브셋에 더 많은 쿼리를 할당함으로써 적응형 샘플링을 반영했다.
  • 이 프레임워크는 다중 데이터 서브셋 사용이 초파라미터 공간의 효율적 탐색을 가능하게 하며, 에너지 소비와 이산화탄소 배출량을 줄이는 데 기여함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.