[논문 리뷰] Fair and Green Hyperparameter Optimization via Multi-objective and Multiple Information Source Bayesian Optimization
이 논문은 정확도와 공정성을 근사하기 위해 소규모 데이터 서브셋을 사용하여 공정하고 녹색인 초파rameter 최적화를 가속화하는 다목적, 다중 정보원 베이지안 최적화 프레임워크인 FanG-HPO를 제안한다. 표준 다목적 BO에 비해 훨씬 적은 수의 쿼리로 파레토 효율적인 모델을 달성함으로써, 벤치마크 공정성 데이터셋에서 모델 품질을 희생시키지 않고 계산 비용과 에너지 소비를 감소시킨다.
There is a consensus that focusing only on accuracy in searching for optimal machine learning models amplifies biases contained in the data, leading to unfair predictions and decision supports. Recently, multi-objective hyperparameter optimization has been proposed to search for machine learning models which offer equally Pareto-efficient trade-offs between accuracy and fairness. Although these approaches proved to be more versatile than fairness-aware machine learning algorithms -- which optimize accuracy constrained to some threshold on fairness -- they could drastically increase the energy consumption in the case of large datasets. In this paper we propose FanG-HPO, a Fair and Green Hyperparameter Optimization (HPO) approach based on both multi-objective and multiple information source Bayesian optimization. FanG-HPO uses subsets of the large dataset (aka information sources) to obtain cheap approximations of both accuracy and fairness, and multi-objective Bayesian Optimization to efficiently identify Pareto-efficient machine learning models. Experiments consider two benchmark (fairness) datasets and two machine learning algorithms (XGBoost and Multi-Layer Perceptron), and provide an assessment of FanG-HPO against both fairness-aware machine learning algorithms and hyperparameter optimization via a multi-objective single-source optimization algorithm in BoTorch, a state-of-the-art platform for Bayesian Optimization.
연구 동기 및 목표
- 기계학습 초파라미터 최적화에서 공정성과 에너지 효율성의 이중적 과제를 해결하기 위해.
- 공정한 기계학습 모델의 초파라미터 튜닝에 따른 계산 비용과 환경 비용을 줄이기 위해.
- 최소한의 모델 훈련 및 검증 쿼리 수를 유지하면서도 높은 품질의 파레토 프론트를 유지하는 방법을 개발하기 위해.
- 대규모 데이터셋에서 정확도, 공정성, 쿼리 효율성 간의 상호 상충 관계를 평가하기 위해.
- BoTorch에서의 단일 정보원 다목적 BO와 비교하여 FanG-HPO의 성능을 평가하기 위해.
제안 방법
- FanG-HPO는 대규모 데이터셋에서 소규모이고 대표적인 서브셋을 샘플링하여 정확도 및 공정성 지표를 근사함으로써 다중 정보원을 활용한다.
- 정확도와 공정성을 동시에 최적화하기 위해 다목적 베이지안 최적화를 사용하며, 두 목표를 가우시안 프로세스로 모델링된 확률적 과정으로 간주한다.
- 탐색과 이용의 균형을 맞추기 위해 다중 정보원을 고려한 이중 단계의 획득 함수를 설계하여 가장 정보가 많은 쿼리를 선택한다.
- 전체 쿼리 비용을 최소화하기 위해 불확실성과 기대 향상도를 기반으로 쿼리를 동적으로 자원에 할당한다.
- 쿼리 비용이 데이터 서브셋 크기에 따라 달라지는 비용 인식 모델링을 통합하여 에너지 효율적인 최적화를 가능하게 한다.
- 기본 데이터셋에서의 실제 평가를 통해 파레토 프론트를 구성하지만, 최적화는 근사된 자원에서 수행된다.
실험 결과
연구 질문
- RQ1다중 정보원 베이지안 최적화는 공정한 기계학습을 위한 다목적 초파라미터 최적화에서 모델 품질을 희생시키지 않고 쿼리 비용을 줄일 수 있는가?
- RQ2FanG-HPO는 단일 정보원 다목적 BO(예: BoTorch)와 비교할 때 파레토 프론트 품질과 쿼리 효율성 측면에서 어떻게 다른가?
- RQ3FanG-HPO는 공정성 인식 기반 기계학습 알고리즘(예: zlrm, fgrrm)에 비해 얼마나 높은 수준의 파레토 효율적인 모델을 식별할 수 있는가?
- RQ4데이터 서브셋 사용이 초파라미터 튜닝에서 에너지 소비를 크게 줄일 수 있는가? 이는 공정성과 정확도를 유지하면서도 가능한가?
- RQ5XGBoost와 MLP와 같은 다양한 기계학습 모델과 ADULT, COMPAS와 같은 다양한 공정성 데이터셋에서 FanG-HPO의 성능은 어떻게 변화하는가?
주요 결과
- FanG-HPO는 BoTorch 기반의 다목적 최적화와 유사한 초체적 부피를 달성하지만, 전체 데이터셋에 대한 쿼리 수가 훨씬 적게 소요된다.
- ADULT 및 COMPAS 데이터셋 모두에서, 특히 MLP 모델에 대해 고성능 파레토 솔루션을 도출하기 위해 필요한 전체 데이터셋 쿼리 수를 줄였다.
- XGBoost 모델은 FanG-HPO를 통해 최적화된 결과로 대부분의 MLP 및 공정성 인식 알고리즘 모델을 파레토 측면에서 압도했으며, 정확도와 공정성 간의 더 우수한 트레이드오프를 달성했다.
- zlrm 및 fgrrm에서 도출된 모델과 비교해 FanG-HPO가 도출한 모델은 파레토 효율성 측면에서 우월하거나 경쟁 가능했으며, 특히 ADULT 데이터셋에서 공정성 인식 알고리즘조차도 FanG-HPO에 뒤지지 않는 성능을 보였다.
- 정보원 별 쿼리 수는 데이터셋과 모델에 따라 달라졌으며, FanG-HPO는 더 작은 정보가 많은 서브셋에 더 많은 쿼리를 할당함으로써 적응형 샘플링을 반영했다.
- 이 프레임워크는 다중 데이터 서브셋 사용이 초파라미터 공간의 효율적 탐색을 가능하게 하며, 에너지 소비와 이산화탄소 배출량을 줄이는 데 기여함을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.