Skip to main content
QUICK REVIEW

[논문 리뷰] High Dimensional Restrictive Federated Model Selection with multi-objective Bayesian Optimization over shifted distributions

Xudong Sun, Andrea Bommert|arXiv (Cornell University)|2019. 02. 24.
Machine Learning and Data Classification참고 문헌 40인용 수 3
한 줄 요약

이 논문은 고차원적이고 개인정보가 민감한 임상 데이터 환경에서 모델을 현지에서 훈련하고 원격에서 평가하는 조건에서 하이퍼파rameter 최적화를 위한 새로운 프레임워크인 제한적 분산 모델 선택(RFMS)을 제안한다. 이는 이동된 데이터 분포 위에서 다목적 베이지안 최적화를 사용하여, 단일 목표 또는 무작위 탐색 기반의 기준 대비 더 뛰어난 일반화 성능을 달성한다. fmo는 초체적량 지표에서 다른 방법들을 능가한다.

ABSTRACT

A novel machine learning optimization process coined Restrictive Federated Model Selection (RFMS) is proposed under the scenario, for example, when data from healthcare units can not leave the site it is situated on and it is forbidden to carry out training algorithms on remote data sites due to either technical or privacy and trust concerns. To carry out a clinical research under this scenario, an analyst could train a machine learning model only on local data site, but it is still possible to execute a statistical query at a certain cost in the form of sending a machine learning model to some of the remote data sites and get the performance measures as feedback, maybe due to prediction being usually much cheaper. Compared to federated learning, which is optimizing the model parameters directly by carrying out training across all data sites, RFMS trains model parameters only on one local data site but optimizes hyper-parameters across other data sites jointly since hyper-parameters play an important role in machine learning performance. The aim is to get a Pareto optimal model with respective to both local and remote unseen prediction losses, which could generalize well across data sites. In this work, we specifically consider high dimensional data with shifted distributions over data sites. As an initial investigation, Bayesian Optimization especially multi-objective Bayesian Optimization is used to guide an adaptive hyper-parameter optimization process to select models under the RFMS scenario. Empirical results show that solely using the local data site to tune hyper-parameters generalizes poorly across data sites, compared to methods that utilize the local and remote performances. Furthermore, in terms of dominated hypervolumes, multi-objective Bayesian Optimization algorithms show increased performance across multiple data sites among other candidates.

연구 동기 및 목표

  • 개인정보, 신뢰성 또는 기술적 제약으로 인해 데이터가 현지 시설 외부로 이동할 수 없는 임상 연구 환경에서 머신러닝 모델을 훈련하는 데 도전하는 문제를 해결한다.
  • 다른 분포를 가진 데이터 시설 간에 잘 일반화되는 모델 선택 과정을 개발한다.
  • 훈련을 위한 원격 데이터 접근이 필요 없이도 효율적인 하이퍼파rameter 튜닝을 가능하게 한다. 평가만 원격에서 수행된다.
  • 표준 분산 학습의 한계를 극복하기 위해, 여러 시설 간에 동기화되고 통신 비용이 높은 훈련을 피한다.
  • 베이지안 최적화를 사용하여 현지 및 원격 예측 성능을 동시에 최적화함으로써 모델의 일반화 성능을 향상시킨다.

제안 방법

  • 모델 훈련은 오직 현지 데이터에서만 이루어지지만, 성능 피드백은 원격 데이터 시설로부터 획득되는 새로운 학습 철학인 제한적 분산 모델 선택(RFMS)을 제안한다.
  • 현지 및 원격 예측 손실을 동시에 최적화하기 위해 다목적 베이지안 최적화(MOBO)를 사용하며, 파레토 최적의 하이퍼파rameter를 목표로 한다.
  • 모델 배포 후 원격에서 성능 피드백을 스칼라 신호로 모델링하여 통신 및 개인정보 침해의 부담을 최소화한다.
  • 현실적인 데이터 분포 이동을 시뮬레이션하기 위해 주성분 분석(PCA)을 사용하며, 분산된 데이터의 10%를 유지한다.
  • 더 균형 잡힌 데이터 분포 시나리오를 위한 강건한 평가를 위해 분류 기반 무작위 분할을 적용한다.
  • 성능 평탄한 경계를 다룰 수 있도록, 1e-6의 nugget 값을 가진 가우시안 프로세스 회귀를 사용하여 목적 함수를 모델링한다.

실험 결과

연구 질문

  • RQ1제한된 분산 모델 선택 조건에서, 다목적 베이지안 최적화가 단일 목표나 무작위 탐색보다 하이퍼파rameter 튜닝에서 뛰어나게 성능을 내는가?
  • RQ2하이퍼파라미터 튜닝에 원격 피드백을 통합할 경우와 현지 데이터만을 사용할 경우에 비해, 분포가 이동된 데이터 시설 간의 모델 일반화 성능는 어떻게 비교되는가?
  • RQ3불균형한 분포 대비 분류 기반 분할과 같은 다양한 데이터 분포 시나리오에서 MOBO 방법의 성능 향상 여부는 어떻게 되는가?
  • RQ4고차원 임상 데이터에서의 분포 이동이 하이퍼파라미터 최적화의 안정성과 수렴성에 미치는 영향은 무엇인가?
  • RQ5통신 효율성과 비동기적 배포가 개인정보 제약 환경에서 모델 선택의 실현 가능성과 성능에 미치는 영향은 무엇인가?

주요 결과

  • 단지 현지 데이터에서 튜닝된 모델은 분포가 이동된 데이터 시설 간에서 일반화 성능이 떨어지며, 이는 원격 성능 피드백이 필요하다는 것을 확인한다.
  • 다목적 베이지안 최적화 방법(특히 fmo)은 단일 목표 및 무작위 탐색 기준 대비 유의미하게 높은 초체적량 점수를 달성한다.
  • 차원 감소 및 클러스터링(DRC) 시나리오에서 fmo는 rand_mo를 크게 앞서며, 실험의 50% 이상에서 승리한다.
  • 분류 기반 무작위 분할(SRS) 시나리오에서는 더 균형 잡힌 데이터 분포로 인해 모든 방법의 성능이 향상되지만, fmo는 여전히 압도적인 우위를 점한다.
  • 승자 대 패배자 플롯은 여러 데이터셋과 시나리오에서 fmo가 다른 후보자들보다 일관되게 뛰어난 성능을 보이며 통계적 신뢰성을 확보한다.
  • 알고리즘 실패(예: GP 회귀에서 수치 문제)로 인해 약 5%의 실험만 제외되었으며, 이는 평가 파이프라인의 강건성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.