Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Optimization for Policy Search via Online-Offline Experimentation

Benjamin Letham, Eytan Bakshy|arXiv (Cornell University)|2019. 04. 01.
Advanced Bandit Algorithms Research인용 수 16
한 줄 요약

이 논문은 실세계 시스템에서 복잡한 머신러닝 정책을 효율적으로 튜닝하기 위해 오프라인 시뮬레이터 평가와 온라인 A/B 테스트를 결합한 다중작업 베이지안 최적화 프레임워크를 제안한다. 저차원 다중작업 가우시안 프로세스를 통해 시뮬레이터 및 온라인 실험 결과를 함께 모델링함으로써, 비용이 많이 드는 온라인 실험 수를 줄이며, 시뮬레이터의 편향에도 불구하고 최적화 효율성과 정확도를 크게 향상시킨다.

ABSTRACT

Online field experiments are the gold-standard way of evaluating changes to real-world interactive machine learning systems. Yet our ability to explore complex, multi-dimensional policy spaces - such as those found in recommendation and ranking problems - is often constrained by the limited number of experiments that can be run simultaneously. To alleviate these constraints, we augment online experiments with an offline simulator and apply multi-task Bayesian optimization to tune live machine learning systems. We describe practical issues that arise in these types of applications, including biases that arise from using a simulator and assumptions for the multi-task kernel. We measure empirical learning curves which show substantial gains from including data from biased offline experiments, and show how these learning curves are consistent with theoretical results for multi-task Gaussian process generalization. We find that improved kernel inference is a significant driver of multi-task generalization. Finally, we show several examples of Bayesian optimization efficiently tuning a live machine learning system by combining offline and online experiments.

연구 동기 및 목표

  • 실세계 머신러닝 시스템에서 복잡한 다차원 정책 공간에 대해 온라인 A/B 테스트의 높은 비용과 제한된 처리량 문제를 해결하기 위해.
  • 오프라인 시뮬레이터 평가와 온라인 실험을 다중신뢰도 관측치로 간주하여 통합함으로써 최적화 효율성을 향상시키기 위해.
  • 특히 다양한 시뮬레이터 배치 간의 비정상성과 오프정책 행동으로 인해 발생하는 편향을 모델링하고 보정하기 위해.
  • 오프라인 및 온라인 데이터를 융합하여 정책 탐색에 사용하는 다중작업 가우시안 프로세스 모델의 실증적 성능을 평가하기 위해.
  • 특히 저차원 작업 공분산 구조를 통한 개선된 커널 추론이 다중작업 최적화에서 일반화 성능을 높이는 데 핵심적인 역할을 한다는 것을 입증하기 위해.

제안 방법

  • 모델은 다중작업 가우시안 프로세스(MTGP)와 내재된 공역성(ICC) 커널을 사용하여 오프라인 시뮬레이터와 온라인 A/B 테스트의 반응을 함께 모델링한다.
  • 각 오프라인 시뮬레이터 배치를 별도의 작업으로 간주함으로써, 시간 순서로 정렬된 시뮬레이터 실행 간의 비정상성 편향을 학습하고 보정할 수 있도록 한다.
  • 다수의 시뮬레이터 배치로 인한 고차원성 문제를 해결하기 위해 작업 공분산 행렬의 저차원 근사법을 사용하여 확장성과 일반화 능력을 향상시킨다.
  • 온라인 최적화기는 탐색과 이용의 균형을 이루는 할당 함수를 사용하며, 오프라인 및 온라인 평가에서 유래한 정보를 통합한다.
  • 프레임워크는 반복적인 정책 평가를 통해 시간에 따라 변화하는 편향 추정과 모델 校정 향상을 가능하게 하기 위해 시뮬레이터 배치 간 반복 평가를 포함한다.
  • 교차검증을 통해 모델 성능을 검증하고, 모델 잘못 설정 및 비정상성에 대한 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1실세계 머신러닝 시스템의 정책 탐색에서 오프라인 시뮬레이터 평가가 온라인 A/B 테스트의 수요를 상당히 줄일 수 있는가?
  • RQ2시간에 따라 변화하는 사용자 행동과 항목 특성으로 인해 발생하는 시뮬레이터 비정상성으로 인한 편향은 어떻게 효과적으로 모델링하고 보정할 수 있는가?
  • RQ3특히 저차원 작업 공분산 구조를 갖춘 다중작업 가우시안 프로세스 모델링이 일반화 및 최적화 성능에 얼마나 기여하는가?
  • RQ4편향된 오프라인 데이터의 포함이 베이지안 최적화에서 학습 곡선과 수렴 속도에 어떤 영향을 미치는가?
  • RQ5개선된 커널 추론이 온라인-오프라인 실험 환경에서 다중작업 일반화에 미치는 영향은 무엇인가?

주요 결과

  • 실증적 학습 곡선은 편향된 오프라인 시뮬레이터 데이터를 통합함으로써 최적화 성능 향상이 뚜렷하게 이루어지며, 수렴 속도가 빨라지고 온라인 실험 요구 수가 감소함을 보여준다.
  • 오프라인 데이터의 통합은 온라인 최적화기가 최적 정책에 대한 믿음의 불확실성(엔트로피) 감소를 빠르게 이끌어낸다.
  • 시뮬레이터 배치 간 비정상성은 시간에 따라 변화하는 편향, 예를 들어 반응 표면의 선형 이동과 같은 현상을 유도하며, 이는 저차원 ICM 커널을 통해 효과적으로 모델링된다.
  • 편향된 오프라인 데이터에서 학습할 수 있는 능력은 주로 저차원 작업 공분산 구조를 통한 개선된 커널 추론에 기인한다.
  • 시뮬레이터 배치 간 반복 정책 평가는 시간에 따라 변화하는 편향을 효과적으로 추정함으로써 모델의 校정 및 일반화 능력을 향상시킨다.
  • 교차검증 결과, 모델 잘못 설정 및 비정상성에도 불구하고 다중작업 모델이 잘 작동함을 확인하여 실세계 환경에서의 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.