Skip to main content
QUICK REVIEW

[논문 리뷰] Differentiable Bandit Exploration

Craig Boutilier, Chih‐Wei Hsu|arXiv (Cornell University)|2020. 02. 17.
Advanced Bandit Algorithms Research참고 문헌 46인용 수 5
한 줄 요약

이 논문은 문제 인스턴스의 분포에 대해 베이즈 보상 최적화를 통해 베이지안 다수의 손잡이 밴딧에 대한 최적의 탐색 정책을 학습하기 위한 미분 가능하고 기울기 기반 접근법을 제안한다. 새로운 미분 가능한 소프트맥스 정책인 소프트엘리미네이션(SoftElim)을 제안하고, 분산 감소 기법을 사용한 정책 기반 강화 학습을 통해 신경망 및 기타 정책을 훈련시켜 기존 표준 기준보다 낮은 베이즈 회귀를 달성하면서 데이터 분포로부터 암묵적인 편향을 학습한다.

ABSTRACT

Exploration policies in Bayesian bandits maximize the average reward over problem instances drawn from some distribution $\mathcal{P}$. In this work, we learn such policies for an unknown distribution $\mathcal{P}$ using samples from $\mathcal{P}$. Our approach is a form of meta-learning and exploits properties of $\mathcal{P}$ without making strong assumptions about its form. To do this, we parameterize our policies in a differentiable way and optimize them by policy gradients, an approach that is general and easy to implement. We derive effective gradient estimators and introduce novel variance reduction techniques. We also analyze and experiment with various bandit policy classes, including neural networks and a novel softmax policy. The latter has regret guarantees and is a natural starting point for our optimization. Our experiments show the versatility of our approach. We also observe that neural network policies can learn implicit biases expressed only through the sampled instances.

연구 동기 및 목표

  • 사전 분포 P에 대해 강력한 가정 없이도 일반적인, 미분 가능한 프레임워크를 개발하여 밴딧 탐색 정책을 학습하는 것.
  • 정책 기반 강화 학습을 통해 최대 베이즈 보상을 달성하기 위해 정책 기반 강화 학습을 사용하여 확률적 최적화를 통한 엔드 투 엔드 훈련을 가능하게 하는 것.
  • 이론적 회귀 보장과 최적화 용이성을 갖춘 새로운 미분 가능한 밴딧 정책인 소프트엘리미네이션(SoftElim)을 설계하는 것.
  • 신경망 정책이 정책 기반 강화 학습을 통해 데이터 분포의 복잡한 암묵적 편향을 명시적 지도 없이 학습할 수 있는지 검증하는 것.
  • 밴딧 구조에 맞는 문제 특화 기반선과 새로운 분산 감소 기법을 사용하여 밴딧 정책 최적화의 기울기 분산을 줄이는 것.

제안 방법

  • 신경망과 새로운 소프트맥스 정책(SoftElim)을 포함한 다양한 미분 가능한 함수로 밴딧 정책를 매개변수화하며, 각 행동의 확률은 추정된 최적성 부족 간격과 횟수에 따라 결정된다.
  • 알 수 없는 사전 분포 P에서 샘플링된 문제 인스턴스의 누적 보상 기대값으로서의 베이즈 보상을 정의하고, 정책 기반 강화 학습을 통해 최적화한다.
  • 가능도 비율 기법을 사용하여 보상 기울기를 유도하고, 밴딧 설정에 특화된 두 가지 분산 감소 기반선인 자기 기반선(self-baseline)과 최적 후회 기반선(optimal hindsight baseline)을 도입한다.
  • 행동 i를 선택할 확률이 exp(θ × (max_j μ_j - μ_i)^2 × T_i)에 비례하는 소프트엘리미네이션을 도입함으로써, 이론적 회귀 보장이 있는 낙관적 탐색이 가능하고 최적화가 용이한 미분 가능한 정책을 제공한다.
  • 샘플링된 에피소드로부터 기울기의 경험적 추정치를 구하고, 확률적 기울기 상승 기법을 사용하여 정책 매개변수를 훈련시킨다.
  • 합성 및 실제 밴딧 문제에서 본 방법을 평가하고, UCB1, 씻어내기 샘플링(Thompson Sampling), Exp3와의 성능을 비교한다.

실험 결과

연구 질문

  • RQ1기울기 기반 정책 기반 강화 학습을 사용하여 베이즈 보상을 최적화함으로써, 베이지안 밴딧에 대해 효과적인 탐색 정책을 학습할 수 있는가?
  • RQ2소프트엘리미네이션과 같은 미분 가능한 소프트맥스 정책은 기울기 기반 최적화에 적합하면서도 하위선형 회귀를 달성할 수 있는가?
  • RQ3밴딧 구조에 맞는 특화된 분산 감소 기법은 정책 기반 강화 학습의 샘플 효율성과 수렴 속도 향상에 얼마나 효과적인가?
  • RQ4신경망 정책는 명시적 지도 없이 사전 분포 P의 복잡한 암묵적 편향을 학습할 수 있는가?
  • RQ5베이즈 보상 목적함수는 정책 매개변수에 대해 볼록함을 보장할 수 있는가? 이는 기울기 상승 기반 수렴 보장에 기여한다.

주요 결과

  • 제안된 방법 GradBand은 다양한 문제 인스턴스에서 UCB1, 씻어내기 샘플링(Thompson Sampling), Exp3보다 낮은 베이즈 회귀를 달성하는 밴딧 정책를 성공적으로 학습하였다.
  • θ=8일 때 소프트엘리미네이션 정책는 O(1)의 회귀 상수를 달성하여 이전 연구의 O(KΔ⁻⁴) 상한보다 크게 향상되었으며, 기울기 하강법을 통해 쉽게 최적화될 수 있다.
  • 정책 기반 강화 학습을 통해 훈련된 신경망 정책는 비최적의 암을 무시하고 관련 있는 암에 집중하는 경향을 보이며, 데이터 분포로부터 암묵적 편향을 포착할 수 있음을 보여준다.
  • 후회 기반 최적 기반선(b^opt)과 자기 기반선을 사용함으로써 기울기 분산이 크게 감소하여 훈련의 안정성과 수렴 속도가 향상되었다.
  • 경험적 결과에 따르면 RNN 기반 정책를 사용할 경우 암의 수 K가 증가하더라도 베이즈 회귀가 증가하지 않으며, 기존의 고전적 알고리즘과는 달리 학습된 주의 메커니즘이 관련 있는 암에 집중하기 때문이다.
  • 이 방법은 구조적 또는 고차원 사전 분포를 가진 다양한 밴딧 문제에 대해 잘 일반화되며, 광범위한 적용 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.