Skip to main content
QUICK REVIEW

[논문 리뷰] EE-Net: Exploitation-Exploration Neural Networks in Contextual Bandits

Yikun Ban, Yuchen Yan|arXiv (Cornell University)|2021. 10. 07.
Advanced Bandit Algorithms Research참고 문헌 35인용 수 10
한 줄 요약

이 논문은 보상 추정(이윤 극대화)을 위한 하나의 신경망과 잔차 보상 증가량을 학습하는 다른 하나의 신경망을 사용하여 이윤 극대화와 탐색을 분리하는 새로운 신경망 기반의 컨텍스트 밴딧 알고리즘인 EE-Net을 제안한다. 보상 추정의 편향에 기반해 적응적으로 상향 또는 하향 탐색을 예측함으로써 EE-Net은 $\mathcal{O}(\sqrt{T\log T})$의 손실 경계를 달성하며, 근사 오차를 줄이고 방향 인식 탐색을 가능하게 하여 기존의 신경망 밴딧 알고리즘보다 향상된 성능을 보인다.

ABSTRACT

In this paper, we propose a novel neural exploration strategy in contextual bandits, EE-Net, distinct from the standard UCB-based and TS-based approaches. Contextual multi-armed bandits have been studied for decades with various applications. To solve the exploitation-exploration tradeoff in bandits, there are three main techniques: epsilon-greedy, Thompson Sampling (TS), and Upper Confidence Bound (UCB). In recent literature, linear contextual bandits have adopted ridge regression to estimate the reward function and combine it with TS or UCB strategies for exploration. However, this line of works explicitly assumes the reward is based on a linear function of arm vectors, which may not be true in real-world datasets. To overcome this challenge, a series of neural bandit algorithms have been proposed, where a neural network is used to learn the underlying reward function and TS or UCB are adapted for exploration. Instead of calculating a large-deviation based statistical bound for exploration like previous methods, we propose "EE-Net", a novel neural-based exploration strategy. In addition to using a neural network (Exploitation network) to learn the reward function, EE-Net uses another neural network (Exploration network) to adaptively learn potential gains compared to the currently estimated reward for exploration. Then, a decision-maker is constructed to combine the outputs from the Exploitation and Exploration networks. We prove that EE-Net can achieve $\mathcal{O}(\sqrt{T\log T})$ regret and show that EE-Net outperforms existing linear and neural contextual bandit baselines on real-world datasets.

연구 동기 및 목표

  • 복잡하고 비선형적인 보상 구조를 가진 실제 응용에서 자주 실패하는 선형 보상 가정의 한계를 해결한다.
  • UCB 및 TS 기반의 신경망 밴딧 방법에서 기인하는 내재된 근사 오차를 극복한다. 이러한 방법들은 탐색을 위해 통계적 상한을 기반으로 한다.
  • 보상 추정의 편향에 기반해 적응적으로 상향 또는 하향 탐색을 결정하는 신경망 기반의 탐색 전략을 개발한다.
  • 신경망 일반화 오차 외의 오차 성분을 제거함으로써 최신 신경망 밴딧 알고리즘보다 더 날카운 손실 경계를 달성한다.
  • 실제 데이터셋에서 선형 및 신경망 밴딧 기준보다 뛰어난 경험적 성능을 입증한다.

제안 방법

  • 기존의 컨텍스트-보상 쌍에 기반해 릿지 회귀와 신경망 피팅을 사용하여 보상 함수를 추정하는 이윤 극대화 네트워크 $f_1$을 훈련한다.
  • 별도의 탐색 네트워크 $f_2$를 도입하여 진정한 보상에서 $f_1$의 추정치를 뺀 잔차 $h(x) - f_1(x)$를 학습함으로써 탐색 결정을 안내한다.
  • $f_2$의 출력을 사용해 탐색 방향을 결정한다: 양수 값은 추정치가 낮을 때 상향 탐색을, 음수 값은 추정치가 높을 때 하향 탐색을 유도한다.
  • $f_1$과 $f_2$를 선형 또는 비선형 신경망을 통해 조합하는 의사결정자 $f_3$를 구성하여 추정 가치에 적응적인 탐색 증가량을 기반으로 암을 선택한다.
  • 기본적인 과다 파rameter화된 신경망 가정 하에 EE-Net이 $\mathcal{O}(\sqrt{T\log T})$의 손실 경계를 달성함을 증명하며, 이는 이전 방법보다 $\sqrt{\log T}$ 요소로 향상된다.
  • 탐색 네트워크의 훈련 목표를 진정한 보상과 $f_1$의 예측 간 잔차 차이로 설정함으로써 탐색 잠재력의 엔드 투 엔드 학습이 가능해진다.

실험 결과

연구 질문

  • RQ1UCB 및 TS 기반의 신경망 밴딧 방법과 비교해 이중 네트워크 신경망 아키텍처가 컨텍스트 밴딧에서 탐색 정확도와 손실 경계를 향상시킬 수 있는가?
  • RQ2전용 신경망을 통해 잔차 보상 차이 $h(x) - f_1(x)$를 학습하면 고정되거나 무작위 탐색 전략보다 더 나은 탐색 방향 선택(상향/하향)을 이끌 수 있는가?
  • RQ3통계적 신뢰도 상한에서 탐색을 분리함으로써 비선형 보상 환경에서 근사 오차를 줄이고 손실 성능을 향상시키는 데 얼마나 기여하는가?
  • RQ4EE-Net의 손실 경계는 기존의 신경망 밴딧 알고리즘과 비교해 입력 차원 또는 유효 차원에 대한 의존성 측면에서 어떻게 다른가?
  • RQ5EE-Net은 다양한 실제 데이터셋에 일반화되어 있으며, 누적 보상 성능에서 선형 및 신경망 밴딧 기준보다 뛰어나게 성능을 발휘할 수 있는가?

주요 결과

  • EE-Net은 $\mathcal{O}(\sqrt{T\log T})$의 손실 경계를 달성하며, 통계적 상한에 의존하는 기존의 신경망 밴딧 알고리즘보다 $\sqrt{\log T}$ 요소로 향상된다.
  • 탐색 네트워크 $f_2$는 보상 추정의 편향의 부호와 크기를 학습함으로써 필요에 따라 상향 및 하향 탐색을 모두 가능하게 한다.
  • EE-Net은 릿지 회귀, NTK 근사, 커널-거리 성분 등에서 기인하는 오차를 누적하지 않고, 오직 신경망 일반화 오차만을 남긴다.
  • 네 개의 실제 데이터셋에서 EE-Net은 누적 보상 측면에서 선형 및 신경망 밴딧 기준보다 뛰어난 성능을 보였다.
  • 과도 추정 및 추정 부족을 탐지할 수 있는 능력 덕분에 UCB(항상 상향) 또는 TS(무작위 방향)보다 더 정밀한 탐색이 가능함을 아블레이션 및 시각화 연구에서 입증했다.
  • 이론적 분석을 통해 EE-Net의 손실 경계가 입력 차원과 유효 차원에 영향을 받지 않음을 확인하였으며, 이는 고차원 환경에서도 안정성을 확보함을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.