[논문 리뷰] Neural Contextual Bandits with UCB-based Exploration
NeuralUCB는 신경망 기반으로 뉴럴 탠전트 커널에서 영감을 받은 무작위 특징을 사용하여 UCB를 구성하고 강한 보상 가정 없이 확률적 맥락 밴딧에서 거의 최적에 가까운 후회(ret regret)를 달성한다.
We study the stochastic contextual bandit problem, where the reward is generated from an unknown function with additive noise. No assumption is made about the reward function other than boundedness. We propose a new algorithm, NeuralUCB, which leverages the representation power of deep neural networks and uses a neural network-based random feature mapping to construct an upper confidence bound (UCB) of reward for efficient exploration. We prove that, under standard assumptions, NeuralUCB achieves $ ilde O(\sqrt{T})$ regret, where $T$ is the number of rounds. To the best of our knowledge, it is the first neural network-based contextual bandit algorithm with a near-optimal regret guarantee. We also show the algorithm is empirically competitive against representative baselines in a number of benchmarks.
연구 동기 및 목표
- 맥락 밴딧에서 선형 가정을 넘어 비선형, 모델 프리 보상 학습의 필요성에 대한 동기 부여.
- 딥 네트와 신경망 탠전트 무작위 특징을 활용하여 탐색을 위한 UCB를 구성하는 NeuralUCB를 소개.
- 실효적인 신경 탠전트 커널 차원에 따른 근사적 후회 보장을 제시하여 거의 최적의 성능을 보여주기.
- 합성 및 실제 데이터에서 NeuralUCB가 대표적 베이스라인과의 실험적 경쟁력을 보여주기.
제안 방법
- 모든 계층이 연결된 신경망을 사용하여 한정된 출력 값을 갖는 미지의 보상 함수를 학습한다.
- f(x_{t,a}; θ_{t-1})와 그라디언트 g(x_{t,a}; θ_{t-1}) 및 행렬 Z_{t-1}를 포함하는 항을 사용하여 각 행동에 대한 상한 신뢰 구간 U_{t,a}를 구성한다.
- 관찰된 데이터에 대해 정규화된 최소제곱(obj TrainNN) 목적 함수를 근사적으로 최소화하여 네트워크 파라미터 θ_t를 업데이트한다.
- NTK 기반 유효 차원 ˜d를 정의하고 활용하여 파라미터 수 p가 아니라 ˜d에 비례하는 후회 경향을 유도한다.
- 표준 가정 하에서 후회 경향이 ˜~O(˜d sqrt(T))임을 보여주고 선형 밴딧의 보장을 특별한 경우로 회복한다.
- 합성 및 실제 데이터셋에서 베이스라인과의 실험적 비교를 제공하여 실용적 성능을 검증한다.
실험 결과
연구 질문
- RQ1강한 보상 모델 가정 없이 UCB 기반 탐색을 갖춘 신경망 기반 맥락 밴딧이 거의 최적의 후회를 달성할 수 있는가?
- RQ2신경 탠전트 커널의 효적 차원은 후회를 어떻게 지배하며 선형 및 커널 기반 접근법과 어떻게 비교되는가?
- RQ3NeuralUCB가 합성 및 실제 맥락 밴딧 벤치마크에서 확립된 베이스라인과 실적으로 경쟁력 있는가?
- RQ4신경망 학습의 최적화 오차가 전체 후회 경향에 미치는 영향은 무엇이며 이를 어떻게 제어할 수 있는가?
주요 결과
- NeuralUCB는 ˜~O(˜d sqrt(T))의 후회 경향을 달성하는데, 여기서 ˜d는 유효 NTK 차원으로 비선형 보상에 대한 거의 최적의 속도에 맞춘다.
- 보상 예가 맥락에 대해 선형일 때 후회 경향은 ˜~O(d sqrt(T))의 선형 맥락 밴딧 속도로 회복된다.
- 실험 결과 NeuralUCB가 합성 벤치마크와 실제 데이터 세트에서 대표적 베이스라인과 경쟁력이 있음을 보여준다.
- 부록의 NeuralUCB_0 변형은 커널/ UCB와 일치하는 후회 경향을 보이고, NeuralUCB가 더 풍부한 표현으로 인해 실제로는 더 나은 성능을 보이는 경향이 있다.
- 분석은 NTK 기반의 Gram 행렬과 gradient 기반 특징 매핑을 포함한 신경망 최적화 및 일반화 결과에 의존한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.