[논문 리뷰] Learning Neural Contextual Bandits Through Perturbed Rewards
이 논문은 모델 업데이트 중 보상에 가우시안 노이즈를 주입하여 명시적 탐색을 제거함으로써 계산적으로 효율적인 신경망 기반 컨텍스트 밴딧 알고리즘을 제안한다. 펌프팅된 보상에 기반하여, 추가적인 계산 비용 없이도 $\tilde{\mathbf{O}}(\widetilde{d}\sqrt{T})$의 리그레트 한계를 달성하며, 실제 데이터셋에서 기존의 신경망 밴딧 방법들보다 효율성과 경험적 성능 면에서 뛰어나다.
Thanks to the power of representation learning, neural contextual bandit algorithms demonstrate remarkable performance improvement against their classical counterparts. But because their exploration has to be performed in the entire neural network parameter space to obtain nearly optimal regret, the resulting computational cost is prohibitively high. We perturb the rewards when updating the neural network to eliminate the need of explicit exploration and the corresponding computational overhead. We prove that a $ ilde{O}( ilde{d}\sqrt{T})$ regret upper bound is still achievable under standard regularity conditions, where $T$ is the number of rounds of interactions and $ ilde{d}$ is the effective dimension of a neural tangent kernel matrix. Extensive comparisons with several benchmark contextual bandit algorithms, including two recent neural contextual bandit models, demonstrate the effectiveness and computational efficiency of our proposed neural bandit algorithm.
연구 동기 및 목표
- 신경망 기반 컨텍스트 밴딧 알고리즘에서 명시적 탐색으로 인한 높은 계산 비용을 해결하기 위해.
- 딥 뉴럴 네트워크를 위한 신뢰집합 구축 시 비용이 많이 드는 공분산 행렬 역행렬 계산의 필요성을 제거하기 위해.
- 계산 오버헤드를 크게 줄이면서도 이론적 리그레트 보장을 유지하기 위해.
- 온라인 학습 환경에서 강력한 신경망 기반 밴딧 모델의 실용적 구현을 가능하게 하기 위해.
- 신경망 기반 밴딧 알고리즘에서 이론적 리그레트 한계와 경험적 성능 간 격차를 메우기 위해.
제안 방법
- 모든 모델 업데이트 과정에서 관측된 보상에 평균이 0인 가우시안 노이즈를 주입하여 암묵적 탐색을 유도한다.
- 펌프팅 후 예측된 보상이 가장 높은 액션을 선택하여 파rameter 공간에서의 명시적 탐색을 피한다.
- 모델의 유효 차원 $\widetilde{d}$를 분석하기 위해 신경장핵 커널(NTK) 프레임워크를 활용한다.
- 펌프팅 기반 방법이 표준 정규성 조건 하에서 $\tilde{\mathbf{O}}(\widetilde{d}\sqrt{T})$ 리그레트를 달성함을 증명한다.
- 완전한 배치 행렬 역행렬 계산을 피하기 위해 확률적 경사 하강법을 사용한다.
- 이론적 정당성의 갭이 존재하는 이전 연구들에 비해 필요할 경우에만 대각 행렬 근사를 사용한다.
실험 결과
연구 질문
- RQ1보상 펌프팅이 리그레트 보장을 훼손시키지 않고 신경망 기반 컨텍스트 밴딧에서 명시적 탐색을 대체할 수 있는가?
- RQ2펌프팅된 보상을 사용하는 신경망 기반 밴딧 알고리즘의 이론적 리그레트 한계는 무엇인가?
- RQ3제안된 방법의 계산 비용은 기존의 신경망 기반 밴딧 알고리즘과 비교해 어떻게 되는가?
- RQ4펌프팅 기반 방법은 실제 데이터셋에서 강력한 경험적 성능을 유지하는가?
- RQ5이 방법은 계산 비용이 급격히 증가하지 않도록 대규모 신경망에 스케일링 가능한가?
주요 결과
- 제안된 방법은 $\tilde{\mathbf{O}}(\widetilde{d}\sqrt{T})$의 리그레트 한계를 달성하며, 이는 이전 방법들의 이론적 보장을 그대로 유지한다.
- 알고리즘은 명시적 탐색을 피하고 전체 공분산 행렬 역행렬 계산이 필요 없어져 계산 비용이 감소한다.
- LastFM 및 Delicious 데이터셋에서 NPR는 누적 정규화 보상 면에서 NeuralUCB와 NeuralTS를 모두 앞서나갔다.
- 행렬 역행렬 오버헤드가 없기 때문에 NPR은 NeuralUCB와 NeuralTS보다 훨씬 빠른 학습 시간을 기록했다.
- 합성 데이터와 실제 데이터 양쪽에서 강력한 경험적 성능을 유지하여 그 효과성을 입증했다.
- 온라인 신경망 기반 밴딧 학습의 핵심 장애물은 모델 업데이트 단계에 있었으며, 제안된 방법이 이를 효율적으로 해결했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.