Skip to main content
QUICK REVIEW

[논문 리뷰] Provable Model-based Nonlinear Bandit and Reinforcement Learning: Shelve Optimism, Embrace Virtual Curvature

Kefan Dong, Jiaqi Yang|arXiv (Cornell University)|2021. 02. 08.
Advanced Bandit Algorithms Research참고 문헌 84인용 수 5
한 줄 요약

이 논문은 가상 곡률을 사용하여 낙관주의 대신 근사 국소 최대값으로 수렴하는 모델 기반 알고리즘인 ViOlin을 제안한다. 이 알고리즘은 모델 클래스의 순차적 라데마처 복잡도에만 의존하는 샘플 복잡도 한계를 확립하며, 결정론적 보상이 있는 한 층 신경망에 대해서조차도 전역 수렴이 통계적으로 비가능함을 보여준다.

ABSTRACT

This paper studies model-based bandit and reinforcement learning (RL) with nonlinear function approximations. We propose to study convergence to approximate local maxima because we show that global convergence is statistically intractable even for one-layer neural net bandit with a deterministic reward. For both nonlinear bandit and RL, the paper presents a model-based algorithm, Virtual Ascent with Online Model Learner (ViOlin), which provably converges to a local maximum with sample complexity that only depends on the sequential Rademacher complexity of the model class. Our results imply novel global or local regret bounds on several concrete settings such as linear bandit with finite or sparse model class, and two-layer neural net bandit. A key algorithmic insight is that optimism may lead to over-exploration even for two-layer neural net model class. On the other hand, for convergence to local maxima, it suffices to maximize the virtual return if the model can also reasonably predict the size of the gradient and Hessian of the real return.

연구 동기 및 목표

  • 신경망 함수 근사가 있는 비선형 밴딧 및 강화학습에서 전역 수렴의 통계적 비가능성 문제를 해결하기 위해.
  • 한 층 신경망 밴딧에 대해 전역 최적화가 증명적으로 불가능하므로, 전역 수렴에서 근사 국소 최대값 수렴으로 목표를 재정의하기 위해.
  • 모델 클래스의 순차적 라데마처 복잡도에 다항적으로 의존하는 샘플 복잡도를 가지는 모델 기반 알고리즘을 설계하기 위해.
  • 비선형 설정에서 낙관주의 탐색이 과도한 탐색을 유도하는 반면, 가상 곡률이 효율적인 수렴을 가능하게 함을 보여주기 위해.
  • 유한/희박 모델 클래스가 있는 선형 밴딧과 두 층 신경망 밴딧을 포함한 구체적 설정에서 증명 가능한 누적 손실 한계를 제공하기 위해.

제안 방법

  • 모델 예측된 기울기와 헤시안을 기반으로 가상 수익을 최대화하는 모델 기반 알고리즘인 ViOlin(Virtual Ascent with Online Model Learner)을 제안한다.
  • 모델 클래스의 보상 및 동역학 복잡도를 측정하기 위해 순차적 라데마처 복잡도를 사용하며, 이는 샘플 복잡도 한계의 기초가 된다.
  • 낙관주의 기반 탐색을 모델 예측된 헤시안과 기울기 기반의 곡률 인식 업데이트로 대체한다.
  • 진짜 동역학과 모델 동역학 간의 가치 차이를 연결하기 위해 시뮬레이션 보조정리를 사용하며, 오차 전파를 제어한다.
  • 결정론적 동역학 하에서 기울기 업데이트와 가치 함수 향상 간의 관계를 연결하기 위해 정책 기울기 보조정리를 도입한다.
  • 모델 및 진짜 파rameter 간의 이차형식 차이를 제한하기 위해 가우시안 스무딩과 텔레스코프 기법을 사용한다.

실험 결과

연구 질문

  • RQ1한 층 신경망 보상이 있는 비선형 밴딧 문제에서 전역 수렴은 통계적으로 가능할 수 있는가?
  • RQ2전역 수렴이 비가능한 상황에서 모델 기반 강화학습 알고리즘이 국소 최대값으로 샘플 효율적으로 수렴할 수 있는가?
  • RQ3비선형 함수 근사 설정에서 낙관주의 기반 탐색은 과도한 탐색을 유도하는가?
  • RQ4예측된 기울기와 헤시안 기반의 가상 곡률이 효율적 탐색을 위해 낙관주의를 대체할 수 있는가?
  • RQ5모델 클래스 복잡도의 관점에서 모델 기반 비선형 밴딧 및 강화학습 알고리즘의 샘플 복잡도는 무엇인가?

주요 결과

  • 결정론적 보상이 있는 한 층 신경망 밴딧에 대해서조차도 전역 수렴이 통계적으로 비가능하며, 입력 차원에 대해 지수적 샘플이 필요하다.
  • 제안된 ViOlin 알고리즘은 모델 클래스의 순차적 라데마처 복잡도에 다항적으로 의존하는 샘플 복잡도로 근사 국소 최대값으로 증명 가능한 수렴을 달성한다.
  • 유한 또는 희박 모델 클래스가 있는 선형 밴딧에서는 ViOlin이 모델 클래스 크기의 로그에 비례하는 국소 누적 손실 한계를 달성한다.
  • 두 층 신경망 밴딧에서는 알고리즘이 입력 차원이 아닌 모델의 순차적 라데마처 복잡도에 의존하는 국소 누적 손실 한계를 달성한다.
  • 이론적 분석을 통해 낙관주의가 비선형 설정에서 과도한 탐색을 유도하는 반면, 가상 곡률은 더 효율적이고 안정적인 수렴을 가능하게 함을 보여준다.
  • 이 논문은 한 층 신경망이 다항적으로 유계된 엘루더 차원을 가지지 않음을 증명하며, 이는 비선형 동역학에 대한 이전의 복잡도 측정법을 무효화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.