[논문 리뷰] Instance-Dependent Complexity of Contextual Bandits and Reinforcement Learning: A Disagreement-Based Perspective
이 논문은 함수 근사와 함께 연역적 보상과 함께 맥락적 밴디트 및 강화 학습에서의 인스턴스 의존적 손실을 특성화하기 위해 불일치 기반 프레임워크를 제안한다. 가능한 경우 보상 갭에 적응하는 오라클 효율적인 알고리즘을 제안하여 최적의 갭 의존적 샘플 복잡도를 달성하면서 동시에 악성 경우 시나리오에서 최소 최대 비용을 유지한다.
In the classical multi-armed bandit problem, instance-dependent algorithms attain improved performance on "easy" problems with a gap between the best and second-best arm. Are similar guarantees possible for contextual bandits? While positive results are known for certain special cases, there is no general theory characterizing when and how instance-dependent regret bounds for contextual bandits can be achieved for rich, general classes of policies. We introduce a family of complexity measures that are both sufficient and necessary to obtain instance-dependent regret bounds. We then introduce new oracle-efficient algorithms which adapt to the gap whenever possible, while also attaining the minimax rate in the worst case. Finally, we provide structural results that tie together a number of complexity measures previously proposed throughout contextual bandits, reinforcement learning, and active learning and elucidate their role in determining the optimal instance-dependent regret. In a large-scale empirical evaluation, we find that our approach often gives superior results for challenging exploration problems. Turning our focus to reinforcement learning with function approximation, we develop new oracle-efficient algorithms for reinforcement learning with rich observations that obtain optimal gap-dependent sample complexity.
연구 동기 및 목표
- 특수 케이스를 초과하여 맥락적 밴디트에서 인스턴스 의존적 손실 한계에 대한 일반 이론의 부족을 해결한다.
- 인스턴스 의존적 손실 보장을 달성하기 위해 필수적이고도 충분한 복잡도 측정법을 개발한다.
- 보상 갭에 적응하면서도 악성 경우 설정에서 최소 최대 최적성을 유지하는 오라클 효율적인 알고리즘을 설계한다.
- 맥락적 밴디트, 강화 학습 및 능동 학습 전반에서 다양한 복잡도 측정법(예: eluder 차원 및 스타 수)의 역할을 통합하고 명확히 한다.
- 풍부한 관측값이 있는 강화 학습으로 프레임워크를 확장하여 최적의 갭 의존적 샘플 복잡도를 제공한다.
제안 방법
- 보상 갭과 관련하여 정책 클래스의 통계적 능력을 측정하기 위해 불일치 계수를 도입한다.
- 특정 인스턴스의 어려움을 캡처하는 새로운 복잡도 측정법 가족(예: 정책 불일치 계수, 스타 수, eluder 차원)을 제안한다.
- 가격 함수를 추정하기 위해 회귀 오라클을 사용하고 보상 갭에 동적으로 적응하는 오라클 효율적인 알고리즘을 설계한다.
- 집중 불등식과 정보 이론적 도구를 사용하여 분포에 종속되지 않고 척도 민감한 손실 한계를 수립한다.
- 신뢰 집합과 최소 제곱 추정을 활용하여 함수 근사가 있는 강화 학습에서의 근사 오차와 오프셋 오차를 제한한다.
- 유니온 바ounds와 동질성 추론을 사용하여 결과를 함수 클래스의 스타 헐름으로 확장하여 일반화 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1맥락적 밴디트에서 인스턴스 의존적 손실 한계를 달성하기 위해 필수적이고도 충분한 복잡도 측정법은 무엇인가?
- RQ2보상 갭에 적응하면서도 최소 최대 최적성을 유지하는 오라클 효율적인 알고리즘을 설계할 수 있는가?
- RQ3eluder 차원 및 스타 수와 같은 기존의 복잡도 측정법들이 인스턴스 의존 학습 맥락에서 상호 관계는 어떻게 되는가?
- RQ4풍부한 관측값과 함수 근사가 있는 강화 학습에서 최적의 갭 의존적 샘플 복잡도는 무엇인가?
- RQ5불일치 기반 분석을 통해 맥락적 밴디트, 강화 학습 및 능동 학습 전반에서 이론적 보장을 통합할 수 있는가?
주요 결과
- 논문은 정책 불일치 계수가 맥락적 밴디트에서 인스턴스 의존적 손실 한계를 달성하기 위해 필수적이며 충분하다고 규명한다.
- 제안된 알고리즘은 양의 갭이 있는 쉬운 인스턴스에서 로그 손실을 달성하면서도 악성 경우 시나리오에서 최소 최대 비용인 $\sqrt{T}$ 를 유지한다.
- 새로운 복잡도 측정법인 스타 수는 불일치 계수와 밀접하게 연결되어 있으며 학습 어려움의 구조적 특성을 제공한다.
- 풍부한 관측값이 있는 강화 학습에서 알고리즘은 최적의 갭 의존적 샘플 복잡도를 달성하며 기존 알려진 하한선과 일치한다.
- 실증 평가에서 기존 기준 대비 도전적인 탐색 문제에서 뛰어난 성능을 보였다.
- 이론적 분석을 통해 eluder 차원과 스타 수가 더 넓은 불일치 기반 프레임워크의 특수 케이스임을 규명하여 이전의 복잡도 측정법들을 통합한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.