[논문 리뷰] Nonparametric General Reinforcement Learning
이 논문은 비모수적 일반 강화 학습을 발전시켜 확률적 환경에서 토머슨 샘플링의 渐近 최적성과 다중 에이전트 환경에서 진리의 조각 문제를 해결한다. 선구자적 사전 분포가 진리의 조각을 포함할 경우, 토머슨 샘플링이 알려지지 않은 계산 가능한 다중 에이전트 환경에서 ε-내쉬 균형으로 수렴함을 증명하며, 아익시의 계산 불가능성과 사전 의존적 최적성 기준의 한계도 제시한다.
Reinforcement learning (RL) problems are often phrased in terms of Markov decision processes (MDPs). In this thesis we go beyond MDPs and consider RL in environments that are non-Markovian, non-ergodic and only partially observable. Our focus is not on practical algorithms, but rather on the fundamental underlying problems: How do we balance exploration and exploitation? How do we explore optimally? When is an agent optimal? We follow the nonparametric realizable paradigm. We establish negative results on Bayesian RL agents, in particular AIXI. We show that unlucky or adversarial choices of the prior cause the agent to misbehave drastically. Therefore Legg-Hutter intelligence and balanced Pareto optimality, which depend crucially on the choice of the prior, are entirely subjective. Moreover, in the class of all computable environments every policy is Pareto optimal. This undermines all existing optimality properties for AIXI. However, there are Bayesian approaches to general RL that satisfy objective optimality guarantees: We prove that Thompson sampling is asymptotically optimal in stochastic environments in the sense that its value converges to the value of the optimal policy. We connect asymptotic optimality to regret given a recoverability assumption on the environment that allows the agent to recover from mistakes. Hence Thompson sampling achieves sublinear regret in these environments. Our results culminate in a formal solution to the grain of truth problem: A Bayesian agent acting in a multi-agent environment learns to predict the other agents' policies if its prior assigns positive probability to them (the prior contains a grain of truth). We construct a large but limit computable class containing a grain of truth and show that agents based on Thompson sampling over this class converge to play Nash equilibria in arbitrary unknown computable multi-agent environments.
연구 동기 및 목표
- 마르코프 결정 과정을 초월한 일반 강화 학습의 근본적 과제를 해결하기 위해, 비마르코프, 비에르고딕, 부분 관측 가능한 환경에서의 도전에 초점을 맞춘다.
- 베이지안 강화 학습 에이전트의 한계를 분석하며, 특히 아익시의 성능을 다루고, 레그-허터 지능과 같은 사전 의존적 최적성 기준의 주관성을 드러낸다.
- 특히 토머슨 샘플링을 통해 일반 강화 학습 환경에서 베이지안 에이전트에 대한 객관적 최적성 보장을 수립한다.
- 진리의 조각 문제를 다중 에이전트 환경에서 해결하기 위해, ε-내쉬 균형으로 수렴을 가능하게 하는 극한 계산 가능한 사전 클래스를 구성한다.
- 산술 계층의 관점에서 일반 강화 학습 에이전트, 특히 아익시와 지식 탐색 에이전트의 계산 가능성과 불가능성을 분석한다.
제안 방법
- 비모수적 실현 가능 기반 접근을 사용: 데이터가 알려진 가산 수의 후보 집합 내의 알려지지 않은 소스에서 유래된다고 가정한다.
- 카라테오도리의 확장 정리를 적용하여 유한 문자열 위의 함수 q로부터 무한 수열 위의 확률 측도를 구성한다.
- 회복 가능성 조건 하에서, 가치 수렴과 하위선형 손실 간의 연결을 통해 토머슨 샘플링이 확률적 환경에서 渐近 최적임을 증명한다.
- 아익시가 극한 계산 불가능하며 산술 계층의 높은 수준에 위치함을 증명하며, 상한과 하한을 통한 계산 불가능성 입증을 수행한다.
- 진리의 조각을 포함하는 큰 극한 계산 가능한 환경 클래스를 구성하여, 다중 에이전트 설정에서 ε-내쉬 균형으로의 수렴 가능성을 보장한다.
- 측도 이론적 도구를 사용하여 확률 측도의 존재성과 유일성을 증명한다. 특히 σ-준가역성과 곱 위상에서의 컴actness를 활용한다.
실험 결과
연구 질문
- RQ1토머슨 샘플링은 확률적, 비마르코프, 부분 관측 가능한 환경에서 渐近 최적성을 달성할 수 있는가?
- RQ2아익시의 최적성은 어느 정도 사전 선택에 의존하며, 이 의존성은 객관적으로 정당화될 수 있는가?
- RQ3모든 알려지지 않은 계산 가능한 다중 에이전트 환경에서 ε-내쉬 균형으로 수렴할 수 있는 베이지안 강화 학습 에이전트가 존재하는가?
- RQ4아익시 및 관련 보편 에이전트의 정확한 계산 불가능성 수준은 산술 계층 내에서 어느 정도인가?
- RQ5주관적인 사전 선택에 영향을 받지 않는 객관적 최적성 보장을 만족하는 베이지안 에이전트를 구성할 수 있는가?
주요 결과
- 토머슨 샘플링은 확률적 환경에서 渐近 최적이며, 그 가치가 최적 정책의 가치로 수렴한다.
- 회복 가능성 조건 하에서, 토머슨 샘플링은 확률적 환경에서 하위선형 손실을 달성한다.
- 아익시는 극한 계산 불가능하며 산술 계층의 높은 수준에 위치하여 본질적으로 계산 불가능하다.
- 아익시의 극한 계산 가능한 ε-최적 근사가 존재하며, 실용적 구현을 위한 계산 가능한 대체 수단이 된다.
- 모든 계산 가능한 환경의 클래스 내에서 모든 정책이 파레토 최적임을 보여, 레그-허터 지능과 같은 사전 의존적 최적성 보장의 기반을 약화시킨다.
- 진리의 조각을 포함하는 극한 계산 가능한 사전 클래스를 사용하는 베이지안 에이전트가 토머슨 샘플링을 통해 임의의 알려지지 않은 계산 가능한 다중 에이전트 환경에서 ε-내쉬 균형으로 수렴한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.