QUICK REVIEW
[논문 리뷰] A Variant of the Wang-Foster-Kakade Lower Bound for the Discounted Setting
Philip Amortila, Nan Jiang|arXiv (Cornell University)|2020. 11. 02.
Reinforcement Learning in Robotics참고 문헌 1인용 수 9
한 줄 요약
이 논문은 할인 설정 하에서 선형적으로 실현 가능한 가치 함수와 양호한 특징 커버리지가 있음에도 불구하고 배치 강화 학습에서 무한한 샘플 복잡도를 보이는 단순화된 2상태, 1차원 특징 MDP를 제시한다. 이 구성은 관측되지 않은 상태-행동 쌍으로 인해 무한한 데이터가 있음에도 불구하고 최적의 정책 학습이 본질적으로 불가능하다는 것을 보여주며, 배치 RL의 기존 가정에 도전한다.
ABSTRACT
Recently, Wang et al. (2020) showed a highly intriguing hardness result for batch reinforcement learning (RL) with linearly realizable value function and good feature coverage in the finite-horizon case. In this note we show that once adapted to the discounted setting, the construction can be simplified to a 2-state MDP with 1-dimensional features, such that learning is impossible even with an infinite amount of data.
연구 동기 및 목표
- 할인 설정 하에서 배치 강화 학습이 선형적으로 실현 가능한 가치 함수가 있음에도 불구하고 무한한 샘플 복잡도를 가질 수 있음을 보여주기 위해.
- 왕 등 (2020) 의 유한한 수명 하한 구성의 결과를 최소한의 2상태, 1차원 특징 MDP로 할인 설정에 맞게 단순화하기 위해.
- 할인 설정 하에서 양호한 특징 커버리지와 가치 함수 실현 가능성에도 불구하고 학습 가능성 보장이 되지 않는다는 것을 보여주기 위해.
- 유한 수명 하한과 할인 설정 하한이 구조적으로 유사하다는 기존의 믿음을 도전하기 위해.
제안 방법
- 상태 s_A 는 보상 0으로 s_B 로 전이되는 결정론적 MDP를 구성한다. s_B 는 자기 자신으로의 순환 전이와 보상 r 을 가진다.
- φ(s_A) = γ, φ(s_B) = 1 인 1차원 특징 맵을 정의하여 가치 함수의 선형 실현 가능성을 확보한다.
- 데이터 샘플링 분포를 s_A 에서만 전이를 샘플링하도록 설정하여 s_B 는 관측되지 않도록 한다.
- 데이터 분포 하에서 특징 공분산 행렬의 고유값이 γ² > 0 임을 증명하여 커버리지 가정을 만족함을 보인다.
- 진짜 보상 r 값이 학습자에게 미지이므로, 무한한 데이터가 있음에도 불구하고 Q-값 추정이 불가능하다는 것을 보인다.
- 이 구성 결과를 d차원 특징과 다중 행동을 가진 제어 가능한 설정으로 확장하여 일반화한다.
실험 결과
연구 질문
- RQ1최소한의 MDP 구성이 할인 설정 하에서 배치 강화 학습에서 무한한 샘플 복잡도를 보일 수 있는가?
- RQ2선형 실현 가능성과 양호한 특징 커버리지가 할인 설정 하에서도 학습 가능성 보장을 하지 못하는가?
- RQ3왕 등 (2020) 의 유한 수명 하한 구성이 할인 설정에서 하드니스 결과를 유지하면서 단순화될 수 있는가?
- RQ4유한 수명 하한과 할인 설정 하한은 구조적 유사성에도 불구하고 본질적으로 다른 학습 복잡도를 보이는가?
- RQ5다중 행동을 가진 제어 가능한 MDP로 하한 결과를 확장할 수 있으며, 이 경우 학습 불가능성이 유지되는가?
주요 결과
- 할인 인자 γ ∈ (0,1) 이나 1차원 특징을 가진 2상태 MDP는 배치 강화 학습에서 무한한 샘플 복잡도를 보인다.
- 값 함수의 선형 실현 가능성과 고유값 γ² > 0 인 특징 공분산 행렬이 있음에도 불구하고, 진짜 보상 r 은 데이터로부터 식별 불가능하다.
- s_B 에서의 관측 부족으로 인해 무한한 데이터가 있음에도 불구하고 학습자는 s_A 나 s_B 의 진짜 값을 알 수 없다.
- d차원 특징으로 확장할 경우 특징 커버리지가 Θ(1/d) 수준으로 감소하지만 오차는 여전히 Ω(1) 이 유지된다.
- s_A 에서 두 개의 행동이 존재하는 제어 가능한 설정에서, 최적의 Q-값은 진짜 값으로부터 임의로 멀어질 수 있어 정책 학습이 불가능하다.
- 결과적으로, 기존의 가정인 '유한 수명 하한과 할인 설정 하한은 상호 교환 가능하다' 는 것을 도전하며, 이 둘 간의 학습 복잡도에 본질적인 차이가 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.