[논문 리뷰] Q-Learning in enormous action spaces via amortized approximate maximization
Amortized Q-learning (AQL)은 Q-learning에서 정확한 행동 최대화를 학습된 제안 분포로 대체하여 소수의 행동 세트를 샘플링하도록 하여, 이산, 연속 및 하이브리드 행동 공간에서 확장 가능한 학습을 가능하게 한다.
Applying Q-learning to high-dimensional or continuous action spaces can be difficult due to the required maximization over the set of possible actions. Motivated by techniques from amortized inference, we replace the expensive maximization over all actions with a maximization over a small subset of possible actions sampled from a learned proposal distribution. The resulting approach, which we dub Amortized Q-learning (AQL), is able to handle discrete, continuous, or hybrid action spaces while maintaining the benefits of Q-learning. Our experiments on continuous control tasks with up to 21 dimensional actions show that AQL outperforms D3PG (Barth-Maron et al, 2018) and QT-Opt (Kalashnikov et al, 2018). Experiments on structured discrete action spaces demonstrate that AQL can efficiently learn good policies in spaces with thousands of discrete actions.
연구 동기 및 목표
- 고차원 또는 연속 행동 공간에서 정확한 최대화가 불 tractible한 환경에서 Q-learning의 필요성을 촉진한다.
- Q-learning 업데이트를 위한 후보 행동 샘플링 제안을 학습하는 제안 분포를 학습하는 암묵적 접근을 제안한다.
- AQL이 이산적, 연속적 및 하이브리드 행동 공간을 처리하면서도 Q-learning의 이점을 유지함을 보여준다.
- 연속 제어 및 대규모 이산 행동 작업에서 강력한 기준선보다 AQL이 우수하다는 실증적 근거를 제시한다.
제안 방법
- 행동에 대한 정확한 최대화를 학습된 제안 분포 μ(a|s;θμ)에서 샘플링된 집합의 최대화로 대체한다.
- 확률적 탐색 절차로 찾은 행동에서 감독 학습으로 μ를 예측하는 두 번째 네트워크를 학습시키고, 탐색을 유지하기 위한 규제를 적용한다.
- 표준 Q-learning에서의 Q-함수 손실을 μ에서 샘플링된 행동들 중 최댓값으로 대체하여 정의한다.
- 균등 샘플과 μ에서의 샘플 조합으로 발견된 높은 Q-값을 갖는 행동의 가능성을 높이고, 탐색을 위한 엔트로피 항을 추가하여 μ를 감독 학습으로 업데이트한다.
- 부분 행동 간 의존성을 모델링하기 위해 자기회귀 제안을 사용하여 다변수 행동 공간 처리를 가능하게 한다.
- μ의 형태를 조정하여 연속, 이산 및 하이브리드 행동 공간에 AQL을 적용한다(이산화, 가우시안, 또는 범주형).
실험 결과
연구 질문
- RQ1고차원 행동 공간에서 행동 선택의 암묵화가 Q-learning 성능을 최대화할 수 있는가?
- RQ2연속 제어 작업에서 AQL이 강력한 기준선(D3PG, QT-Opt, IMPALA)과 비교하여 어떤 성능을 보이는가?
- RQ3AQL이 대규모 이산 행동 공간 및 구조화된 행동 집합으로 확장될 수 있는가?
- RQ4제안 분포의 정확도와 탐색이 학습 효율에 미치는 영향은 무엇인가?
주요 결과
- AQL은 DeepMind Control Suite의 연속 제어 작업에서 D3PG 및 QT-Opt보다 우수한 성능을 보인다.
- AQL은 수천 개의 행동이 있는 대규모 이산 행동 공간에서도 효과적인 정책을 학습하며, DeepMind Lab 작업에서 이를 시연한다.
- 이산화된 AQL 및 결정적 정책 변형은 고차원 행동 공간에서 Uniform Q-learning 및 QT-Opt보다 더 나은 성능을 보인다.
- DeepMind Lab의 대규모 행동 세트(3528 행동)에서 AQL은 최종 성능이 가장 좋고, 큰 집합에서의 정확한 Q-learning보다 더 효율적으로 학습하며 액션 선택의 유익한 확률적 특성으로 인해 학습 속도가 빨랐다.
- 제어-스위트 실험에서, 연속 구현의 AQL은 저/중 차원에서 비슷한 성능을 보이지만 매우 높은 차원 작업에서는 다소 저조할 수 있으며, 이산화된 AQL은 전반적으로 강력한 성능을 유지한다.
- AQL은 중요도 샘플링 보정 없이도 다양한 행동 공간 유형을 다루는 확장된 오프-폴리시 대안으로, 확률적 배우-비판 네트워크 방법의 대안을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.