[논문 리뷰] Estimating Q(s,s') with Deep Deterministic Dynamics Gradients
이 논문은 상태 s에서 이웃한 상태 s'로 전이하고 이후에 최적으로 행동할 경우의 유용성을 평가하는 새로운 가치 함수 Q(s,s')를 소개한다. 이는 행동과 가치를 분리함으로써 행동과 가치 학습을 분리한다. Q(s,s')를 최대화하는 다음 상태를 예측하도록 딥 디터미니스틱 다이내믹스 그래디언트(D3G)를 통해 전방 다이내믹스 모델을 훈련시킴으로써, 랜덤하거나 부분 최적 정책에서 유래한 순수 관측 데이터로부터도 오프-폴리시 학습이 가능해지며, 이는 부동한 행동 공간에서 전이성과 효율성이 향상된다.
In this paper, we introduce a novel form of value function, $Q(s, s')$, that expresses the utility of transitioning from a state $s$ to a neighboring state $s'$ and then acting optimally thereafter. In order to derive an optimal policy, we develop a forward dynamics model that learns to make next-state predictions that maximize this value. This formulation decouples actions from values while still learning off-policy. We highlight the benefits of this approach in terms of value function transfer, learning within redundant action spaces, and learning off-policy from state observations generated by sub-optimal or completely random policies. Code and videos are available at http://sites.google.com/view/qss-paper.
연구 동기 및 목표
- 행동에 종속되지 않는 상태 전이의 유용성을 표현하는 가치 함수를 개발하여, 가치와 정책 학습을 분리할 수 있도록 한다.
- 전달자 행동에 접근할 수 없더라도 오직 상태 관측 자료만을 사용하여 오프-폴리시 강화 학습을 가능하게 한다.
- 중복되거나 고차원적인 행동 공간을 가진 환경에서 전이성과 샘플 효율성을 향상시킨다.
- 행동에 조건부가 아닌, 향후 수익을 최대화하는 다음 상태를 예측하는 전방 다이내믹스 모델을 훈련시킨다.
제안 방법
- Q(s,s')를 상태 s에서 s'로 전이하고 이후 최적으로 행동할 경우의 수익으로 정의하며, Q(s,s') = r + γ max_{s''} Q(s',s'')로 표현한다.
- 행동 조건 없이 Q(s,τ(s))를 최대화하는 전방 다이내믹스 모델 τ(s) → s'을 훈련시키는 D3G(Depth Deterministic Dynamics Gradients) 방법을 제안한다.
- 다양이 가능한 다이내믹스 모델을 사용하여 가치 함수 타겟에 기반한 다음 상태 예측에 대한 기울기 업데이트를 수행함으로써, 엔드 투 엔드 오프-폴리시 학습을 가능하게 한다.
- 이중 단계 학습 과정을 적용한다: 첫 번째 단계에서는 부트스트랩을 통해 Q(s,s')를 학습하고, 두 번째 단계에서는 Q(s,τ(s))를 최대화하는 다음 상태 예측을 위해 τ(s)를 훈련시킨다.
- 여러 행동이 동일한 상태 전이로 이어질 수 있음을 활용하여, 중복 행동을 자연스럽게 하나의 가치 추정치로 통합한다.
- 함수 근사와 경험 리플레이를 사용하여, 표본화된 환경과 연속 제어 환경(예: MuJoCo 작업) 모두에 이 방법을 적용한다.
실험 결과
연구 질문
- RQ1행동에 종속되지 않는 상태 전이에 기반한 가치 함수 Q(s,s')가 기존의 Q(s,a)에 비해 샘플 효율성과 전이성 측면에서 뛰어나게 성능을 발휘할 수 있는가?
- RQ2행동 감독 없이도 향후 수익을 최대화하는 다음 상태 예측을 생성할 수 있는 전방 다이내믹스 모델을 훈련시킬 수 있는가?
- RQ3Q(s,s')와 D3G는 전달자 행동 정보 없이도 순수 관측 데이터로부터 효과적인 정책을 학습할 수 있는가? 특히 랜덤하거나 부분 최적의 시연 데이터로부터도 가능한가?
- RQ4행동과 가치를 분리함으로써, 다이내믹스는 동일하지만 행동 표현 방식이 다른 환경 간의 전이성이 향상되는가?
주요 결과
- 표준 표본화 환경에서 Q(s,s')는 Q(s,a)와 유사한 성능을 기록하여, 행동에 종속되지 않는 가치 학습의 타당성을 입증한다.
- 전문가 행동 정보 없이도 순수 관측 데이터로부터 정책을 성공적으로 학습시켰으며, 완전히 랜덤한 시범 데이터로부터도 학습이 가능했다.
- 중복 행동이 존재하는 환경에서는 Q(s,s')가 동일한 전이를 자연스럽게 하나의 가치 추정치로 통합하여 샘플 효율성을 향상시켰다.
- D3G를 통해 행동 감독 없이도 수익을 최대화하는 전방 다이내믹스 모델을 오프-폴리시로 훈련시킬 수 있었으며, MuJoCo 제어 과제에서 높은 샘플 효율성을 달성했다.
- 유사한 다이내믹스를 가진 작업 간에 효과적인 가치 전이가 가능했으며, 전이 시에는 역다이내믹스 모델만 재학습하면 되었다.
- 이 방법은 관측 전용 데이터로부터 자동 목표 생성과 계획이 가능했으며, 행동 레이블이 필요한 관측 기반 이mitation 학습 보다 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.