Skip to main content
QUICK REVIEW

[논문 리뷰] Qgraph-bounded Q-learning: Stabilizing Model-Free Off-Policy Deep Reinforcement Learning

Sabrina Hoppe, Marc Toussaint|arXiv (Cornell University)|2020. 07. 15.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 모델-프리 오폴리시 딥 강화학습의 안정성을 높이기 위해 복구 메모리 전이로부터 부분 그래프(Q 그래프)를 구성하여 정확한 하한값 Q-값을 Q-반복을 통해 계산하는 Qgraph-bounded Q-학습을 제안한다. 시간 차분 학습에서 이러한 하한값을 강제 적용함으로써 소프트 발산을 방지하고, 샘플 효율성을 향상시키며, 연속 제어 과제에서 하이퍼파ram터 및 제한된 복구 메모리 용량에 대한 강건성을 향상시킨다.

ABSTRACT

In state of the art model-free off-policy deep reinforcement learning, a replay memory is used to store past experience and derive all network updates. Even if both state and action spaces are continuous, the replay memory only holds a finite number of transitions. We represent these transitions in a data graph and link its structure to soft divergence. By selecting a subgraph with a favorable structure, we construct a simplified Markov Decision Process for which exact Q-values can be computed efficiently as more data comes in. The subgraph and its associated Q-values can be represented as a QGraph. We show that the Q-value for each transition in the simplified MDP is a lower bound of the Q-value for the same transition in the original continuous Q-learning problem. By using these lower bounds in temporal difference learning, our method QG-DDPG is less prone to soft divergence and exhibits increased sample efficiency while being more robust to hyperparameters. QGraphs also retain information from transitions that have already been overwritten in the replay memory, which can decrease the algorithm's sensitivity to the replay memory capacity.

연구 동기 및 목표

  • 모델-프리 오폴리시 딥 강화학습에서 특히 연속 제어 과제에서 발생하는 소프트 발산 문제를 해결하기 위해.
  • 불안정성과 발산을 유발하는 복구 메모리의 구조적 성질을 분석하기 위해.
  • 부분 그래프 구조를 활용하여 정확한 보수적인 Q-값 하한을 계산하는 방법을 개발하기 위해.
  • 기존 전이가 덮어쓰기로 인해 손실된 정보를 유지함으로써 복구 메모리 용량에 민감도를 낮추기 위해.
  • DDPG 기반 알고리즘에서 샘플 효율성과 하이퍼파ram터 설정에 대한 강건성을 향상시키기 위해.

제안 방법

  • 노드가 상태이고 간선이 (상태, 행동, 보상, 다음 상태) 전이인 데이터 그래프로 복구 메모리를 표현하기 위해.
  • '이어지지 않은 끝' (후속 상태가 없는 비종료 상태)를 제외하고, 이러한 상태를 통합하기 위해 0행동을 포함하여 Q 그래프를 구성하기 위해.
  • Q-반복을 사용하여 Q 그래프의 정확한 Q-값을 계산하여 원래 Q-값에 대해 증명 가능한 하한값을 갖는 유한한 MDP를 형성하기 위해.
  • 시간 차분 학습에서 이러한 하한값을 타겟으로 사용하여 Q-학습 업데이트를 안정화하고 소프트 발산을 방지하기 위해.
  • 정책 및 가치 네트워크 업데이트 중 하한 Q-값을 통합함으로써 Q 그래프를 DDPG에 통합하기 위해.
  • 비결정적 전이를 경험적으로 다루기 위해 반환 편차가 유계임을 가정하여, 불확실성에도 불구하고 성능을 유지하기 위해.

실험 결과

연구 질문

  • RQ1복구 메모리 데이터 그래프에서 소프트 발산과 관련된 구조적 패턴은 무엇인가?
  • RQ2복구 전이의 부분 그래프를 구성하여 정확한 Q-값을 효율적으로 계산하고 전체 MDP의 하한값으로 사용할 수 있는가?
  • RQ3TD 학습에서 이러한 하한 Q-값을 강제 적용함으로써 연속 제어 과제에서 소프트 발산을 줄이고 학습 안정성을 향상시킬 수 있는가?
  • RQ4Q 그래프가 샘플 효율성과 하이퍼파aram터 설정에 대한 강건성에 얼마나 기여하는가?
  • RQ5Q 그래프가 복구 버퍼에서 덮어쓰기로 손실된 전이에서 유용한 정보를 유지할 수 있는가?

주요 결과

  • Q 그래프 방법인 QG-DDPG는 복구 전이의 부분 그래프에서 유도된 보수적인 Q-값 하한을 강제 적용하여 연속 제어 과제에서 소프트 발산을 방지한다.
  • QG-DDPG는 일반 DDPG보다 더 높은 샘플 효율성을 달성하며, 불리한 하이퍼파aram터 설정에서도 특히 두드러진다.
  • 복구 버퍼에 단 1,000개의 전이만 존재하는 조건에서도 QG-DDPG는 무제한 메모리 사용 시 일반 DDPG와 유사한 성능을 보이며, 메모리 용량 제한에 대한 강건성을 입증한다.
  • 전이의 비결정성 증가 조건에서도 메서드는 효과적으로 유지되며, 결정성 가정에 대한 이론적 제약에도 불구하고 내성적 저항성을 보인다.
  • Q 그래프가 덮어쓰기로 손실된 전이의 정보를 암묵적으로 유지함으로써 복구 버퍼 크기 민감도를 감소시킨다.
  • Q 그래프에서 유도된 하한값은 일반 하한값보다 더 유용하며, 현재 정책 하에서 방문 가능성이 높은 상태에서의 과소추정을 보정한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.