Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Exploring Starts by Kernel Density Estimation-Based State-Space Coverage Acceleration in Reinforcement Learning

Maximilian Schenke, Oliver Wallscheid|arXiv (Cornell University)|2021. 05. 19.
Control Systems and Identification인용 수 5
한 줄 요약

이 논문은 커널 밀도 추정 기반 방법인 DESSCA를 제안하여, 상태공간의 덜 방문된 상태를 우선순위화함으로써 강화학습에서 탐색 시작을 향상시킨다. KDE를 사용해 방문 밀도를 추정하고, 희소한 영역으로 향하는 초기 상태 선택을 유도함으로써, 이는 이산화 없이도 연속 상태공간에서 학습 안정성과 최종 성능을 향상시키며, 표준 탐색 시작 방식에 비해 모터 제어 과제에서 최대 10.9%의 중앙값 성능 향상을 달성한다.

ABSTRACT

Reinforcement learning (RL) is currently a popular research topic in control engineering and has the potential to make its way to industrial and commercial applications. Corresponding RL controllers are trained in direct interaction with the controlled system, rendering them data-driven and performance-oriented solutions. The best practice of exploring starts (ES) is used by default to support the learning process via randomly picked initial states. However, this method might deliver strongly biased results if the system's dynamic and constraints lead to unfavorable sample distributions in the state space (e.g., condensed sample accumulation in certain state-space areas). To overcome this issue, a kernel density estimation-based state-space coverage acceleration (DESSCA) is proposed, which improves the ES concept by prioritizing infrequently visited states for a more balanced coverage of the state space during training. Compared to neighbouring methods in the field of count-based exploration, DESSCA can also be applied to continuous state spaces without the need for artificial discretization of the states. Moreover, the algorithm allows to define arbitrary reference state distributions such that the state coverage can be shaped w.r.t. the application needs. Considered test scenarios are mountain car, cartpole and electric motor control environments. Using DQN and DDPG as exemplary RL algorithms, it can be shown that DESSCA is a simple yet effective algorithmic extension to the established ES approach that enables an increase in learning stability as well as the final control performance.

연구 동기 및 목표

  • 시스템 동역학과 제약 조건 하에서 랜덤한 초기 상태 선택으로 인한 상태공간 커버리지의 편향 문제를 해결하기 위해.
  • 인위적인 이산화 없이도 연속 상태공간에서 더 균형 잡히고 효율적인 탐색을 가능하게 하는 방법을 개발하기 위해.
  • 사용자 정의 기반 참조 분포를 정의함으로써 응용 분야에 맞는 상태 커버리지 형상 조절을 가능하게 하기 위해.
  • 대상 초기화 전략을 통해 학습 효율성과 최종 제어 성능을 향상시키기 위해.
  • 기존의 DQN 및 DDPG 알고리즘에 쉽게 통합할 수 있는 단순하고 구현 가능한 확장 기법을 제공하기 위해.

제안 방법

  • 커널 밀도 추정(KDE)을 사용해 방문된 상태의 경험적 밀도를 추정하여 상태공간 내에서 탐색이 부족한 영역을 식별한다.
  • 응용 분야의 필요에 따라 원하는 커버리지 형상을 정의하기 위해 기준 상태 분포 $ c^*({\bm{x}}) $ 를 정의한다.
  • 추정된 밀도 $ \hat{c}({\bm{x}}) $ 와 기준 $ c^*({\bm{x}}) $ 간의 이질성 최소화를 위해 입자군집최적화(PSO)를 사용해 초기 상태를 찾는다.
  • 낮은 $ \hat{c}({\bm{x}}) $ 를 가지는 영역에서 초기 상태를 선택하여, 희소한 영역을 우선순위로 삼아 커버리지를 가속화한다.
  • DQN 및 DDPG 알고리즘의 표준 탐색 시작 방식에 DESSCA 전략을 플러그인 확장 형태로 통합한다.
  • 낮은 성능의 제어기(LPC)가 이용 가능하다는 가정 하에 실제 시스템과의 호환성을 유지한다.

실험 결과

연구 질문

  • RQ1KDE 기반의 상태공간 커버리지 가속화는 연속 상태 강화학습에서 탐색 효율성을 향상시킬 수 있는가?
  • RQ2표준 랜덤 탐색 시작 방식에 비해 DESSCA는 학습 안정성과 최종 성능 측면에서 어떻게 비교되는가?
  • RQ3DESSCA는 다양한 제어 과제에서 성능 변동성을 얼마나 줄이고, 강건성을 향상시킬 수 있는가?
  • RQ4특히 고차원 연속 환경에서 상태공간 이산화 없이 DESSCA를 효과적으로 적용할 수 있는가?
  • RQ5기준 분포의 선택이 과제 특화 시나리오에서 커버리지와 성능에 어떤 영향을 미치는가?

주요 결과

  • PMSM 전류 제어 과제에서 DESSCA는 제어 성능의 사분위율 범위를 1.734% 감소시켜 일관성 향상을 나타냈다.
  • 마운틴카 환경에서 DESSCA는 중앙값 성능을 91.941%에서 92.206%로 상승시켜 상대적 향상률 +0.289%를 달성했다.
  • 카트폴 과제에서 DESSCA는 중앙값 성능을 77.738%에서 77.308%로 약간 감소시켰지만, 통계적으로 유의미한 차이는 없었다.
  • PMSM 전류 제어 시나리오에서 DESSCA는 중앙값 성능을 10.944% 상승시켰으며, 표본 평균에 대한 95% 신뢰구간은 [86.587%, 88.325%]였다.
  • 모든 테스트 환경에서 알고리즘이 학습 안정성을 향상시키고 성능 산산을 감소시켰으며, 특히 추적 제어 문제에서 두드러진 성능 향상을 보였다.
  • DESSCA는 이산화 없이도 연속 상태공간에서 효과적인 탐색을 가능하게 하여, 복잡한 동역학을 가진 산업 제어 응용 분야에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.