Skip to main content
QUICK REVIEW

[논문 리뷰] Memory-based Deep Reinforcement Learning for POMDPs

Lingheng Meng, Rob Gorbet|arXiv (Cornell University)|2021. 02. 24.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 부분적으로 관찰 가능한 마르코프 결정 과정(POMDP)를 해결하기 위해 장기 단기 기억(LSTM) 네트워크를 트윈 딜레이드 딥 디터미니스틱 드리프트 정책 기반 강화학습(TD3) 프레임워크에 통합한 메모리 증강 Deep Reinforcement Learning(DRL) 알고리즘인 LSTM-TD3를 제안한다. 과거 관측치와 행동을 포함한 순환 메모리 구조를 통해, 노이즈가 있거나 관측이 불완전한 환경에서도 성능을 크게 향상시키면서도, 완전히 관찰 가능한 MDP 환경에서도 최신 기술 수준의 성능 유지를 달성한다.

ABSTRACT

A promising characteristic of Deep Reinforcement Learning (DRL) is its capability to learn optimal policy in an end-to-end manner without relying on feature engineering. However, most approaches assume a fully observable state space, i.e. fully observable Markov Decision Processes (MDPs). In real-world robotics, this assumption is unpractical, because of issues such as sensor sensitivity limitations and sensor noise, and the lack of knowledge about whether the observation design is complete or not. These scenarios lead to Partially Observable MDPs (POMDPs). In this paper, we propose Long-Short-Term-Memory-based Twin Delayed Deep Deterministic Policy Gradient (LSTM-TD3) by introducing a memory component to TD3, and compare its performance with other DRL algorithms in both MDPs and POMDPs. Our results demonstrate the significant advantages of the memory component in addressing POMDPs, including the ability to handle missing and noisy observation data.

연구 동기 및 목표

  • 센서 노이즈나 제한된 감지로 인해 상태 정보가 불완전한 부분 관찰 가능한 환경에서 표준 Deep Reinforcement Learning(DRL) 알고리즘의 한계를 해결하기 위해.
  • 관측치와 행동 이력으로부터 은닉 상태를 추론할 수 있는 메모리 증강 DRL 방법을 개발하여, POMDP 환경에서의 정책 학습 성능을 향상시키기 위해.
  • 연속 제어 작업의 MDP 및 POMDP 형태에서 메모리 구성 요소—특히 LSTM 기반 메모리—의 효과를 평가하기 위해.
  • 학습 안정성과 성능 향상에 기여하는 주요 아키텍처 구성 요소들, 예를 들어 현재 특징 추출, 과거 행동 포함, 메모리 압축의 기여도를 조사하기 위해.
  • 진짜 상태가 완전히 관측되지 않을 경우 관측 공간 설계에 대한 통찰을 제공하기 위해, 에이전트가 메모리를 통해 관측되지 않은 상태 역학을 추론할 수 있도록 하기 위해.

제안 방법

  • TD3 알고리즘에 장기 단기 기억(LSTM) 네트워크를 통합하여 과거 관측치와 행동을 인코딩하는 은닉 상태를 유지함으로써, 부분 관찰 가능한 환경에서 시간적 의존성을 모델링할 수 있도록 한다.
  • LSTM이 과거 관측치와 행동의 시퀀스를 처리하는 순환 액터-크리틱 프레임워크를 사용하며, 은닉 상태가 액터 및 크리틱 네트워크 양쪽에 조건부로 사용된다.
  • 메모리 표현과 현재 관측치 특징 추출을 분리하여 간섭을 줄이고, 특히 MDP 설정에서 학습 안정성을 향상시킨다.
  • TD3에서 유래한 메모리 압축(DC)과 타겟 정책 스무딩(TPS)을 적용하여 학습을 안정화하고 Q-값 추정의 과도한 추정 편향을 완화한다.
  • 현재 관측치와 행동을 별도로 처리한 후 LSTM 은닉 상태와 결합하여 정책 및 가치 예측을 수행하는 하이브리드 아키텍처를 사용한다.
  • 각 실험에서 역사 길이 $ l $ 를 하이퍼파라미터로 고정하지만, 향후 연구에서는 효율성과 성능 향상을 위해 동적 적응을 탐색할 것.

실험 결과

연구 질문

  • RQ1TD3에 LSTM 메모리 구성 요소를 통합함으로써 POMDP에서 표준 DRL 알고리즘에 비해 성능 향상이 어떻게 이루어지는가?
  • RQ2현재 특징 추출, 과거 행동 포함, 메모리 압축의 상대적 기여도는 LSTM-TD3 프레임워크의 전체 성능에 어떤 영향을 미치는가?
  • RQ3관측 가능성 저하가 있는 POMDP 환경에서 뚜렷한 성능 향상을 보일 뿐 아니라, MDP 환경에서도 뛰어난 성능 유지를 할 수 있는가?
  • RQ4진짜 상태가 관측치로 완전히 포괄되지 않을 경우 관측 공간 설계의 불확실성에 대해 LSTM-TD3는 얼마나 강건한가?
  • RQ5행동 이력이 유용한 상태 정보를 담고 있는 작업에서 과거 행동을 메모리에 포함시키는 것이 상태 추론에 얼마나 기여하는가?

주요 결과

  • LSTM-TD3는 노이즈가 있거나 관측이 불완전한 조건에서 DDPG, TD3 및 기타 베이스라인보다 훨씬 뛰어난 성능을 기록한다.
  • 제거 실험 결과, 현재 특징 추출(CFE), 메모리 압축(DC), 타겟 정책 스무딩(TPS), 과거 행동 포함(PA) 등 모든 구성 요소가 최적 성능을 내기 위해 필수적임을 확인한다.
  • MDP 환경에서도 DDPG를 초월하는 성능을 기록함으로써, 메모리 구성 요소가 완전히 관찰 가능한 설정에서 성능 저하를 유발하지 않음을 시사한다.
  • 현재 특징 추출을 제거한 경우(전체 - CFE), 특히 MDP 환경에서 성능 저하가 심각하게 발생함을 확인하여, CFE가 관측 공간이 잘 설계된 경우 성능 유지에 핵심적임을 입증한다.
  • 과거 행동을 메모리에서 제외한 경우(PA 제거) POMDP-RV 형태의 환경, 예를 들어 InvertedDoublePendulumPyBulletEnv-v0에서 성능 저하가 뚜렷하게 나타나, 과거 행동이 상태 정보를 담고 있음을 시사한다.
  • LSTM-TD3는 관측 설계의 불확실성에 강건함을 보이며, 관측 공간의 완전성이 자주 알려지지 않은 실세계 로봇 응용 분야에 적합함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.