Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Reinforcement Learning in POMDPs with Incomplete and Noisy Observations

Yuhui Wang, Hao He|arXiv (Cornell University)|2019. 02. 15.
Machine Learning and ELM참고 문헌 13인용 수 9
한 줄 요약

이 논문은 관측이 불완전하고 노이즈가 있는 부분 관측 마르코프 결정 과정(POMDP)에서 연속 제어를 위한 강력한 강화 학습 방법인 BI-PPO를 제안한다. 노이즈가 있는 데이터로부터 전이 모델을 학습하기 위해 局부 근사(local approximation)를 사용하는 서로서프 손실를 도입하고, 믿음 갱신 과정에 생성 모델을 통합하여 믿음 보정을 수행한다. 이는 고노이즈 및 고결손 비율 조건에서도 기존 기준 방법들보다 뛰어난 성능을 보이며, 특히 HalfCheetah와 Ant와 같은 고차원 작업에서 두각을 나타낸다.

ABSTRACT

In real-world scenarios, the observation data for reinforcement learning with continuous control is commonly noisy and part of it may be dynamically missing over time, which violates the assumption of many current methods developed for this. We addressed the issue within the framework of partially observable Markov Decision Process (POMDP) using a model-based method, in which the transition model is estimated from the incomplete and noisy observations using a newly proposed surrogate loss function with local approximation, while the policy and value function is learned with the help of belief imputation. For the latter purpose, a generative model is constructed and is seamlessly incorporated into the belief updating procedure of POMDP, which enables robust execution even under a significant incompleteness and noise. The effectiveness of the proposed method is verified on a collection of benchmark tasks, showing that our approach outperforms several compared methods under various challenging scenarios.

연구 동기 및 목표

  • 실세계의 연속 제어 환경에서 관측이 동적으로 누락되거나 노이즈에 의해 손상될 경우 강화 학습 에이전트를 안정적으로 훈련시키는 도전 과제를 해결한다.
  • 완전한 관측에 의존하지 않고도 결손 또는 노이즈가 있는 센서 입력이 있을 경우에도 정확한 믿음 상태를 유지하는 모델 기반 접근법을 개발한다.
  • 표준 PPO 및 RNN 기반 방법이 관측 오염 상황에서 실패하는 고차원 제어 과제에서의 샘플 효율성과 성능을 향상시킨다.
  • 생성 모델을 믿음 상태 갱신 과정에 통합하여 안정적이고 신뢰할 수 있는 정책 학습을 가능하게 하며, 심각한 데이터 누락 상황에서도 실행 가능성을 확보한다.

제안 방법

  • 결손 및 노이즈가 있는 관측에서 MDP 전이 모델을 추정하기 위해 局부 근사 기반의 새로운 서로서프 손실 함수를 제안하여 강력한 동역학 학습을 가능하게 한다.
  • 훈련 및 추론 과정에서 모두 작동하는 생성 모델을 활용해 누락된 상태 성분을 예측하는 믿음 보정 메커니즘을 도입한다.
  • 생성 모델을 POMDP 믿음 갱신 과정에 원활하게 통합하여 과거 관측과 행동을 바탕으로 보정된 믿음 상태에서 정책이 작동하도록 한다.
  • BI-PPO라는 PPO 유사 알고리즘 내에 모델 기반 프레임워크를 적용하여 정책, 가치 함수, 전이 모델을 모두 믿음 상태 보정 결과를 기반으로 공동으로 훈련한다.
  • 정책 네트워크의 입력으로 믿음 상태를 사용하며, 이는 잠재 상태에 대한 사후 분포를 나타내며, 생성 모델과 관측 데이터를 이용해 순차적으로 갱신된다.
  • 비.i.i.d. 및 손상된 관측을 다루기 위해 서로서프 손실에 局부 근사를 적용하여 전이 동역학 학습의 일반화 및 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ1관측이 동적으로 누락되거나 노이즈가 있는 상황에서 모델 기반 강화 학습 방법이 POMDP에서 강력한 성능을 달성할 수 있는가?
  • RQ2생성 모델을 통한 믿음 보정은 단순 보정 또는 손상된 관측에서 직접 행동을 취하는 것에 비해 정책 성능을 얼마나 향상시키는가?
  • RQ3국부 근사를 적용한 제안된 서로서프 손실이 결손 및 노이즈가 있는 데이터로부터 전이 모델을 얼마나 잘 학습하는가?
  • RQ4믿음 보정을 통한 전이 모델과 정책의 공동 학습은 표준 PPO나 RNN 기반 기준 방법보다 더 높은 샘플 효율성과 최종 성능을 달성하는가?

주요 결과

  • BI-PPO는 고결손 비율과 고노이즈 조건에서 HalfCheetah, Ant, Hopper, Walker2d에서 EI-PPO, DR-PPO, ADR-PPO를 크게 앞서며, 특히 고차원 제어 과제에서 두각을 나타낸다.
  • HalfCheetah와 Ant에서 BI-PPO는 각각 원래 PPO의 최대 에피소드 보상의 268%, 120%를 기록하여 뚜렷한 성능 향상을 입증한다.
  • BI-PPO는 뛰어난 샘플 효율성을 보이며, HalfCheetah, Hopper, InvertedDoublePendulum, Reacher에서 목표 성능에 도달하기 위해 PPO 및 EI-PPO보다 적은 타임스텝을 소비한다.
  • 진짜 잠재 상태와의 MSE로 측정한 보정된 상태 정밀도는 보상 성능과 강하게 상관관계가 있어 믿음 보정 메커니즘의 효과성을 검증한다.
  • 실행 시간 복잡도는 O(T(D(1−η))³)로 증가하지만, 평균적으로 에피소드당 5.1초 내외로 실행되어 그 강건성과 성능 향상 수준를 감안할 때 수용 가능한 수준이다.
  • BI-PPO는 관측의 50%가 누락되거나 손상되어도 강력한 성능 유지를 유지하는 반면, DR-PPO 및 ADR-PPO와 같은 다른 방법들은 이러한 조건에서 심각하게 성능이 저하된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.