Skip to main content
QUICK REVIEW

[논문 리뷰] Predictive Coding for Boosting Deep Reinforcement Learning with Sparse Rewards

Xingyu Lu, Stas Tiomkin|arXiv (Cornell University)|2019. 12. 21.
Reinforcement Learning in Robotics참고 문헌 32인용 수 4
한 줄 요약

이 논문은 희박 보상 환경에서 강화학습의 샘플 효율성을 높이기 위해 예측 코딩을 사용하여 비지도 표현을 학습하고 보상 구조를 형성하는 방법을 제안한다. 연속된 상태 간 상호정보량을 최대화하기 위해 대비 예측 코딩(Contrastive Predictive Coding)을 활용함으로써, 노이즈에 강건하고 동역학을 반영하는 보상 신호를 생성한다. 이 보상 신호는 로봇 조작, 탐색, 운동 제어 과제에서 수동으로 설계된 보상과 동일한 샘플 효율성을 확보한다.

ABSTRACT

While recent progress in deep reinforcement learning has enabled robots to learn complex behaviors, tasks with long horizons and sparse rewards remain an ongoing challenge. In this work, we propose an effective reward shaping method through predictive coding to tackle sparse reward problems. By learning predictive representations offline and using these representations for reward shaping, we gain access to reward signals that understand the structure and dynamics of the environment. In particular, our method achieves better learning by providing reward signals that 1) understand environment dynamics 2) emphasize on features most useful for learning 3) resist noise in learned representations through reward accumulation. We demonstrate the usefulness of this approach in different domains ranging from robotic manipulation to navigation, and we show that reward signals produced through predictive coding are as effective for learning as hand-crafted rewards.

연구 동기 및 목표

  • 희박 보상 환경에서의 강화학습에서의 샘플 비효율성 문제를 해결하기 위해.
  • 도메인 특화 보상 설계 없이도 비지도 표현 학습을 활용하는 보상 형상화 방법을 개발하기 위해.
  • 학습된 표현에서 발생하는 노이즈에 강건하고 환경의 동역학을 강조하는 보상 신호를 생성하기 위해.
  • 예측 코딩 기반 보상 형상화가 복잡한 제어 과제에서 수동으로 설계된 보상과 동등한 성능을 내는지 확인하기 위해.

제안 방법

  • 방법은 궤적 내 연속된 상태 간 상호정보량을 최대화하기 위해 대비 예측 코딩(CPC)을 사용하여 표현을 학습한다.
  • 예측 특징은 무작위 또는 탐색 정책을 통해 사전에 수집한 오프라인 궤적에서 추출된다.
  • 이러한 특징은 표현 공간에서 보상을 형상화하는 데 사용되며, 원시 관측값에서 학습하는 동안 에이전트에게 밀도 높은 피드백을 제공한다.
  • 보상 형상화는 조밀하고 희박 보상에 의존하지 않는 신호로 적용되며, 표현 학습과 정책 학습을 분리한다.
  • 표준 강화학습 알고리즘(PPO 등)과 호환되며, 오프라인 인코더 사전학습과 온라인 강화학습을 단계적으로 수행하는 이중 단계 파이프라인으로 운영된다.
  • 노이즈에 강건한 성능을 높이기 위해 임베딩을 직접 특징으로 사용하는 것을 피하고, 대신 이를 보상 형상화에만 활용함으로써 표현이 완벽하지 않을 경우의 민감도를 감소시킨다.

실험 결과

연구 질문

  • RQ1비지도 예측 코딩 표현이 희박 보상 강화학습에서 효과적인 보상 신호를 제공할 수 있는가?
  • RQ2예측 코딩 기반 보상 형상화는 수동으로 설계된 보상과 비교해 샘플 효율성과 최종 성능 측면에서 어떻게 성능을 내는가?
  • RQ3명시적인 감독 없이도 예측 코딩 표현이 다양한 무늬와 환경 변화에 일반화될 수 있는가?
  • RQ4정책 학습에서 예측 특징을 보상 형상화에 사용하는 것이 상태 특징으로 사용하는 것보다 성능이 뛰어나게 되는가?
  • RQ5장수명 환경 및 탐색이 제한된 환경에서 이 방법은 어떻게 성능을 내는가?

주요 결과

  • 제안된 방법은 로봇 조작, 탐색, 운동 제어 과제에서 수동으로 설계된 보상과 동등한 성능을 달성하였으며, 동일한 샘플 효율성을 확보하였다.
  • 예측 코딩 특징을 보상 형상화에 사용하는 것이 특징을 상태 특징으로 사용하는 것보다 유의미하게 뛰어나며, 특히 노이즈가 많거나 표현 학습이 부족한 환경에서 두드러진다.
  • 배경 무늬 변화에 대해 강건한 성능을 보였으며, 임베딩이 물리적 상태(예: 팔의 각도)에 따라 군집되는 경향을 보여, 동역학을 효과적으로 추상화하고 있음을 시사한다.
  • 예측 코딩 기반 보상 형상화 덕분에 탐색이 제한된 환경에서도 안정적인 학습이 가능했으며, Reacher 및 Pendulum과 같은 환경에서 표준 희박 보상 학습보다 뛰어난 성능을 보였다.
  • 표현 학습과 정책 학습을 분리함으로써 노이즈가 있는 표현에 대한 민감도를 감소시켰고, 궤적 전반에 걸친 보상 누적 기능을 활용하였다.
  • 이 방법은 고차원 관측값(예: 픽셀 입력)을 포함한 다양한 환경에서 효과적이었으며, 아키텍처나 알고리즘 수정 없이도 성능을 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.