Skip to main content
QUICK REVIEW

[논문 리뷰] Deep RL With Information Constrained Policies: Generalization in Continuous Control

Tyler Malloy, Chris R. Sims|arXiv (Cornell University)|2020. 10. 09.
Reinforcement Learning in Robotics참고 문헌 14인용 수 5
한 줄 요약

이 논문은 연속 제어 작업에서 일반화 성능을 향상시키기 위해 상호정보량 정규화를 통해 정책 복잡도에 정보이론적 제약을 부과하는 Capacity-Limited Actor-Critic (CLAC)을 제안한다. 정책 학습을 비율-왜곡 문제로 공식화함으로써 CLAC는 SAC와 MIRL보다 우수한 분포 외 일반화 성능를 달성하면서도 높은 샘플 효율성을 유지한다.

ABSTRACT

Biological agents learn and act intelligently in spite of a highly limited capacity to process and store information. Many real-world problems involve continuous control, which represents a difficult task for artificial intelligence agents. In this paper we explore the potential learning advantages a natural constraint on information flow might confer onto artificial agents in continuous control tasks. We focus on the model-free reinforcement learning (RL) setting and formalize our approach in terms of an information-theoretic constraint on the complexity of learned policies. We show that our approach emerges in a principled fashion from the application of rate-distortion theory. We implement a novel Capacity-Limited Actor-Critic (CLAC) algorithm and situate it within a broader family of RL algorithms such as the Soft Actor Critic (SAC) and Mutual Information Reinforcement Learning (MIRL) algorithm. Our experiments using continuous control tasks show that compared to alternative approaches, CLAC offers improvements in generalization between training and modified test environments. This is achieved in the CLAC model while displaying the high sample efficiency of similar methods.

연구 동기 및 목표

  • 유한한 정보 처리 용량을 갖는 에이전트를 모델링하여 연속 제어를 위한 딥 강화학습에서 일반화 성능을 향상시키는 것.
  • 정책 학습을 비율-왜곡 최적화 문제로 공식화하여 생물학적 인지와 정보이론과 연결하는 것.
  • 상호정보량 정규화를 통해 성능와 일반화를 균형 잡는 새로운 알고리즘 CLAC를 개발하는 것.
  • 용량 제약 정책이 표준 엔트로피 정규화 또는 상호정보량 정규화 방법보다 더 나은 일반화 성능를 보이는지 입증하는 것.
  • 보상 척도에 대한 강건성을 확보하고 부정적 전이를 완화하기 위해 상호정보량 계수를 자동 조정할 수 있도록 하는 것.

제안 방법

  • 정책의 상호정보량이 최대 용량 C 이내로 제약을 두는 방식으로 RL 목적함수를 비율-왜곡 문제로 공식화한다.
  • 정책 채널 π(a|s)에 대한 상호정보량 제약 조건 하에 기대 수익을 최대화하는 학습 목표를 유도한다.
  • 정책 복잡도를 정규화하기 위해 -β·I(π(a|s))의 페널티 항을 포함한 CLAC 알고리즘을 도입한다.
  • SAC의 α 조정 방식을 영감으로 받아, 학습 중 정보 용량을 동적으로 제어할 수 있는 자동 β 계수 업데이트 규칙을 적용한다.
  • 비판자 네트워크를 통해 상태와 행동 간의 상호정보량을 변분 근사로 추정한다.
  • N-chain 및 MuJoCo 벤치마크를 포함한 연속 제어 환경에 적용하여, 일반화 성능 평가를 위해 흐트러진 테스트 조건을 설정한다.

실험 결과

연구 질문

  • RQ1상호정보량을 통한 정책 복잡도 제약이 연속 제어 강화학습에서 일반화 성능 향상에 기여하는가?
  • RQ2정보 제약 정책 학습이 분포 외 일반화에서 엔트로피 정규화(SAC) 및 상호정보량 정규화(MIRL) 방법과 비교해 어떻게 성능를 발휘하는가?
  • RQ3상호정보량 계수의 자동 조정이 다양한 환경에서 강건성과 성능 안정성 향상에 기여하는가?
  • RQ4비율-왜곡 기반 목적함수는 표준 딥 강화학습 기반 알고리즘보다 더 높은 샘플 효율성과 일반화 성능를 달성할 수 있는가?
  • RQ5정보 용량 제한이 전이 학습 시나리오에서 부정적 전이를 얼마나 줄이는가?

주요 결과

  • CLAC는 특히 분포 외 설정에서 흐트러진 연속 제어 환경에서 SAC와 MIRL보다 일반화 성능가 뛰어나다.
  • 자동 β 조정 메커니즘이 학습 안정성을 향상시키고 보상 척도 변화에 대한 강건성을 확보하며, SAC의 α 적응 방식과 유사한 효과를 발휘한다.
  • 기본 기반 방법보다 더 높은 샘플 효율성을 확보하면서도 강력한 일반화 성능를 유지한다.
  • 정보이론적 제약이 정책 복잡도를 효과적으로 제한하여 특정 상태-행동 패턴에 대한 과적합을 줄인다.
  • 더 강한 정보 제약으로 인해 전이 학습에서 표준 전이 학습보다 부정적 전이가 감소함을 입증한다.
  • 실험 결과, 환경 파라미터가 변경된 경우 CLAC는 MERL 기반 방법보다 더 나은 일반화 성능를 보이며, 용량 제한 학습의 유용성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.