Skip to main content
QUICK REVIEW

[논문 리뷰] Factored Adaptation for Non-Stationary Reinforcement Learning

Fan Feng, Biwei Huang|UvA-DARE (University of Amsterdam)|2022. 03. 30.
Mental Health Research Topics인용 수 5
한 줄 요약

이 논문은 비정상적인 강화학습을 위한 인과적 구조와 분리된 잠재 요인을 통해 시간에 따라 변화하는 동역학과 보상 구조를 모델링하는 FANS-RL이라는 요인 분해 적응 프레임워크를 제안한다. 함께 학습된 요인 분해 MDP와 시간에 따라 변화하는 변화 요인을 통해 FANS-RL은 다양한 비정상적 환경에서 보상, 표현의 압축성, 내성적 안정성 측면에서 뛰어난 성능을 달성하며, 연속 제어 및 로봇 조작 벤치마크에서 이전 방법들을 능가한다.

ABSTRACT

Dealing with non-stationarity in environments (e.g., in the transition dynamics) and objectives (e.g., in the reward functions) is a challenging problem that is crucial in real-world applications of reinforcement learning (RL). While most current approaches model the changes as a single shared embedding vector, we leverage insights from the recent causality literature to model non-stationarity in terms of individual latent change factors, and causal graphs across different environments. In particular, we propose Factored Adaptation for Non-Stationary RL (FANS-RL), a factored adaption approach that learns jointly both the causal structure in terms of a factored MDP, and a factored representation of the individual time-varying change factors. We prove that under standard assumptions, we can completely recover the causal graph representing the factored transition and reward function, as well as a partial structure between the individual change factors and the state components. Through our general framework, we can consider general non-stationary scenarios with different function types and changing frequency, including changes across episodes and within episodes. Experimental results demonstrate that FANS-RL outperforms existing approaches in terms of return, compactness of the latent state representation, and robustness to varying degrees of non-stationarity.

연구 동기 및 목표

  • 실제 강화학습 환경에서 동역학과 보상 함수가 시간에 따라 변화하는 비정상성 문제를 해결하기 위해.
  • 공유 임베딩이 아닌 분리된 시간 변화 잠재 요인으로 변화를 모델링함으로써 적응 효율성을 향상시키기 위해.
  • 기본 식별 가능성 가정 하에 전이 및 보상 함수의 인과적 구조 복원을 가능하게 하기 위해.
  • 내부 에피소드 및 에피소드 간 변화를 다양한 빈도로 처리할 수 있는 통합 프레임워크 개발을 위해.
  • 최첨단 방법들과 비교해 보상, 잠재 표현의 압축성, 내성적 안정성 측면에서 향상된 성능을 입증하기 위해.

제안 방법

  • 시간에 따라 변화하는 잠재 변화 요인을 마르코프 과정으로 모델링한 요인 분해 비정상 MDP(FN-MDP)를 정식화한다.
  • 상태 전이 및 보상의 인과 그래프를 식별하고, 변화 요인과 상태 구성 요소 간의 부분적 인과적 구조를 복원하는 인과적 구조 학습 프레임워크를 도입한다.
  • FN-MDP 학습과 정책 적응을 번갈아 수행하는 연합 모델 추정 및 정책 최적화 프레임워크인 FANS-RL을 제안한다.
  • LSTM을 사용한 시간 모델링과 변분 추론을 활용한 잠재 요인 추정을 위한 신경망 아키텍처인 FN-VAE를 활용한다.
  • 재구성, 예측, KL, 희소성, 스무딩 항목을 포함한 다중 구성 요소 손실 함수를 사용하며, 학습 안정성을 확보하기 위해 가중치를 적응적으로 조정한다.
  • AdaRL 프레임워크를 비정상적 환경에 적용하기 위해, 빠른 정책 적응을 위한 저차원의 시간에 따라 변화하는 변화 요인 표현을 학습한다.

실험 결과

연구 질문

  • RQ1기본 식별 가능성 가정 하에 비정상 MDP의 전이 및 보상 함수 인과적 구조를 식별할 수 있는가?
  • RQ2비정상 환경에서 개별 변화 요인과 상태 구성 요소 간의 부분적 인과적 구조를 복원할 수 있는가?
  • RQ3공유 임베딩 접근 방식과 비교해 분리된 잠재 변화 요인을 통해 비정상성을 모델링할 경우 정책 성능과 표현의 압축성이 향상되는가?
  • RQ4제안된 프레임워크는 내부 에피소드 및 에피소드 간 발생하는 이산적 및 연속적 변화를 모두 처리할 수 있는가?
  • RQ5다양한 수준의 비정상성(동역학 및 보상 함수 기반)에 대해 FANS-RL의 내성적 안정성은 어느 정도인가?

주요 결과

  • FANS-RL은 Half-Cheetah, Sawyer-Reaching, Sawyer-Peg, Minitaur 등 평가된 모든 벤치마크에서 최첨단 방법들보다 높은 누적 보상을 달성한다.
  • FANS-RL에서 학습된 잠재 상태 표현은 다른 방법들에 비해 더 압축되어 있으며, 차원 수가 40개로 감소하였다.
  • FANS-RL은 비정상성에 대해 뛰어난 내성적 안정성을 보이며, 높은 빈도 또는 복잡한 변화가 발생하는 상황에서도 높은 성능을 유지한다.
  • 기본 식별 가능성 가정 하에 전이 및 보상 함수의 인과적 구조를 성공적으로 복원하였으며, 변화 요인에 대한 부분적 구조 복원도 가능했다.
  • FN-VAE 아키텍처는 FN-MDP와 정책 적응의 효과적인 연합 학습을 가능하게 하여, 메타테스트 시나리오에서 TRIO 및 VariBAD를 능가하는 성능을 보였다.
  • 절단 실험 결과, 변화 요인의 분리된 모델링이 공유 임베딩 접근 방식에 비해 더 나은 일반화 성능과 더 빠른 적응을 이끌어내는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.