Skip to main content
QUICK REVIEW

[논문 리뷰] You Can't Count on Luck: Why Decision Transformers and RvS Fail in Stochastic Environments

Keiran Paster, Sheila A. McIlraith|arXiv (Cornell University)|2022. 05. 31.
Reinforcement Learning in Robotics인용 수 8
한 줄 요약

이 논문은 결정 트랜스포머와 RvS(RL via Supervised Learning)가 확률적 환경에서 최적의 행동이 아닌 운에 의해 높은 보상이 달성되는 비판적 실패 모드를 규명한다. 저자들은 적대적 학습을 통해 환경의 확률성과 무관한 표현—특히 클러스터 평균 보상—에 조건을 두는 ESPER를 제안하며, 목표 보상과 실제 보상 간의 일치도를 향상시켜 확률적 오프라인 RL 벤치마크에서 최신 기준 성능을 달성한다.

ABSTRACT

Recently, methods such as Decision Transformer that reduce reinforcement learning to a prediction task and solve it via supervised learning (RvS) have become popular due to their simplicity, robustness to hyperparameters, and strong overall performance on offline RL tasks. However, simply conditioning a probabilistic model on a desired return and taking the predicted action can fail dramatically in stochastic environments since trajectories that result in a return may have only achieved that return due to luck. In this work, we describe the limitations of RvS approaches in stochastic environments and propose a solution. Rather than simply conditioning on the return of a single trajectory as is standard practice, our proposed method, ESPER, learns to cluster trajectories and conditions on average cluster returns, which are independent from environment stochasticity. Doing so allows ESPER to achieve strong alignment between target return and expected performance in real environments. We demonstrate this in several challenging stochastic offline-RL tasks including the challenging puzzle game 2048, and Connect Four playing against a stochastic opponent. In all tested domains, ESPER achieves significantly better alignment between the target return and achieved return than simply conditioning on returns. ESPER also achieves higher maximum performance than even the value-based baselines.

연구 동기 및 목표

  • 결정 트랜스포머와 같은 RvS 스타일 에이전트가 결정론적 환경에서는 뛰어난 성능을 보이지만, 확률적 환경에서는 왜 실패하는지 규명하는 것.
  • 궤적 보상에 조건을 두는 것이 확률적 동역학에서 최적의 행동과 운을 혼동한다는 핵심 문제를 해결하는 것.
  • 환경의 확률성과 무관한 보상 추정치에 조건을 두어 신뢰할 수 있는 정책 학습을 보장하는 방법을 개발하는 것.
  • 기존의 표준 RvS가 실패하는 새로운 도전적인 확률적 오프라인 RL 벤치마크에서 접근 방식을 검증하는 것.
  • ESPER가 RvS 에이전트와 CQL과 같은 강력한 가치 기반 기준 모델보다도 확률적 환경에서 뛰어난 성능을 보이는지 입증하는 것.

제안 방법

  • ESPER는 궤적의 통계를 행동에 의존하는 요소와 환경에 기인한 확률성과 분리하기 위해 적대적 학습을 사용하여 궤적 표현을 학습한다.
  • 행동 시퀀스 기반으로 궤적을 클러스터링하고, 각 클러스터의 평균 보상을 계산하여 개별 궤적 보상 대신 조건 신호로 사용한다.
  • 학습된 궤적 표현이 환경의 확률성에 영향을 받지 않도록 보장하기 위해 적대적 손실을 활용한다.
  • 모델은 상태와 클러스터 평균 보상에 조건을 두어 행동을 예측하도록 훈련되어, 확률적 환경에서의 견고한 의사결정을 가능하게 한다.
  • 모델은 엔드 투 엔드로 미분 가능하고 확장 가능하며, 명시적 인과 추론이 필요 없이 딥 러닝 아키텍처를 활용한다.
  • 역학 모델을 활용하여 적대적 클러스터링을 지원함으로써, 표현이 에이전트가 제어하는 행동 패턴을 반영하도록 보장한다.

실험 결과

연구 질문

  • RQ1결정 트랜스포머와 RvS 에이전트가 결정론적 벤치마크에서는 뛰어난 성능을 보이지만, 왜 확률적 환경에서는 실패하는가?
  • RQ2환경의 확률성과 무관한 RvS의 조건 신호를 식별할 수 있는가? 이는 정책 학습에 더 신뢰할 수 있는가?
  • RQ3행동 시퀀스에서 추정한 클러스터 평균 보상에 조건을 두면, 확률적 환경에서 목표 보상과 실제 기대 보상 간의 일치도가 향상되는가?
  • RQ4확률성에 영향을 받지 않는 표현에 조건을 두는 모델이 도전적인 확률적 오프라인 RL 과제에서 표준 RvS와 가치 기반 방법보다 뛰어난 성능을 보일 수 있는가?
  • RQ5제안된 방법이 부분 관측 가능하고 고분산 도메인을 포함한 다양한 확률적 환경에서 견고한가?

주요 결과

  • ESPER는 확률적 환경에서 목표 보상과 기대 성능 간의 일치도가 보상에 조건을 두는 RvS 에이전트보다 유의미하게 뛰어나다.
  • 2048 퍼즐 게임과 확률적 상대방 상대에서 Connect Four를 플레이할 때, ESPER는 CQL과 같은 강력한 가치 기반 기준 모델조차도 앞서는 근최대 성능을 달성한다.
  • 카지노 환경에서는 RvS 에이전트가 운에 의해 열등한 행동을 선호하여 치명적인 실패를 겪지만, ESPER는 확실한 양의 보상을 보장하는 최적의 행동(a2)을 정확히 식별한다.
  • ESPER의 적대적 클러스터링은 환경의 확률성과 무관한 표현을 성공적으로 학습하여, 신뢰할 수 있는 정책 일반화를 가능하게 한다.
  • 무한한 데이터가 있더라도, 보상에 조건을 두는 RvS 모델은 확률적 설정에서 실패한다. 이는 데이터 스케일만으로는 근본적인 문제를 해결할 수 없음을 증명한다.
  • ESPER는 환경의 확률성과 무관한 결과—예를 들어 행동 클러스터당 평균 보상—에 조건을 두는 것이 실제 확률적 작업에서 견고하고 최적의 의사결정을 가능하게 한다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.