Skip to main content
QUICK REVIEW

[논문 리뷰] Counterfactual Credit Assignment in Model-Free Reinforcement Learning

Thomas Mesnard, Théophane Weber|arXiv (Cornell University)|2020. 11. 18.
Reinforcement Learning in Robotics참고 문헌 39인용 수 8
한 줄 요약

이 논문은 모델에 의존하지 않는 강화학습 방법인 대체적 책임 할당(Counterfactual Credit Assignment, CCA)을 소개한다. 이 방법은 뒤에서 봤을 때의 정보를 사용하여 대체적 수익을 추정함으로써 정책 그래เดียน트 업데이트의 분산을 낮춘다. 이는 증명 가능하게 비편향이면서 분산이 감소된 정책 그래디언트 알고리즘의 가족을 체계화하며, 장기적인 시간 간격과 노이즈가 있는 역학을 가지는 도전적인 환경에서 검증되었다.

ABSTRACT

Credit assignment in reinforcement learning is the problem of measuring an action's influence on future rewards. In particular, this requires separating skill from luck, i.e. disentangling the effect of an action on rewards from that of external factors and subsequent actions. To achieve this, we adapt the notion of counterfactuals from causality theory to a model-free RL setup. The key idea is to condition value functions on future events, by learning to extract relevant information from a trajectory. We formulate a family of policy gradient algorithms that use these future-conditional value functions as baselines or critics, and show that they are provably low variance. To avoid the potential bias from conditioning on future information, we constrain the hindsight information to not contain information about the agent's actions. We demonstrate the efficacy and validity of our algorithm on a number of illustrative and challenging problems.

연구 동기 및 목표

  • 시간 기반의 거친 책임 할당으로 인해 고분산과 낮은 데이터 효율성을 보이는 고전적 모델에 의존하지 않는 강화학습의 문제를 해결한다.
  • 모델에 의존하지 않는 방법이 다른 행동이 취해졌다면 어떻게 되었을지를 평가하는 대체적 추론을 수행하는 데에 한계가 있다는 점을 극복한다.
  • 세부적인 책임 할당을 가능하게 하기 위해 세계 모델이 필요 없이 미래의 사건에 조건화된 가치 함수를 사용하는 방법을 개발한다.
  • 뒤에서 봤을 때의 정보를 에이전트의 행동 의존성에서 제외함으로써 비편향이면서 분산이 낮은 정책 그래디언트 추정을 보장한다.
  • 외부 노이즈, 장기적인 의존성, 작업의 겹침이 있는 환경에서 표준 강화학습이 실패하는 데서도 이 방법의 유효성을 입증한다.

제안 방법

  • 대체적 추론에서 유도된 미래 조건부 가치 함수를 베이스라인 또는 크로스로 사용하는 정책 그래디언트 추정자 가족을 제안한다.
  • 미래의 관측치와 결과에 조건화된 가치 함수를 사용하여 취하지 않은 행동의 대체적 수익을 추정하며, 에이전트 자신의 행동에 대한 정보는 제외한다.
  • 실제 결과와 대체적 결과의 차이를 계산하는 대체적 이점 추정자(CF-ITE)를 도입하여 저분산의 기준선을 제공한다.
  • 대체적 결과를 정의하기 위해 구조적 인과 모델(SCM)을 사용하여 이론적으로 비편향 추정을 보장한다.
  • 뒤에서 봤을 때의 정보를 사용한 대체적 추정에서 충분한 조건을 유도함으로써 분산을 낮추는 것을 보장한다.
  • 환경 모델 학습이 필요 없이 이러한 요소들을 통합한 학습 루프에 적용 가능한 실용적 알고리즘 CCA-PG를 구현한다.

실험 결과

연구 질문

  • RQ1세계 모델 학습 없이도 대체적 추론이 모델에 의존하지 않는 강화학습에 효과적으로 적용될 수 있는가?
  • RQ2궤적 데이터에서 어떻게 대체적 가치 함수를 구성하여 정책 그래디언트의 분산을 줄일 수 있는가?
  • RQ3대체적 책임 할당에서 편향을 피하기 위해 뒤에서 봤을 때의 정보에 어떤 제약 조건이 필요한가?
  • RQ4어떤 유형의 환경에서 대체적 책임 할당이 표준 모델에 의존하지 않는 강화학습보다 뚜렷이 우수한가?
  • RQ5구조적 인과 모델(SCM)의 선택이 정책 학습에서 대체적 이점 추정의 분산에 어떤 영향을 미치는가?

주요 결과

  • 제안된 CCA-PG 알고리즘은 장기적인 시간 간격 의존성이 있는 환경에서 표준 모델에 의존하지 않는 방법보다 정책 그래디언트 추정의 분산이 크게 낮아진다.
  • 의료 사례에서 모델 I는 대체적 이점 추정자의 분산을 1/6으로 산출하고, 모델 II는 1으로 산출하여 SCM의 구조 선택이 추정 효율성에 직접적인 영향을 미친다는 것을 보여준다.
  • 외부 노이즈가 있는 부분 관측 환경에서도 효과적인 책임 할당이 가능하며, 표준 방법이 높은 분산으로 인해 실패하는 상황에서 유의미한 성능을 보인다.
  • 실증 결과는 CCA-PG가 작업 겹침과 지연 보상을 포함한 도전적인 환경에서 베이스라인 방법보다 뛰어난 성능을 보임을 보여준다.
  • 이론적 분석은 제안된 조건화 제약 조건 하에서 대체적 이점 추정자가 비편향임을 확인하고, 표준 기준선보다 분산이 낮다는 것을 입증한다.
  • 이 프레임워크는 인과 이론과 강화학습을 효과적으로 연결하며, 세계 모델이 없는 모델에 의존하지 않는 강화학습 맥락에서 대체적 결과를 체계화함으로써 기술적 능력과 운의 분리에 체계적인 접근법을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.