Skip to main content
QUICK REVIEW

[논문 리뷰] Transfer with Model Features in Reinforcement Learning

Lucas Lehnert, Michael L. Littman|arXiv (Cornell University)|2018. 07. 04.
Reinforcement Learning in Robotics참고 문헌 11인용 수 4
한 줄 요약

이 논문은 전이 및 보상 함수가 다른 작업 간에 효율적인 전이를 가능하게 하기 위해 행동적으로 동일한 상태를 군집화하는 표현인 Model Features를 소개한다. 새로운 최적화 목표를 제안하고 모델 축소로의 수렴을 증명함으로써, 동적 특성이 다를 경우에도 정확한 가치 함수 근사와 전이 성능을 달성할 수 있다.

ABSTRACT

A key question in Reinforcement Learning is which representation an agent can learn to efficiently reuse knowledge between different tasks. Recently the Successor Representation was shown to have empirical benefits for transferring knowledge between tasks with shared transition dynamics. This paper presents Model Features: a feature representation that clusters behaviourally equivalent states and that is equivalent to a Model-Reduction. Further, we present a Successor Feature model which shows that learning Successor Features is equivalent to learning a Model-Reduction. A novel optimization objective is developed and we provide bounds showing that minimizing this objective results in an increasingly improved approximation of a Model-Reduction. Further, we provide transfer experiments on randomly generated MDPs which vary in their transition and reward functions but approximately preserve behavioural equivalence between states. These results demonstrate that Model Features are suitable for transfer between tasks with varying transition and reward functions.

연구 동기 및 목표

  • 전이 동적 특성과 보상 함수가 다른 강화학습 작업 간에 지식을 효율적으로 전이하는 데 도전하는 것.
  • 행동적으로 동일한 상태를 군집화하는 특징 표현을 개발하여 보상 예측에 필수적인 동적 특성을 유지하는 것.
  • 수렴이 모델 축소로 이르는 최적화 목표를 체계화하여 예측 능력 손실를 최소화하는 것.
  • 오직 보상 함수만 변화하는 경우에도 Model Features가 효과적인 전이를 가능하게 함으로써, 이전 방법이 공유된 동적 특성에 의존하는 데서 벗어나는 것.
  • 제안된 목표를 최소화할 경우 모델 축소의 점차 정확한 근사가 이루어짐을 보여주는 이론적 경계를 제공하는 것.

제안 방법

  • 행동적으로 동일한 상태에 동일한 벡터를 할당함으로써 모델 축소를 수행하는 특징 표현으로 Model Features를 제안한다.
  • 기존의 전이 동적 특성과 압축된 전이 동적 특성 간의 차이를 최소화하는 데 목적이 있는 새로운 최적화 목표를 도입한다.
  • 최소화된 목표가 모델 축소의 보다 정확한 근사로 이어짐을 보여주는 이론적 경계를 유도한다. 오차는 목표가 최소화될수록 감소한다.
  • 딥 네ural 네트워크를 사용한 엔드 투 엔드 학습이 가능한, Successor Features 아키텍처를 변형하여 Model Features를 학습한다.
  • Successor Feature 프레임워크를 활용하여 Model Features 학습이 모델 축소된 MDP를 학습하는 것과 동일한 것임을 보여준다.
  • 행렬 노름과 스펙트럼 경계를 사용하여 근사 오차를 분석하고, 가치 함수 오차가 보상 및 전이 근사 오차에 의해 제한됨을 증명한다.

실험 결과

연구 질문

  • RQ1행동적으로 동일한 상태를 군집화하고 전이 및 보상 함수가 다른 작업 간에 전이를 가능하게 하는 특징 표현을 학습할 수 있는가?
  • RQ2제안된 최적화 목표를 최소화할 경우 MDP에서 모델 축소의 보다 정확한 근사가 이루어지는가?
  • RQ3다른 동적 특성을 가진 전이 학습 시나리오에서 Model Features의 성능은 기존 방법인 Successor Features와 비교해 어떻게 되는가?
  • RQ4모델 축소 하에서 Model Features가 가치 함수의 예측 정확도를 어느 정도 유지할 수 있는가?
  • RQ5최적화 목표를 최소화함에 따라 학습된 특징이 유효한 모델 축소로 수렴한다는 이론적 보장이 있는가?

주요 결과

  • Model Features는 행동적으로 동일한 상태를 성공적으로 군집화한다. 30×3 격자 세계에서 열이 하나의 상태로 압축되더라도 예측 능력 손실 없이 성능 유지됨을 입증하였다.
  • 제안된 최적화 목표는 이를 최소화할수록 점차 정확한 모델 축소 근사로 수렴함을 보장하며, 오차 전파에 대한 이론적 경계가 존재한다.
  • 값 함수 근사 오차가 유계임을 입증하였으며, 이 오차 상한은 보상 및 전이 근사 오차가 감소할수록 감소한다.
  • 무작위로 생성된 MDP에서의 전이 실험 결과, 전이 함수가 작업 간에 다를 경우에도 Model Features가 효과적인 지식 전이를 가능하게 함을 보였다.
  • 이론적 분석을 통해 가치 함수 근사 오차가 할인 인자에 의해 스케일링된 보상 근사 오차와 전이 근사 오차에 의해 제한됨을 증명하였다.
  • 동적 특성이 다를 경우 기존의 표준 Successor Features보다 Model Features가 더 우수한 성능을 보이며, 이는 공유된 전이 함수에 제한되지 않기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.