Skip to main content
QUICK REVIEW

[논문 리뷰] Lifelong Inverse Reinforcement Learning

Jorge A. Mendez, Shashank Shivkumar|arXiv (Cornell University)|2022. 07. 01.
Reinforcement Learning in Robotics참고 문헌 27인용 수 7
한 줄 요약

이 논문은 지속적인 지식 공유를 통해 지침 수요를 줄이기 위해 다수의 시연 작업 간 지식을 이전할 수 있도록 하는 수명 주기 역강화 학습(LIRL) 프레임워크를 소개한다. 공유 잠재 보상 표현을 통해 최대 엔트로피 IRL을 확장함으로써 제안된 ELIRL 알고리즘은 지속적인 개선을 통해 새로운 작업과 이전에 학습된 작업 양쪽에서 성능을 향상시키며, 계산 비용을 최소화하면서도 단일 작업 IRL에 비해 뚜렷한 성능 향상을 달성한다.

ABSTRACT

Methods for learning from demonstration (LfD) have shown success in acquiring behavior policies by imitating a user. However, even for a single task, LfD may require numerous demonstrations. For versatile agents that must learn many tasks via demonstration, this process would substantially burden the user if each task were learned in isolation. To address this challenge, we introduce the novel problem of lifelong learning from demonstration, which allows the agent to continually build upon knowledge learned from previously demonstrated tasks to accelerate the learning of new tasks, reducing the amount of demonstrations required. As one solution to this problem, we propose the first lifelong learning approach to inverse reinforcement learning, which learns consecutive tasks via demonstration, continually transferring knowledge between tasks to improve performance.

연구 동기 및 목표

  • 모의 학습을 통한 다수 작업 학습 시 사용자 부담을 줄이기 위해 작업 간 지속적인 지식 이전을 가능하게 하기 위해.
  • 역강화 학습에서 시연를 통한 수명 주기 학습을 온라인 다중 작업 학습 문제로 체계화하기 위해.
  • 기존 IRL 방법을 감싸 기술하는 일반적인 프레임워크를 개발하기 위해.
  • 공유 보상 표현을 통해 과거 작업에서의 성능 향상(역전이)이 달성될 수 있는지 평가하기 위해.
  • 프레임워크를 도메인 간 및 연속 상태-행동 공간으로 확장하기 위해.

제안 방법

  • 공유 잠재 성분을 보상 함수 간에 모델링하기 위해 저랭크 행렬 분해를 사용하며, 이를 행렬 L로 표현한다.
  • 각 작업의 보상 함수는 공유 잠재 요소의 선형 조합으로 모델링되며, 작업별 고유의 가중치 s^(t)로 매개변수화된다.
  • 알고리즘은 온라인 학습을 수행하며, 새로운 작업이 도착할 때마다 공유 잠재 요소 L과 작업별 고유 가중치 s^(t)를 갱신한다.
  • 기본 학습기로 최대 엔트로피 IRL을 사용하며, L과 s^(t)를 동시 최적화하여 생애 주기 설정에 적합하게 조정한다.
  • 시간이 지남에 따라 L을 개선함으로써 역전이를 지원하며, 이는 이전에 학습된 작업의 모델링 향상으로 자동으로 이어진다.
  • 확장 기능으로는 도메인 적응형 특징 정렬을 통한 도메인 간 전이 및 라디얼 기저 함수 표현을 통한 연속 상태-행동 공간 적용.

실험 결과

연구 질문

  • RQ1기존에 학습된 작업의 지식이 역강화 학습에서 새로운 작업 학습을 가속화하는 데 효과적으로 전이될 수 있는가?
  • RQ2공유 잠재 보상 성분을 지속적으로 개선함으로써 이전에 학습된 작업에서의 성능 향상(역전이)이 달성되는가?
  • RQ3표본 효율성과 계산 비용 측면에서 생애 주기 IRL은 단일 작업 IRL에 비해 어떻게 비교되는가?
  • RQ4다른 특징 공간 또는 연속 상태-행동 공간을 가진 작업 간에 프레임워크가 일반화될 수 있는가?
  • RQ5각 작업 이후에 s^(t)를 재최적화함으로써 다양한 작업에서 성능과 안정성이 얼마나 향상되는가?

주요 결과

  • ELIRL은 단일 작업 MaxEnt IRL보다 뚜렷이 뛰어나며, 가우스 프로세스 기반 IRL보다 훨씬 낮은 계산 비용으로 동일하거나 더 높은 성능을 달성한다.
  • 알고리즘이 역전이를 보여주며, 더 많은 작업을 학습할수록 이전 작업의 성능이 향상되며, 모든 작업을 학습한 후 평균 성능 향상이 관찰된다.
  • CD-ELIRL를 통한 도메인 간 전이에서는 도메인 내 ELIRL 대비 보상 차이를 최대 30% 감소시켜, 다양한 특징 공간 간 효과성을 입증한다.
  • 연속 평면 내비게이션 작업에서는 ELIRL이 단일 작업 AME-IRL를 능가하며, 관측된 작업 수가 증가할수록 성능 향상이 커진다.
  • 각 작업 이후에 s^(t)를 재최적화함으로써 역전이가 향상되고 성능이 안정화되며, 특히 서로 다른 격자 크기를 가진 도메인 간 전이 시에 두드러진 효과가 있다.
  • 공유 잠재 행렬 L은 의미 있는 작업 구조를 포착하며, Objectworld 환경에서 학습된 성분들은 특정 색상 주변의 공간 영역과 대응된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.