[논문 리뷰] Optimistic Linear Support and Successor Features as a Basis for Optimal Policy Transfer
이 논문은 성공자기능(SFs)과 낙관적 선형 지원(OLS)을 결합한 새로운 알고리즘인 SFOLS를 제안한다. 이 알고리즘은 SFs가 볼록 커버리지 집합(CCS)을 이룰 수 있도록 정책의 집합을 구성함으로써, 추가적인 환경 상호작용 없이도 선형으로 표현된 새로운 작업에 대해 일반화 정책 개선(GPI)을 통해 최적의 정책 전이를 가능하게 한다. 이 방법은 성공자기능 기반 전이 학습과 다목적 강화학습 간 이론적 동치성을 활용하여 모든 선형 보상 함수에 대해 최적의 성능을 보장한다.
In many real-world applications, reinforcement learning (RL) agents might have to solve multiple tasks, each one typically modeled via a reward function. If reward functions are expressed linearly, and the agent has previously learned a set of policies for different tasks, successor features (SFs) can be exploited to combine such policies and identify reasonable solutions for new problems. However, the identified solutions are not guaranteed to be optimal. We introduce a novel algorithm that addresses this limitation. It allows RL agents to combine existing policies and directly identify optimal policies for arbitrary new problems, without requiring any further interactions with the environment. We first show (under mild assumptions) that the transfer learning problem tackled by SFs is equivalent to the problem of learning to optimize multiple objectives in RL. We then introduce an SF-based extension of the Optimistic Linear Support algorithm to learn a set of policies whose SFs form a convex coverage set. We prove that policies in this set can be combined via generalized policy improvement to construct optimal behaviors for any new linearly-expressible tasks, without requiring any additional training samples. We empirically show that our method outperforms state-of-the-art competing algorithms both in discrete and continuous domains under value function approximation.
연구 동기 및 목표
- 기존의 성공자기능(SF)-기반 방법들이 정책 전이를 가능하게 하더라도 새로운 작업에 대해 최적의 정책을 보장하지 못하는 한계를 해결하기 위해.
- 선형 선호도 하에 SF 기반 전이 학습과 다목적 강화학습(MORL) 간 이론적 동치성을 확립하기 위해.
- 최적의 일반화를 갖는 모든 선형으로 표현된 작업에 대해 볼록 커버리지 집합(CCS)을 구성하는 OLS 알고리즘의 SF 기반 확장인 SFOLS를 개발하기 위해.
- CCS에서 유도된 정책들이 일반화 정책 개선(GPI)을 통해 추가적인 환경 상호작용 없이도 어떤 새로운 작업에 대해서도 최적의 행동을 도출할 수 있음을 증명하기 위해.
- 가치 함수 근사 하에서 이산 및 연속 영역에서 최첨단 방법들과의 실험적 검증을 수행하기 위해.
제안 방법
- 선형 선호도 하에 SF 기반 전이 학습 문제를 다목적 MDP(MOMDP)로 매핑함으로써, 두 프레임워크 간 이론적 동치성을 확립한다.
- SFOLS를 도입하며, 이는 OLS의 SF 기반 확장으로, 결과적으로 SFs가 볼록 커버리지 집합(CCS)을 이룰 수 있도록 작업을 반복적으로 선택한다.
- 알고리즘은 CCS의 정책들을 조합하기 위해 GPI를 사용하여, 어떤 새로운 선형 보상 함수에 대해서도 최적의 행동을 보장한다.
- 결과로 도출된 정책 집합이 모든 선형으로 표현된 작업에 대해 최적임을 증명하며, CCS가 완전하지 않을 경우 성능 격차에 대한 이론적 경계를 제공한다.
- 성공자기능을 사용해 상태 방문 패턴을 표현하고, 재학습 없이도 효율적인 정책 조합을 가능하게 한다.
- 비지도 스킬 디스커버리 열린 문제를 해결함을 보이며, 성공자기능 표현에 대해 CCS를 구성한다.
실험 결과
연구 질문
- RQ1성공자기능 기반 전이 학습 문제를 선형 선호도 하에 다목적 강화학습으로 공식적으로 매핑할 수 있는가?
- RQ2CCS를 구성하여 어떤 새로운 선형 보상 함수에 대해서도 최적성을 보장하는 SF 기반 OLS의 확장은 설계할 수 있는가?
- RQ3해당 CCS 위에서 일반화 정책 개선(GPI)을 수행할 경우, 추가적인 환경 상호작용 없이도 최적의 정책을 도출할 수 있는가를 증명할 수 있는가?
- RQ4가치 함수 근사 하에서 SFOLS는 이산 및 연속 제어 영역에서 최첨단 방법들을 초월할 수 있는가?
- RQ5Eysenbach 등(2022)이 정의한 비지도 설정에서 최적의 스킬 디스커버리 열린 문제를 SFOLS는 해결할 수 있는가?
주요 결과
- SFOLS는 성공자기능이 볼록 커버리지 집합(CCS)을 이룰 수 있도록 정책 집합을 구성함으로써, 추가적인 환경 상호작용 없이도 어떤 새로운 선형으로 표현된 작업에 대해서도 GPI를 통해 최적의 해결을 보장한다.
- 이론적 보장이 존재하며, 약간의 가정 하에 결과로 도출된 정책들이 모든 선형 보상 함수에 대해 최적임을 보장한다.
- 실험 결과, 가치 함수 근사 하에서 SFOLS는 이산 및 연속 제어 영역에서 최첨단 알고리즘들을 능가하는 성능을 보였다.
- CCS가 완전하지 않을 경우 GPI 해법과 최적 정책 간의 성능 격차가 경계되어 있음을 보이며, 이는 강건성의 척도를 제공한다.
- SFOLS는 성공자기능 표현에 대해 CCS를 구성함으로써, Eysenbach 등(2022)이 정의한 비지도 설정에서 최적의 스킬 디스커버리 열린 문제를 해결함을 입증하였다.
- 이 방법은 SF와 GPI를 사용하여 모든 선형으로 표현된 작업에 대해 최적의 정책 전이를 공식적으로 보장하는 최초의 방법이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.