[논문 리뷰] Learning from Trajectories via Subgoal Discovery
이 논문은 전문가 트레이젝터리에서 부분 목표를 발견하여 이산적이고 외부적인 보상 함수를 생성함으로써, 복잡하고 보상이 희박한 작업에서 효율적인 학습을 가능하게 하는 방법을 제안한다. 암시적 학습과 강화 학습을 결합하고, 한 종류의 분류 기반 부분 목표 조절기(모듈)를 사용함으로써, 이 방법은 전문가 트레이젝터리가 부적절할 경우조차도 MuJoCo 작업에서 최신의 RL, IL 및 하이브리드 방법보다 뛰어난 성능을 보인다.
Learning to solve complex goal-oriented tasks with sparse terminal-only rewards often requires an enormous number of samples. In such cases, using a set of expert trajectories could help to learn faster. However, Imitation Learning (IL) via supervised pre-training with these trajectories may not perform as well and generally requires additional finetuning with expert-in-the-loop. In this paper, we propose an approach which uses the expert trajectories and learns to decompose the complex main task into smaller sub-goals. We learn a function which partitions the state-space into sub-goals, which can then be used to design an extrinsic reward function. We follow a strategy where the agent first learns from the trajectories using IL and then switches to Reinforcement Learning (RL) using the identified sub-goals, to alleviate the errors in the IL step. To deal with states which are under-represented by the trajectory set, we also learn a function to modulate the sub-goal predictions. We show that our method is able to solve complex goal-oriented tasks, which other RL, IL or their combinations in literature are not able to solve.
연구 동기 및 목표
- 희박한 종료 보상만 존재하는 복잡한 목표 지향 작업을 학습하는 데 있어, 환경과의 상호작용 횟수가 과도하게 많은 문제를 해결하기 위해.
- 전문가 트레이젝터리를 정책 사전 훈련뿐만 아니라 부분 목표 발견을 통해 보상 함수를 형상화하는 데 활용함으로써 암시적 학습을 향상시키기 위해.
- 전문가의 품질과 커버리지에 대한 의존도를 줄이기 위해, 한 종류의 분류 기반으로 부분 목표 예측기를 학습함으로써 부족한 상태에 일반화할 수 있도록 하기 위해.
- 연속적이고 오류가 발생할 수 있는 가치 함수를 이산적이고 구조화된 부분 목표 보상으로 변환함으로써, 더 빠르고 신뢰할 수 있는 강화 학습을 가능하게 하기 위해.
제안 방법
- 먼저 전문가 트레이젝터리에 기반한 지도 학습을 통해 암시적 학습을 통해 정책을 초기화한다.
- 전문가 트레이젝터리의 시간적 순서를 기반으로 상태 공간을 분할하여 부분 목표를 발견한다. 이 과정에서 학습된 함수 $ u_{\psi} $ 를 사용해 도착 지점(웨이포인트)을 식별한다.
- 이러한 부분 목표를 사용하여 이산적이고 외부적인 보상 함수를 구성함으로써, RL 최적화 과정에서 구조화되고 희박하지 않은 보상 신호를 제공한다.
- 전문가 트레이젝터리에 포함되지 않은 이방(Out-of-distribution) 상태를 처리하기 위해, 한 종류의 분류 모듈이 부분 목표 예측을 조절함으로써 일반화 능력을 향상시킨다.
- 암시적 학습에서 강화 학습으로의 전이 과정을 거치며, 부분 목표 기반 보상 함수를 사용하여 초반 암시적 학습 단계에서 발생하는 오류를 완화한다.
- 보상 함수는 식 (5)에 수식화되어 있으며, $ u_{\psi} $ 를 사용함으로써 보상이 희박한 환경에서 학습의 안정성과 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1전문가 트레이젝터리에서 부분 목표를 발견함으로써, 복잡하고 보상이 희박한 작업에서 샘플 효율성과 성능 향상이 가능할까?
- RQ2연속적 가치 기반 보상 형상화와 비교했을 때, 부분 목표 기반 이산적 보상 형상화는 학습 안정성과 수렴성 측면에서 어떻게 다른가?
- RQ3이 방법은 전문가 트레이젝터리에 포함되지 않은 상태로 일반화할 수 있을까? 그리고 한 종류의 분류 모듈이 강인성을 어떻게 향상시키는가?
- RQ4이 방법은 보상이 희박한 도전적인 MuJoCo 작업에서 최신의 RL, IL 및 하이브리드 접근 방식을 초월할 수 있는가?
주요 결과
- 이 방법은 최신 기술 기반의 RL, IL 및 하이브리드 방법이 일관되게 학습에 실패하는 세 가지 복잡한 MuJoCo 작업—BiMGame, AntTarget, AntMaze—를 성공적으로 해결한다.
- 부분 목표 조절기 $ u_{\psi} $ 를 사용함으로써, 특히 전문가 커버리지가 희박한 경우 발생하는 국소 최적값을 피하는 데서 BiMaze와 BiMGame에서 뛰어난 성능을 달성한다.
- 부적절한 전문가 트레이젝터리가 사용되더라도, 이 방법은 전문가 자신들보다도 뛰어난 성능을 보이며 전문가의 품질에 대한 강인성을 입증한다.
- 부분 목표 발견 메커니즘은 봉착 지점(예: BiMGame에서의 봉착 영역)을 효과적으로 식별하고, 경로를 균일하게 분할함으로써 AntTarget 및 AntMaze에서와 같이 다양한 작업 구조에 적응 가능함을 보여준다.
- 연속적 가치 기반 보상과 비교했을 때, 이산적 부분 목표 보상의 사용은 전문가 트레이젝터리가 제한적이거나 장기적인 목표를 포함할 경우에 특히 학습 성능 향상에 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.