[논문 리뷰] Language as an Abstraction for Hierarchical Deep Reinforcement Learning
이 논문은 언어를 상위-하위 정책 간의 추상화로 활용하는 HAL( Hierarchical Abstraction with Language ) 프레임워크를 제안한다. 이 프레임워크는 구성 가능한 지시를 따르는 저수준 정책과 언어 공간에서 작동하는 고수준 정책을 가능하게 하며, MuJoCo-CLEVR에서 영감을 받은 환경으로 검증하고 비구성적 추상화 및 베이스라인 대비 학습, 일반화, 확장성의 향상을 보여준다.
Solving complex, temporally-extended tasks is a long-standing problem in reinforcement learning (RL). We hypothesize that one critical element of solving such problems is the notion of compositionality. With the ability to learn concepts and sub-skills that can be composed to solve longer tasks, i.e. hierarchical RL, we can acquire temporally-extended behaviors. However, acquiring effective yet general abstractions for hierarchical RL is remarkably challenging. In this paper, we propose to use language as the abstraction, as it provides unique compositional structure, enabling fast learning and combinatorial generalization, while retaining tremendous flexibility, making it suitable for a variety of problems. Our approach learns an instruction-following low-level policy and a high-level policy that can reuse abstractions across tasks, in essence, permitting agents to reason using structured language. To study compositional task learning, we introduce an open-source object interaction environment built using the MuJoCo physics engine and the CLEVR engine. We find that, using our approach, agents can learn to solve to diverse, temporally-extended tasks such as object sorting and multi-object rearrangement, including from raw pixel observations. Our analysis reveals that the compositional nature of language is critical for learning diverse sub-skills and systematically generalizing to new sub-skills in comparison to non-compositional abstractions that use the same supervision.
연구 동기 및 목표
- 계층적 강화학습에서 구성 가능한 추상화로서 언어를 동기부여하고 활용하여 긴 시야의 기술 습득을 가능하게 한다.
- 고수준 정책이 저수준의 지시를 따르는 정책에 언어 지시를 내보내는 두-layer HAL 프레임워크를 개발한다.
- 구성 일반화를 연구하기 위해 MuJoCo 물리 엔진과 CLEVR에서 영감을 받은 언어를 결합한 객체 조작 작업용 오픈소스 환경을 만든다.
- 언어 기반 추상화가 비구성적 접근법 및 표준 HRL 벤치마크보다 더 나은 일반화와 효율성을 가능하게 함을 보여준다.
제안 방법
- 언어를 사용한 계층적 추상화 HAL(Hierarchical Abstraction with Language)을 도입한다. 이는 고수준 정책이 언어 지시 g를 출력하고 저수준 정책이 상태 s와 g에 조건화된 행동을 수행하는 두-layer HRL이다.
- 저수준의 언어 조건부 정책을 Psi(s, g) 지시-관계 함수와 hindsight instruction relabeling(HIR)이라는 재라벨링 전략의 감독으로 학습하여 보상을 촘촘히 만든다.
- 환경의 Omega(s) 분포에서 뽑힌 언어 목표와 궤적 구간을 연관지어 재라벨링을 수행함으로써 다양한 언어 목표에서 학습할 수 있게 한다.
- 고수준 정책을 G의 구조화된 부분집합 I에서 언어 지시 g를 선택하도록 학습시켜 문제를 지시 어휘에 대한 이산-액션 강화학습으로 사실상 바꾼다.
- 저수준 정책은 목표 조건으로 언어를 사용하여 학습하고, 고수준 정책은 긴 시야의 작업을 달성하기 위해 지시를 순차적으로 구성하는 이중 학습 체제를 활용한다.
- 비전 기반의 긴 시야 작업에서 HAL을 DDQN, HIRO, Option-Critic과 비교하고 이미지 기반 관찰로의 전이(전이 학습)를 시연한다.
실험 결과
연구 질문
- RQ1언어를 추상화로 사용하는 것이 HRL에서 비구성적 표현과 비교하여 지시 따름에 어떤 차이를 보이는가?
- RQ2고수준 정책이 언어 지시의 시퀀스를 효과적으로 구성하여 긴 시야의 작업을 해결할 수 있는가?
- RQ3언어의 구성 구조가 본 seen하지 않은 지시 및 설정에 대해 체계적으로 일반화하는가?
- RQ4HAL은 시각 기반 관찰과 더 다양한 작업군으로 확장되는가?
- RQ5긴 시야 조작 작업에서 HAL이 표준 HRL 벤치마크에 비해 성능을 보이는가?
주요 결과
- 언어 기반 추상화는 비구성적 표현 및 원-핫 지시 인코딩에 비해 학습 및 일반화 성능을 현저히 향상시키며, 특히 지시 집합이 확장될수록 그 차이가 커진다.
- hindsight instruction relabeling은 저수준 정책의 학습 신호를 크게 촘촘하게 만들고 지시 따름 학습에 결정적이다.
- HAL은 희소한 보상으로도 여러 고수준 작업을 해결하는 법을 학습하고 상태에서 픽셀 관찰로의 전이에서도 DDQN, HIRO, Option-Critic보다 우수한 성능과 낮은 분산을 보인다.
- 시각 기반 설정에서 HAL은 성능과 샘플 효율성을 유지하는 반면, 베이스라인은 학습에 실패하는 경우가 많다.
- 구성 가능한 언어는 체계적 일반화를 가능하게 하며, 언어는 일반화 격차가 작고 학습 중 보지 못한 지시에도 제로샷 일반화가 더 좋다(비구성적 벤치마크 대비).
- 환경과 코드(HAL 데모)는 오픈소스이며 CLEVR에서 영감을 받은 연속 제어 작업을 포함하여 구성 가능한 장기 시야 조작 연구를 위한 환경을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.