[논문 리뷰] Learning Action-Transferable Policy with Action Embedding
이 논문은 상태 공간과 행동 공간이 다른 작업 간의 정책 전이를 가능하게 하는 새로운 프레임워크인 TRACE를 제안한다. 이 프레임워크는 전이 모델을 통해 행동 임베딩을 학습함으로써, 다양한 상태 및 행동 공간 간의 정책 전이를 실현한다. 학습된 임베딩을 통한 행동 간 의미적 유사성과 정책 및 전이 모델의 전이를 통해, TRACE는 표본 효율성을 크게 향상시키며, 특히 도메인 간 전이 설정에서조차 기준 방법들을 능가한다.
Transfer learning (TL) is a promising way to improve the sample efficiency of reinforcement learning. However, how to efficiently transfer knowledge across tasks with different state-action spaces is investigated at an early stage. Most previous studies only addressed the inconsistency across different state spaces by learning a common feature space, without considering that similar actions in different action spaces of related tasks share similar semantics. In this paper, we propose a method to learning action embeddings by leveraging this idea, and a framework that learns both state embeddings and action embeddings to transfer policy across tasks with different state and action spaces. Our experimental results on various tasks show that the proposed method can not only learn informative action embeddings but accelerate policy learning.
연구 동기 및 목표
- 상태 공간과 행동 공간이 다른 작업 간의 정책 전이 문제를 해결하기 위해, 이전 지식 전이가 의미적 및 구조적 불일치로 인해 제한되는 상황을 다루는 것.
- 상태 전이에서의 영향을 바탕으로, 다양한 작업 간 행동 간 의미적 유사성을 포착하는 의미 있는 행동 임베딩을 학습하는 것.
- 공통된 상태 및 행동 임베딩을 사용하여 정책 및 전이 모델을 동시에 전이하는 통합 프레임워크를 설계하여, 대상 작업에서의 학습 속도를 가속화하는 것.
- 행동 임베딩을 통한 태스크 간 의미 지식을 활용하여 딥 강화학습의 표본 효율성을 향상시키는 것.
제안 방법
- 다음 상태를 현재 상태와 행동 임베딩에서 예측하는 전이 모델을 학습시켜 의미적으로 유의미한 행동 임베딩을 학습하는 데 기여한다.
- 행동 임베딩은 상태 전이를 재구성하도록 전이 모델을 학습시켜, 행동의 기능적 유사성을 포착함으로써 학습된다.
- 정책 네트워크는 행동 임베딩 공간에서 최근접 이웃 검색을 통해 행동을 선택함으로써, 다양한 행동 공간 간의 전이 가능성을 보장한다.
- 정책 모델과 전이 모델이 공유된 특성 학습을 통해 상태 임베딩을 정렬함으로써, 소스 작업에서 타겟 작업으로 전이된다.
- 공동 학습 절차를 통해 태스크 간 상태 및 행동 임베딩을 정렬하여, 서로 다른 태스크에서 유사한 행동들이 임베딩 공간에서 가까이 위치하도록 보장한다.
- 이 프레임워크는 '행동 임베딩을 통한 전이(Transfer with Action Embeddings)'로 명명되며, 의미적 행동 유사성을 활용하여 제로샷 정책 전이를 가능하게 한다.
실험 결과
연구 질문
- RQ1다른 행동 공간을 가진 태스크 간 행동 간 의미적 유사성을 포착할 수 있도록 행동 임베딩을 효과적으로 학습할 수 있는가?
- RQ2어떻게 행동 임베딩을 활용하여 딥 강화학습에서 정책 전이 효율성을 향상시킬 수 있는가?
- RQ3공유된 임베딩을 사용하여 정책 및 전이 모델을 동시에 전이하는 것이, 정책만 또는 임베딩만 전이하는 것보다 더 높은 표본 효율성을 달성하는가?
- RQ4제안된 방법은 상태 공간과 행동 공간이 다른 도메인 간 전이 설정에서 부정적 전이를 완화할 수 있는가?
주요 결과
- TRACE는 상업용 MMORPG에서 '침묵'과 '기절'과 같은 유사한 효과를 가진 행동들을 명확히 구분할 수 있는 정보가 풍부한 행동 임베딩을 학습한다.
- 상업 게임의 전투 태스크에서, TRACE-PT는 MIKT를 능가하며, 기준 전이(BT) 방법과 달리 부정적 전이를 피한다.
- 도메인 간 전이 설정에서, TRACE-PT는 BT를 크게 능가하며, 특히 상태 공간과 행동 공간이 다를 경우 복잡한 작업에서 BT가 부정적 전이에 시달리는 것을 방지한다.
- 절단 실험 결과, 정책 및 전이 모델을 동시에 전이하는 TRACE-PT가 가장 뛰어난 성능을 보이며, 행동 임베딩이 적응 시간을 줄이는 데 핵심적인 역할을 한다.
- 전이 모델은 정렬에 크게 기여하며, 일부 경우에서 전이 모델만 전이하는 TRACE-T도 TRACE-PT와 거의 유사한 성능을 보이므로, 행동 표현이 일반화에 매우 중요하다는 것을 시사한다.
- TRACE-P(정책만 전이)는 여전히 학습을 가속화하지만, 타겟 작업의 행동 임베딩 정렬이 어긋나기 때문에 TRACE-PT에 비해 성능이 뒤처진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.