[논문 리뷰] Autotelic Agents with Intrinsically Motivated Goal-Conditioned Reinforcement Learning: a Short Survey
이 논문은 목표 조건부 강화학습(Reinforcement Learning, RL)을 사용하여 자기주도적 목표 생성과 학습을 가능하게 하는 자동자기유도 에이전트(autotelic agents)—즉, 내재된 동기 부여를 통해 스스로 목표를 생성하고 학습하는 인공에이전트—를 위한 프레임워크를 제안한다. 목표를 압축된 표현과 목표 달성 함수의 쌍으로 모델링함으로써, 이 접근법은 에이전트가 자율적으로 탐색하고 목표를 조합하며 스킬을 일반화할 수 있도록 하여 인공지능 분야에서 개방형, 평생 지속되는 학습을 발전시킨다.
Building autonomous machines that can explore open-ended environments, discover possible interactions and build repertoires of skills is a general objective of artificial intelligence. Developmental approaches argue that this can only be achieved by $autotelic$ $agents$: intrinsically motivated learning agents that can learn to represent, generate, select and solve their own problems. In recent years, the convergence of developmental approaches with deep reinforcement learning (RL) methods has been leading to the emergence of a new field: $developmental$ $reinforcement$ $learning$. Developmental RL is concerned with the use of deep RL algorithms to tackle a developmental problem -- the $intrinsically$ $motivated$ $acquisition$ $of$ $open$-$ended$ $repertoires$ $of$ $skills$. The self-generation of goals requires the learning of compact goal encodings as well as their associated goal-achievement functions. This raises new challenges compared to standard RL algorithms originally designed to tackle pre-defined sets of goals using external reward signals. The present paper introduces developmental RL and proposes a computational framework based on goal-conditioned RL to tackle the intrinsically motivated skills acquisition problem. It proceeds to present a typology of the various goal representations used in the literature, before reviewing existing methods to learn to represent and prioritize goals in autonomous systems. We finally close the paper by discussing some open challenges in the quest of intrinsically motivated skills acquisition.
연구 동기 및 목표
- 개방형 환경에서 인공에이전트가 스스로 목표를 생성하고 표현하며 추구할 수 있도록 하는 도전 과제를 해결하기 위해.
- 내재된 동기 부여를 목표 조건부 강화학습과 융합함으로써 발달 로봇공학과 딥 강화학습을 연결하기 위해.
- 수명 기간 동안의 스킬 습득을 지원하는 자가 생성, 다양한, 조합 가능한 목표를 위한 계산 프레임워크를 개발하기 위해.
- 자율적 에이전트의 목표 표현, 목표 우선순위 정하기, 스킬 일반화와 관련된 핵심 과제를 특정하고 해결하기 위해.
- 사회문화적 환경이 인간과 사회에 의미 있는 목표 표현을 어떻게 형성할 수 있는지 탐색하기 위해.
제안 방법
- 목표를 압축된 목표 표현과 관련된 목표 달성 함수의 쌍으로 일반적인 정의를 제안한다.
- 기존 문헌에서의 목표 표현을 분류하며, 상태 기반, 이미지 기반, 언어 기반, 누적량 기반 목표를 포함한다.
- 목표 표현을 학습하기 위한 방법을 검토하며, 목표 조건부 강화학습 기반으로는 역강화학습, 목표 임베딩 네트워크, 생성 모델을 포함한다.
- 외부 보상이 없는 상황에서 목표 선택과 탐색을 이끄는 데 내재된 동기 부여(예: 예측 오차, 호기심)의 사용을 제안한다.
- 계층적이고 옵션 기반 강화학습을 적용하여 다양한 목표 간의 스킬 조합과 이행을 가능하게 한다.
- 에이전트가 누적량의 선형 조합이나 이산적 목표 요소를 통해 목표를 조합할 수 있도록 하여 새로운 과제에 대한 일반화를 가능하게 한다고 제안한다.
실험 결과
연구 질문
- RQ1인공에이전트는 외부 감독 없이 스스로 목표를 자율적으로 생성하고 표현할 수 있는가?
- RQ2어떤 종류의 목표 표현이 개방형 환경에서 효과적인 탐색과 일반화를 가능하게 하는가?
- RQ3외부 보상이 없는 상황에서 목표 선택과 학습을 이끄는 데 내재된 동기 부여를 어떻게 수학적으로 정의할 수 있는가?
- RQ4에이전트는 기존의 스킬이나 목표를 어떻게 조합하여 새로운 복잡한 행동을 형성할 수 있는가?
- RQ5사회문화적 환경은 인간의 가치와 사회적 관련성과 일치하는 목표 표현을 어떻게 형성할 수 있는가?
주요 결과
- 목표 조건부 강화학습는 원래 이 목적을 위해 설계되지 않은 모델들에서도 내재된 동기 부여와 자율적 학습의 핵심 메커니즘으로 재해석될 수 있다.
- 내재된 동기 부여와 목표 조건부 강화학습의 융합은 다양한 비트레이드오프가 아닌 행동을 탐색하고 개방형 스킬 레퍼토리 구축을 가능하게 한다.
- 언어 기반 및 이산적 목표 표현은 조합 가능한 일반화를 가능하게 하여 에이전트가 알려진 목표를 조합해 새로운 복잡한 지시를 생성할 수 있도록 한다.
- 옵션 프레임워크를 통한 누적량 기반 목표 표현은 알려진 행동의 선형 조합으로 일반화를 가능하게 하여 민첩한 스킬 이행을 가능하게 한다.
- 진전이 있었음에도 불구하고, 동시적 스킬 조합과 장기적 목표 달성은 현재의 프레임워크에서 여전히 탐색이 부족한 과제이다.
- 사회문화적 환경은 목표 표현을 인간이 의미 있는 개념에 기반하게 하는 데 핵심적이며, 사회적으로 일치하는 인공지능으로 나아가는 길을 제시한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.