Skip to main content
QUICK REVIEW

[논문 리뷰] A Definition of Open-Ended Learning Problems for Goal-Conditioned Agents

Olivier Sigaud, Gianluca Baldassarre|arXiv (Cornell University)|2023. 11. 01.
Reinforcement Learning in Robotics참고 문헌 58인용 수 4
한 줄 요약

이 논문은 관찰자 시점에서의 지속적인 무한 수평선적 신규 목표, 옵션 또는 보상 함수 생성이라는 핵심 성질을 분리함으로써 목표 조건부 에이전트를 위한 개방형 학습(OEL)의 형식적 정의를 제안한다. 개방형 목표 조건부 강화학습(GCRL) 문제를 도입하고, 시간이 지남에 따라 새로운 목표를 발견하고 마스터하는 데의 능력을 기반으로 에이전트를 평가할 수 있는 프레임워크를 구축함으로써, OEL을 연속적 또는 종신적 학습과 같은 유사 개념들과 구별한다.

ABSTRACT

A lot of recent machine learning research papers have ``open-ended learning'' in their title. But very few of them attempt to define what they mean when using the term. Even worse, when looking more closely there seems to be no consensus on what distinguishes open-ended learning from related concepts such as continual learning, lifelong learning or autotelic learning. In this paper, we contribute to fixing this situation. After illustrating the genealogy of the concept and more recent perspectives about what it truly means, we outline that open-ended learning is generally conceived as a composite notion encompassing a set of diverse properties. In contrast with previous approaches, we propose to isolate a key elementary property of open-ended processes, which is to produce elements from time to time (e.g., observations, options, reward functions, and goals), over an infinite horizon, that are considered novel from an observer's perspective. From there, we build the notion of open-ended learning problems and focus in particular on the subset of open-ended goal-conditioned reinforcement learning problems in which agents can learn a growing repertoire of goal-driven skills. Finally, we highlight the work that remains to be performed to fill the gap between our elementary definition and the more involved notions of open-ended learning that developmental AI researchers may have in mind.

연구 동기 및 목표

  • 기계학습 분야에서 개방형 학습(OEL)에 대한 논의가 증가하고 있음에도 불구하고 아직 공감대가 형성되지 않았고, 형식적 정의가 부족한 문제를 해결하기 위해.
  • OEL의 핵심적이고 기본적인 성질을 분리하기 위해: 관찰자 시점에서 무한 시간 수평선 동안 새로운 요소(예: 목표, 옵션)를 생성하는 것.
  • 목표 조건부 강화학습(GCRL)의 맥락에서만 개방형 학습 문제를 정의하기 위해.
  • 연속적 학습, 종신적 학습, 자동목적성 학습과 같은 유사 개념들과 원칙적인 프레임워크를 통해 OEL을 구분하기 위해.
  • 스킬 습득의 발달적 궤적을 캡처하기 위한 열린 연구 방향을 특정하기 위해, 예를 들어 표현 재기술표현 및 추상화를 포함한다.

제안 방법

  • 논문은 OEL을 핵심 성질을 통해 정의한다: 에이전트는 무한 시간 수평선 동안 새로운 요소(예: 목표, 옵션, 보상 함수)를 생성하며, 이 신선함은 외부 관찰자의 시점에서 평가된다.
  • 에이전트가 두 단계에서 학습하는 개방형 GCRL 문제를 도입한다: 외부 지시 없이 진행되는 내재적 단계와 환경의 작업 공간에서 무작위로 선택된 작업이 주어지는 외재적 단계.
  • 외재적 단계에서의 성능은 내재적 단계 동안의 지식 획득 능력의 대체 측정 기준으로 사용되며, 이는 새로운 작업에 대한 일반화 능력을 측정한다.
  • 논문은 시간이 지남에 따라 새로운 목표 발견 속도를 추적함으로써 OEL 에이전트를 평가할 것을 제안한다. 점 渐진 수렴이 관찰되면 비-OEL 행동으로 간주된다.
  • 다양한 내재적 교육 곡선을 가진 에이전트 간의 공정한 비교를 위해 외재적 단계에서 공통된 작업 세트를 사용할 것을 제안함으로써, OEL 에이전트 간의 성능 기반 비교를 가능하게 한다.
  • 프레임워크는 인간의 발달적 학습을 반영하기 위해 핵심 신선함 성질 외에도 스킬 추상화, 표현 재기술표현, 창의성 등의 추가 능력이 통합되어야 한다는 필요성을 강조한다.

실험 결과

연구 질문

  • RQ1자율 에이전트에서 개방형 학습을 정의하는 데 핵심이 되는 기본적이고 기본적인 성질은 무엇인가?
  • RQ2목표 조건부 강화학습 내에서 개방형 학습 문제를 어떻게 형식적으로 정의할 수 있는가?
  • RQ3개방형 학습은 연속적 학습, 종신적 학습, 자동목적성 학습과 어떻게 다를 수 있는가?
  • RQ4다른 내재적 교육 곡선을 따르는 OEL 에이전트의 성능을 공정하게 평가하는 방법은 무엇인가?
  • RQ5신선함 생성 이외에, OEL 에이전트에서 스킬 습득의 발달적 궤적을 반영하기 위해 필요한 추가 능력은 무엇인가?

주요 결과

  • 개방형 학습의 핵심 성질은 관찰자 시점에서의 지속적이고 무한 수평선적 새로운 요소(예: 목표, 옵션, 보상 함수) 생성이다.
  • 논문은 표준 RL 설정과 구별되는 개방형 목표 조건부 강화학습(GCRL) 문제를 위한 형식적 프레임워크를 수립한다.
  • 시간이 지나도 새로운 목표를 발견하지 못하는 에이전트—보이는 목표 수가 수렴하는 것으로 나타나는 경우—는 개방형 학습 에이전트로 간주되지 않는다.
  • 시간이 지남에 따라 새로운 목표 발견 속도가 로그 또는 선형적으로 증가하는 것은 개방형 학습 행동을 나타내며, 기울기가 점점 커지는 것은 가장 강력한 지표이다.
  • 무작위로 선택된 작업을 포함한 표준화된 외재적 단계에서의 성능은 내재적 단계에서 OEL 과정의 지식 획득 능력을 측정하는 타당한 대체 측정 기준이 된다.
  • 프레임워크는 인간과 유사한 스킬 습득을 반영하기 위해 표현 재기술표현, 추상화, 창의성 등의 추가 발달 메커니즘을 OEL 에이전트에 통합해야 한다는 필요성을 부각시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.