Skip to main content
QUICK REVIEW

[논문 리뷰] Augmenting Autotelic Agents with Large Language Models

Cédric Colas, Laetitia Teodorescu|arXiv (Cornell University)|2023. 05. 21.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 사전 학습된 언어 모델을 사용하여 다양한, 추상적이고 인간 중심의 목표를 생성하고, 이를 다시 레이블링하며 보상하는, 작업에 종속되지 않은 텍스트 기반 환경에서 자율적으로 목표를 설정하는 LMA3라는 언어 모델 증강 자율 에이전트를 소개한다. 수동으로 설계된 목표나 보상 없이도 LMA3는 언어 모델을 통해 목표 생성, 궤적 재레이블링, 보상 형상 조정을 활용하여 개방형 스킬 학습을 달성하며, 스스로 생성한 창의적인 목표를 통해 다양한 스킬에 능숙해지는 것을 보여준다.

ABSTRACT

Humans learn to master open-ended repertoires of skills by imagining and practicing their own goals. This autotelic learning process, literally the pursuit of self-generated (auto) goals (telos), becomes more and more open-ended as the goals become more diverse, abstract and creative. The resulting exploration of the space of possible skills is supported by an inter-individual exploration: goal representations are culturally evolved and transmitted across individuals, in particular using language. Current artificial agents mostly rely on predefined goal representations corresponding to goal spaces that are either bounded (e.g. list of instructions), or unbounded (e.g. the space of possible visual inputs) but are rarely endowed with the ability to reshape their goal representations, to form new abstractions or to imagine creative goals. In this paper, we introduce a language model augmented autotelic agent (LMA3) that leverages a pretrained language model (LM) to support the representation, generation and learning of diverse, abstract, human-relevant goals. The LM is used as an imperfect model of human cultural transmission; an attempt to capture aspects of humans' common-sense, intuitive physics and overall interests. Specifically, it supports three key components of the autotelic architecture: 1)~a relabeler that describes the goals achieved in the agent's trajectories, 2)~a goal generator that suggests new high-level goals along with their decomposition into subgoals the agent already masters, and 3)~reward functions for each of these goals. Without relying on any hand-coded goal representations, reward functions or curriculum, we show that LMA3 agents learn to master a large diversity of skills in a task-agnostic text-based environment.

연구 동기 및 목표

  • 자신이 생각해낸 추상적이고 창의적인 목표를 생성하고 추구함으로써 자율 에이전트가 개방형 스킬 학습을 가능하게 하는 것.
  • 현재 인공 에이전트가 고정되거나 사전 정의된 목표 공간에 의존하는 데서 비롯되는 한계를 극복하는 것.
  • 언어 모델을 문화 전파의 대체 수단으로 활용하여 목표 표현 방식의 진화를 가능하게 하는 것.
  • 사람이 설계한 보상 함수나 교육 과정 없이도 자율적인 목표 생성, 재레이블링, 보상 형상 조정 프레임워크를 개발하는 것.
  • 언어 모델이 작업에 종속되지 않은 환경에서 스케일링 가능하고 다양한, 인간 중심의 스킬 습득을 지원할 수 있음을 입증하는 것.

제안 방법

  • LMA3 프레임워크는 사전 학습된 언어 모델(LM)을 문화 전파 수단으로 통합하여 목표 생성, 궤적 재레이블링, 보상 함수 생성이라는 세 핵심 구성요소를 지원한다.
  • 목표 생성기는 이전 궤적과 달성된 부분 목표를 기반으로 언어 모델에 프롬프트를 제공하여 실행 가능한 부분 목표로 분해되는 고수준의 추상적 목표를 생성한다.
  • 재레이블러는 언어 모델을 사용해 에이전트의 궤적을 자연어로 재기록하고, 롤아웃 중에 달성된 새로운 또는 복잡한 목표를 식별한다.
  • 보상 함수는 재레이블된 목표 기술 기반으로 언어 모델에 의해 자동 생성되며, 스킬 습득을 위한 내재적 동기를 제공한다.
  • 에이전트는 학습된 정책을 사용해 부분 목표 시퀀스를 실행하는 롤아웃을 수행하며, 성공 여부는 언어 모델 기반 재레이블링과 보상 형상 조정을 통해 평가된다.
  • 시스템은 작업에 종속되지 않은 텍스트 기반 환경에서 작동하며, 목표 표현과 피드백에 전적으로 언어에 의존하여 수동으로 설계된 목표나 보상 함수를 피한다.

실험 결과

연구 질문

  • RQ1대규모 언어 모델이 인간이 제공한 목표 템플릿 없이 다양한, 추상적이고 인간 중심의 목표를 효과적으로 생성할 수 있는가?
  • RQ2언어 모델 기반의 재레이블링과 보상 형상 조정이 작업에 종속되지 않은 환경에서 개방형 스킬 학습을 가능하게 하는가?
  • RQ3언어 모델을 자율 에이전트에 통합함으로써 학습된 스킬의 다양성과 복잡도에 어떤 영향을 미치는가?
  • RQ4언어 모델이 에이전트 간 목표 표현 형상 조정을 위한 문화 전파의 대체 수단으로 얼마나 효과적으로 작용하는가?
  • RQ5사전 정의된 보상, 교육 과정, 수동으로 설계된 목표 공간 없이도 에이전트가 의미 있는 스킬 습득을 달성할 수 있는가?

주요 결과

  • LMA3 에이전트는 수동으로 설계된 목표 표현이나 보상 함수 없이도 작업에 종속되지 않은 텍스트 기반 환경에서 다양한 스킬을 성공적으로 습득한다.
  • 언어 모델은 에이전트의 궤적과 달성된 부분 목표를 바탕으로 '시금치 요리 준비하기'나 '맛있는 식사 즐기기'와 같은 고수준의 추상적이고 창의적인 목표를 효과적으로 생성한다.
  • 언어 모델의 재레이블링 구성요소는 롤아웃 중에 달성된 복잡하거나 새로운 목표를 성공적으로 식별하고 재기록한다. 예를 들어 ' refrigirator 열고 닫기' 또는 '건강한 식사하기'와 같은 목표들.
  • 시스템은 달성된 부분 목표를 반복적으로 조합하여 점점 더 복잡한 목표로 발전시키는 방식으로 개방형 학습을 보여주며, 가능한 스킬 공간을 넓게 탐색할 수 있다.
  • 이 접근법은 언어 모델 상호작용과 학습된 정책에만 의존하여 인간 간섭을 최소화한 채 스킬 습득을 달성하며, 실험에서 총 550,000회의 언어 모델 호출을 사용하였다.
  • 프레임워크는 스케일링 가능하고 인간 중심의 스킬 학습에 잠재력을 보여주지만, 높은 추론 비용(약 10,000 에피소드당 $240)이 실용적 한계로 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.