Skip to main content
QUICK REVIEW

[논문 리뷰] ELLA: Exploration through Learned Language Abstraction

Suvir Mirchandani, Siddharth Karamcheti|arXiv (Cornell University)|2021. 03. 10.
Reinforcement Learning in Robotics참고 문헌 46인용 수 8
한 줄 요약

ELLA는 온라인 관련성 분류와 오프라인 종료 분류를 통해 저수준 하위작업을 식별함으로써 희박 보상, 언어 기반 강화학습에서 샘플 효율성을 향상시키는 보상 형상화 방법이다. 사전에 정의된 계층적 지시 분해가 필요 없이 유용한 하위작업을 완료할 때 보조 보상을 제공함으로써 복잡한 BabyAI 작업에서 성능을 향상시킨다.

ABSTRACT

Building agents capable of understanding language instructions is critical to effective and robust human-AI collaboration. Recent work focuses on training these agents via reinforcement learning in environments with synthetic language; however, instructions often define long-horizon, sparse-reward tasks, and learning policies requires many episodes of experience. We introduce ELLA: Exploration through Learned Language Abstraction, a reward shaping approach geared towards boosting sample efficiency in sparse reward environments by correlating high-level instructions with simpler low-level constituents. ELLA has two key elements: 1) A termination classifier that identifies when agents complete low-level instructions, and 2) A relevance classifier that correlates low-level instructions with success on high-level tasks. We learn the termination classifier offline from pairs of instructions and terminal states. Notably, in departure from prior work in language and abstraction, we learn the relevance classifier online, without relying on an explicit decomposition of high-level instructions to low-level instructions. On a suite of complex BabyAI environments with varying instruction complexities and reward sparsity, ELLA shows gains in sample efficiency relative to language-based shaping and traditional RL methods.

연구 동기 및 목표

  • 기초적인 에이전트를 위한 장기적, 희박 보상, 언어 지시 작업에서 샘플 효율성을 향상시키기.
  • 정책 학습 중에 관련성이 높은 저수준 행동을 식별하고 보상함으로써 탐색의 효율성을 높이기.
  • 고수준 지시의 엄격하고 사전 정의된 계층적 분해에 의존하지 않기.
  • 전문가가 제공한 하위작업 시퀀스가 필요 없이 온라인으로 저수준 동작과 고수준 작업 간의 관련성을 학습하기.
  • 복잡하고 조합적인 지시 환경에서 일반화 능력과 강건성을 향상시키기.

제안 방법

  • 저수준 지시와 종료 상태의 레이블러닝 쌍을 사용하여 오프라인으로 종료 분류기를 훈련하여 하위작업 완료를 탐지한다.
  • 고수준 작업 성공 예측에 기여하는 저수준 하위작업을 식별하기 위해 온라인으로 관련성 분류기를 학습한다.
  • 관련성 분류기를 사용하여 하위작업 완료 기반으로 정책 학습 중에 동적으로 보조 보상을 할당한다.
  • 내재 보상과 형상화 보상 간 균형을 맞추기 위해 하이퍼파rameter λ를 사용하여 보상 형상화 손실을 설정하며, 정책 불변성을 확보한다.
  • 성공적인 트레이젝터리에서 온라인 경험을 수집하여, 중복 제거를 통해 노이즈를 줄이며 실시간으로 관련성 분류기를 훈련한다.
  • 표준 RL 알고리즘(예: PPO)과 관련성 분류기를 통합하여 하위작업 관련성에 기반한 보상 형상화를 수행한다.

실험 결과

연구 질문

  • RQ1온라인 하위작업 관련성 학습이 희박 보상 언어 지시 작업에서 샘플 효율성을 향상시키는가?
  • RQ2ELLA의 접근 방식은 전통적 RL 및 언어 기반 형상화 베이스라인과 비교해 학습 속도와 최종 성능에서 어떻게 다른가?
  • RQ3복잡한 환경에서 다양한 조합적 언어 지시에 대해 ELLA는 어느 정도 일반화되는가?
  • RQ4ELLA의 성능는 형상화 하이퍼파rameter λ의 선택에 얼마나 민감한가?
  • RQ5사전 명시적 계층적 분해 없이 ELLA는 의미 있는 추상화를 학습할 수 있는가?

주요 결과

  • ELLA는 PutNext, Unlock, Combo, Open&Pick, Sequence 작업을 포함한 여러 BabyAI 환경에서 샘플 효율성에 상당한 향상을 보였다.
  • PutNext-Maze 및 Sequence-Maze에서 ELLA는 시간이 지남에 따라 고수준 지시당 하위작업 수를 감소시켜 분해 추정이 향상됨을 나타냈다.
  • PutNext-Maze에서 관련성 분류기는 높은 검증 정확도를 달성하여 작업 관련 추상화를 효과적으로 학습함을 입증했다.
  • PutNext, Unlock, Combo에서는 λ = 0.25, 장기적 작업인 Open&Pick 및 Sequence에서는 λ = 0.5일 때 안정적인 학습을 보였다.
  • 지시 복잡도가 중간 수준인 환경에서 성능 향상이 가장 두드러졌으며, 데이터 희소성으로 인해 매우 다양하고 조합적인 지시(예: Sequence-Maze)는 여전히 도전 과제로 남아 있었다.
  • 절단 실험 결과, 종료 분류기는 각 저수준 작업당 약 15,000개의 양성 및 음성 쌍이 필요로 하며, 데이터 효율성은 낮은 데이터 환경에서 여전히 제한 요소로 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.