Skip to main content
QUICK REVIEW

[논문 리뷰] ACTRCE: Augmenting Experience via Teacher's Advice For Multi-Goal Reinforcement Learning

Harris Chan, Yuhuai Wu|arXiv (Cornell University)|2019. 02. 12.
Reinforcement Learning in Robotics참고 문헌 26인용 수 21
한 줄 요약

ACTRCE는 희박한 보상 환경에서 복잡한 3D 탐색 작업을 수행하는 데 있어 희망적 경험 재현(Hindsight Experience Replay, HER)에서 자연어를 목표 표현으로 사용하는 강화학습 방법을 제안한다. 교사가 제공하는 언어 기반 희망적 조언을 활용함으로써, 조언이 최소한일지라도 강화학습 성능이 뛰어나며, 예상치 못한 지시어 및 어휘에 일반화되며, 비언어 기반 HER 접근 방식을 능가한다.

ABSTRACT

Sparse reward is one of the most challenging problems in reinforcement learning (RL). Hindsight Experience Replay (HER) attempts to address this issue by converting a failed experience to a successful one by relabeling the goals. Despite its effectiveness, HER has limited applicability because it lacks a compact and universal goal representation. We present Augmenting experienCe via TeacheR's adviCE (ACTRCE), an efficient reinforcement learning technique that extends the HER framework using natural language as the goal representation. We first analyze the differences among goal representation, and show that ACTRCE can efficiently solve difficult reinforcement learning problems in challenging 3D navigation tasks, whereas HER with non-language goal representation failed to learn. We also show that with language goal representations, the agent can generalize to unseen instructions, and even generalize to instructions with unseen lexicons. We further demonstrate it is crucial to use hindsight advice to solve challenging tasks, and even small amount of advice is sufficient for the agent to achieve good performance.

연구 동기 및 목표

  • 희박한 보상 문제를 해결하기 위해 Hindsight Experience Replay(HER)에 자연어 목표 표현을 통합함으로써 강화학습의 도전 과제를 해결하는 것.
  • 언어 기반 목표 추상화를 통해 예상치 못한 지시어 및 어휘에 일반화할 수 있도록 하는 것.
  • 복잡한 환경에서 효과적인 학습을 위해 최소한의 자연어 기반 희망적 조언이 충분한지 입증하는 것.
  • 언어 기반 지도와 희망적 학습을 융합함으로써 다목표 강화학습의 샘플 효율성과 일반화 능력을 향상시키는 것.
  • 시뮬레이션된 3D 환경에서 언어 조건부 정책 학습을 위한 실용적이고 확장 가능한 프레임워크를 제공하는 것.

제안 방법

  • 방법은 상태 기반 목표를 대체하여 자연어를 압축적이고 표현력 있으며 일반화 가능한 목표 표현으로 사용한다.
  • 각 에피소드 이후, 교사가 달성된 결과의 자연어 기반 기록을 희망적 조언으로 제공한다.
  • 에이전트는 이 조언을 새로운 목표로 간주하고 경험에 밀도 높은 보상(예: 1)을 부여함으로써 실패를 성공으로 전환한다.
  • 事전에 학습된 문장 인코더(예: InferLite)가 언어 조언을 잠재 벡터로 인코딩하여 정책 학습에 활용한다.
  • 깊이 신경망과 GRU 기반 순환망을 통합하여 언어 조건부 목표를 갖는 순차적 의사결정을 모델링한다.
  • 사전에 학습된 언어 모델에서 추출한 의미적 특징을 이용해, 미리 보지 않은 단어나 어구로도 제로샷 일반화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1자연어 기반 목표 표현은 희박한 보상 환경에서 다목표 강화학습의 샘플 효율성과 학습 성능을 향상시키는가?
  • RQ2자연어 기반 희망적 조언을 사용할 경우, 예상치 못한 지시어 및 어휘에 일반화할 수 있는가?
  • RQ3효과적인 학습을 위해 얼마나 많은 희망적 조언이 필요한가? 최소한의 조언으로도 충분한가?
  • RQ4특히 복잡한 3D 환경에서 언어 기반 목표 표현은 상태 기반 목표 표현보다 성능이 뛰어나다고 할 수 있는가?
  • RQ5교사 조언을 통한 언어 기반 지도가 시뮬레이션 환경에서 정책의 일반화 능력과 내구성을 얼마나 향상시키는가?

주요 결과

  • ACTRCE는 HER가 비언어 목표를 사용할 경우 학습에 실패하는 도전적인 ViZDoom 3D 탐색 작업을 성공적으로 해결했다.
  • 희망적 조언이 학습 프레임의 1%에만 제공되더라도 높은 성능을 달성하여, 최소한의 교사 입력에 대한 강건성을 입증했다.
  • 사전에 학습된 문장 임베딩을 통해 예상치 못한 지시어, 특히 새로운 어휘를 포함한 지시어에 대해 제로샷 일반화가 가능했다.
  • 기존의 HER 기반 기준 모델이 보여준 것과 비교해, 예상치 못한 지시어에 대한 일반화 능력이 뚜렷하게 향상되었다.
  • 원시 상태 기반 목표에 비해 언어 기반 목표 표현은 더 컴 pact하고 의미 있는 표현을 제공하여 중복을 줄였다.
  • 조언이 첫 1%의 프레임에서만 제공되더라도 성능이 유지되어, 저 supervision 환경에서의 실용성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.