Skip to main content
QUICK REVIEW

[논문 리뷰] Generalization to New Actions in Reinforcement Learning

Ayush Jain, Andrew Szot|arXiv (Cornell University)|2020. 11. 03.
Reinforcement Learning in Robotics인용 수 10
한 줄 요약

이 논문은 강화학습에서 새로운 동작에 대한 제로샷 일반화를 제안하는 이단계 프레임워크를 통해 도입한다: 첫 번째로 관찰에서 계층적 변동형 오토인코더를 사용하여 동작 표현을 학습하고, 두 번째로 학습된 임베딩을 기반으로 동작를 선택하는 정책을 훈련한다. 이 방법은 도구 선택 및 3D 형태 쌓기와 같은 작업에서 훈련 중에 볼 수 없었던 동작에 대해 강력한 일반화 성능를 보이며, 재훈련 없이도 안정성을 유지한다.

ABSTRACT

A fundamental trait of intelligence is the ability to achieve goals in the face of novel circumstances, such as making decisions from new action choices. However, standard reinforcement learning assumes a fixed set of actions and requires expensive retraining when given a new action set. To make learning agents more adaptable, we introduce the problem of zero-shot generalization to new actions. We propose a two-stage framework where the agent first infers action representations from action information acquired separately from the task. A policy flexible to varying action sets is then trained with generalization objectives. We benchmark generalization on sequential tasks, such as selecting from an unseen tool-set to solve physical reasoning puzzles and stacking towers with novel 3D shapes. Videos and code are available at https://sites.google.com/view/action-generalization

연구 동기 및 목표

  • 새로운 이산 동작이 도입되었을 때 강화학습에서 제로샷 일반화의 부족을 해결하기 위해.
  • 재훈련 없이도 이전에 볼 수 없었던 동작을 사용하여 작업을 해결할 수 있도록 에이전트를 가능하게 하기 위해.
  • 관찰에서 의미 있는 동작 표현을 학습하고 다양한 동작 집합 간에 정책을 일반화할 수 있는 프레임워크를 개발하기 위해.
  • 도구, 3D 형태, 탐색, 추천과 같은 다양한 환경에서 문제를 벤치마크하기 위해.
  • 훈련 중에 사용된 동작에 과적합되지 않도록 하기 위해 훈련 중에 다양한 동작 선택을 장려함으로써 정책의 일반화 성능를 향상시키기 위해.

제안 방법

  • 계층적 변동형 오토인코더(HVAE)를 사용하여 관찰에서 동작 표현을 저차원 표현으로 인코딩한다.
  • 행동 표현은 동작 실행의 영상, 이미지 또는 상태 트레이젝터리와 같은 다양한 입력에서 유도된다.
  • 정책 네트워크는 상태 인코딩과 동작 표현을 사용하여 동작 유틸리티를 계산하고, 동작에 대한 다중 분포를 출력한다.
  • 제로샷 일반화를 향상시키기 위해 훈련 중에 다양한 동작 선택을 장려하는 훈련 절차를 도입한다.
  • 정책은 이산 동작 선택과 연속 동작(예: 위치 또는 종료)을 베타 및 다중 분포를 통해 조합한 하이브리드 동작 공간을 사용한다.
  • 학습된 표현에서 동작 관찰를 정확하게 복원하기 위해 VAE에 복원 손실을 적용한다.

실험 결과

연구 질문

  • RQ1강화학습 에이전트는 훈련 중에 볼 수 없었던 새로운 동작에 일반화할 수 있는가?
  • RQ2영상이나 트레이젝터리와 같은 다양한 고차원 관찰에서 효과적으로 동작 표현을 학습할 수 있는가?
  • RQ3어떤 훈련 절차가 훈련 동작에 과적합되지 않고도 새로운 동작에 일반화할 수 있도록 하는가?
  • RQ4새로운 동작이 도입되었을 때 제안된 프레임워크는 재훈련과 비교해 어떻게 성능를 보이는가?
  • RQ5이 방법은 도구, 3D 형태, 탐색 기술과 같은 다양한 작업과 동작 모odalities에 대해 어느 정도 일반화되는가?

주요 결과

  • 제안된 이단계 프레임워크는 다양한 관찰에서 의미 있는 동작 표현을 효과적으로 학습하여 제로샷 일반화를 가능하게 한다.
  • CREAT 환경에서 에이전트는 새로운 도구 세트를 선택하여 물리적 추론 퍼즐을 해결하는 데서, 훈련 중에 볼 수 없었던 동작에 잘 일반화된다.
  • 형태 쌓기 작업에서 훈련 중에 볼 수 없었던 새로운 3D 형태에 대해 에이전트는 재훈련 없이도 높은 성공률을 기록한다.
  • 다양한 동작 선택을 장려하는 훈련 절차는 단순한 훈련에 비해 제로샷 성능를 크게 향상시킨다.
  • 특히 저자료 환경에서 샘플 효율성과 일반화 성능 측면에서 재훈련보다 프레임워크가 뛰어나다.
  • 탐색 및 추천 작업을 포함한 여러 환경에서의 강건성은 이 방법의 광범위한 적용 가능성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.