Skip to main content
QUICK REVIEW

[논문 리뷰] Ask Your Humans: Using Human Instructions to Improve Generalization in Reinforcement Learning

Valerie Chen, Abhinav Gupta|arXiv (Cornell University)|2020. 11. 01.
Reinforcement Learning in Robotics참고 문헌 42인용 수 6
한 줄 요약

이 논문은 다중 작업 환경에서 zero-shot 일반화를 향상시키기 위해 인간의 시범에서 나온 자연어 지시어를 사용하는 강화학습 프레임워크를 제안한다. 언어에 조건이 붙은 언어 생성기와 정책을 훈련시킴으로써 에이전트는 복잡한 작업을 분해하고, 소수의 시범만으로도 새로운 작업에 일반화하며, 이해할 수 있고 인간이 읽을 수 있는 행동 시퀀스를 생성하게 되어, 볼 수 있는 작업과 볼 수 없는 작업 모두에서 베이스라인을 능가한다.

ABSTRACT

Complex, multi-task problems have proven to be difficult to solve efficiently in a sparse-reward reinforcement learning setting. In order to be sample efficient, multi-task learning requires reuse and sharing of low-level policies. To facilitate the automatic decomposition of hierarchical tasks, we propose the use of step-by-step human demonstrations in the form of natural language instructions and action trajectories. We introduce a dataset of such demonstrations in a crafting-based grid world. Our model consists of a high-level language generator and low-level policy, conditioned on language. We find that human demonstrations help solve the most complex tasks. We also find that incorporating natural language allows the model to generalize to unseen tasks in a zero-shot setting and to learn quickly from a few demonstrations. Generalization is not only reflected in the actions of the agent, but also in the generated natural language instructions in unseen tasks. Our approach also gives our trained agent interpretable behaviors because it is able to generate a sequence of high-level descriptions of its actions.

연구 동기 및 목표

  • 희소 보상, 다중 작업 강화학습에서의 샘플 효율성과 일반화 문제를 해결하기 위해.
  • 단지 소수의 인간 시범과 자연어 지시어만으로도 새로운 작업에 일반화할 수 있도록 에이전트를 가능하게 하기 위해.
  • 성공 및 실패 사례에 대해 인간이 읽을 수 있는 행동 기술을 생성하는 이해 가능한 에이전트를 만들기 위해.
  • 훈련 및 평가를 위해 제작된 캐프팅 기반 격자 세계 환경에서 인간이 애너테이션한 언어 지시어와 트레이젝터리 데이터셋을 개발하기 위해.
  • 언어 조건이 붙은 정책가 다양한 새로운 작업들 사이에서 작업 분해와 하위 작업 지식 재사용을 가능하게 할 수 있음을 보여주기 위해.

제안 방법

  • 프레임워크는 현재 상태와 목표에 기반해 자연어 지시어를 생성하는 고수준 언어 생성기를 사용한다.
  • 생성된 언어에 조건이 붙은 저수준 정책이 행동을 선택함으로써 계층적 작업 분해가 가능해진다.
  • 인간의 시범과 언어 애너테이션을 함께 사용하여 애널로그 학습을 수행하고, 강화학습 보상과 결합하여 모델을 훈련시킨다.
  • 훈련 데이터는 캐프팅 기반 격자 세계 환경에서 14개의 훈련 작업을 통해 6,000개의 게임 트레이서스로 구성되어 있다.
  • 에이전트는 실시간으로 단계별 지시어를 생성하며, 이를 통해 행동을 안내하고 작업 분해 및 일반화를 평가하는 데 사용된다.
  • 이 방법은 새로운 작업에 대해 소수의 추가 시범과 지시어만으로도 소수의 시범 퍼티닝을 지원한다.

실험 결과

연구 질문

  • RQ1인간의 시범에서 나온 자연어 지시어가 다중 작업 강화학습에서 zero-shot 일반화를 향상시킬 수 있는가?
  • RQ2훈련 작업과 공통 하위 작업을 공유하는 새로운 작업에 대해 언어 조건이 붙은 정책이 얼마나 잘 일반화되는가?
  • RQ3생성된 언어가 정확한 작업 분해를 반영하고 에이전트 실패 원인을 진단하는 데 얼마나 도움이 되는가?
  • RQ4소수의 시범만으로도 새로운 작업에 대해 퍼티닝할 때 에이전트가 얼마나 빨리 학습할 수 있는가?
  • RQ5템플릿 기반 언어보다 인간이 생성한 다양한, 노이즈가 있는 언어를 사용할 경우, 강화학습에서 강건성과 해석 가능성은 어떻게 향상되는가?

주요 결과

  • 모델은 35개의 zero-shot 캐프팅 작업 평균에서 기존의 베이스라인 방법을 능가하며, 추가 보상 신호 없이도 강력한 일반화 능력을 보였다.
  • 공유되는 하위 작업을 재사용함으로써 새로운 작업에 성공적으로 일반화되었으며, 이는 새로운 작업에 대해 일관되고 정확한 언어 생성을 통해 뒷받침된다.
  • 언어 생성기는 이해할 수 있고 고수준의 행동 기술을 생성하여 성공 및 실패 행동에 대한 통찰을 가능하게 한다.
  • 골드/브릭 픽아크와 같은 5단계 과제와 같은 도전적인 과제에서는 제한된 훈련 데이터에도 불구하고 비교적 일관되고 의미적으로 올바른 지시어를 생성한다.
  • 실패 분석 결과 언어 생성 오류(예: '골드' 대신 '스톡스' 사용)는 특정 아이템의 훈련 빈도가 낮을 때 발생하는 것으로 나타났으며, 정책 실패는 정확한 지시어가 있음에도 불구하고 발생했다.
  • 모델은 행동 실행뿐 아니라 생성된 언어의 품질과 일관성에서도 일반화되며, 실제 요리법과 유사한 작업 구조를 반영한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.