Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging Human Guidance for Deep Reinforcement Learning Tasks

Ruohan Zhang, Faraz Torabi|arXiv (Cornell University)|2019. 09. 21.
Reinforcement Learning in Robotics참고 문헌 56인용 수 4
한 줄 요약

이 논문은 전통적인 행동 시연 외에 평가 피드백, 선호도, 고수준 목표, 주의 맵, 상태 시퀀스와 같은 비전통적 인간 지시를 활용하는 다섯 가지 딥 강화학습 프레임워크를 조사한다. 이러한 방법들은 인간의 노력을 줄이고 샘플 효율성을 향상시키며 아타리 게임과 로봇 제어와 같은 복잡한 작업에서 더 빠른 학습을 가능하게 한다.

ABSTRACT

Reinforcement learning agents can learn to solve sequential decision tasks by interacting with the environment. Human knowledge of how to solve these tasks can be incorporated using imitation learning, where the agent learns to imitate human demonstrated decisions. However, human guidance is not limited to the demonstrations. Other types of guidance could be more suitable for certain tasks and require less human effort. This survey provides a high-level overview of five recent learning frameworks that primarily rely on human guidance other than conventional, step-by-step action demonstrations. We review the motivation, assumption, and implementation of each framework. We then discuss possible future research directions.

연구 동기 및 목표

  • 전체 행동 시연 외의 인간 지시를 포함시켜 딥 강화학습의 높은 샘플 복잡도를 해결한다.
  • 비용이 많이 들고 품질이 높은 행동 클로닝 데이터에 대한 의존도를 줄이기 위해 대체 인간 피드백 신호를 사용한다.
  • 다양한 형태의 인간 지시—예를 들어 피드백, 선호도, 주의—가 복잡한 환경에서 정책 학습을 가속화하는 방식을 탐구한다.
  • 인간-중심 강화학습 프레임워크에서 정보의 풍부함과 인간의 노력 사이의 트레이드오���을 조사한다.
  • 딥 러닝 연구에서 공유 데이터셋을 통해 재현 가능성과 벤치마킹을 촉진한다.

제안 방법

  • 인간의 평가 피드백을 사용하여 에이전트 행동에 대한 스칼라 보상 또는 이진 비교를 제공함으로써 행동 수준의 시연 없이도 보상 형상화를 가능하게 한다.
  • 인간의 선호도 학습을 구현하여 두 개의 에이전트 궤적을 비교하고 쌍별 비교를 통해 정책 선호도를 최적화한다.
  • 인간이 고수준 목표를 제공하고 하위 정책가 이를 달성하도록 훈련하는 계층적 일관성 학습을 도입한다.
  • 인간의 주의 맵을 활용하여 에이전트가 환경의 관련 특징에 집중하도록 유도함으로써 인식 및 정책 학습을 향상시킨다.
  • 행동 없이 상태 시퀀스만을 사용하여 훈련함으로써 상태 전이 동역학을 모델링함으로써 관찰에서의 일관성 학습을 가능하게 한다.
  • 다양한 지시 유형을 통합한 일관된 생애주기 학습 프레임워크를 구축하여 적응형이고 다단계 학습을 지원한다.

실험 결과

연구 질문

  • RQ1전체 행동 시연 없이 평가 피드백을 효과적으로 사용하여 딥 강화학습에서 보상을 형상화할 수 있는가?
  • RQ2기존의 일관성 학습과 비교할 때 인간의 행동 궤적에 대한 선호도가 정책 학습에 얼마나 기여하는가?
  • RQ3인간이 제공한 고수준 목표가 계층적 제어 작업에서 학습의 샘플 복잡도를 크게 줄일 수 있는가?
  • RQ4인간의 주의 지시가 에이전트가 환경의 관련 특징에 집중하는 능력을 어떻게 향상시키는가?
  • RQ5행동 데이터가 없거나 비용이 많이 들 때 상태 시퀀스만을 사용한 학습 성능에 어떤 영향을 미치는가?

주요 결과

  • 인간 평가 피드백과 선호도 기반 학습은 대규모 행동 시연 데이터의 필요성을 줄이면서도 효과적인 정책 최적화를 가능하게 한다.
  • 계층적 프레임워크에서 고수준 목표 지시는 샘플 효율성을 향상시키고 시뮬레이션된 로봇 제어에서 장기 목표 작업의 학습을 가능하게 한다.
  • 주의 지도 기반 학습은 에이전트의 집중이 인간이 중요하게 여기는 특징과 일치하도록 하여 일반화 능력을 향상시킨다.
  • 행동 데이터가 없거나 비용이 많이 들 때 상태 시퀀스만을 사용한 관찰에서의 일관성 학습이 경쟁적인 성능을 달성한다.
  • 선호도 기반 방법은 인간 피드백이 전문가 시연보다 더 스케일러블한 아타리 게임과 같은 복잡한 환경에서 뛰어난 성능을 보인다.
  • 다양한 지시 유형을 통합한 일관된 생애주기 학습 프레임워크는 단일 지시 접근 방식을 능가하는 적응형이고 다모달 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.