Skip to main content
QUICK REVIEW

[논문 리뷰] Cycle-of-Learning for Autonomous Systems from Human Interaction

Nicholas R. Waytowich, Vinicius G. Goecks|arXiv (Cornell University)|2018. 08. 28.
Reinforcement Learning in Robotics참고 문헌 11인용 수 14
한 줄 요약

이 논문은 자율 시스템을 위한 통합 강화학습 파이프라인으로서 인간 상호작용 모odalities—시연, 간섭, 평가—를 융합한 Cycle-of-Learning 프레임워크를 제안한다. 인간의 시연을 통해 액터를 사전 훈련하고, 간섭을 통해 크리틱을 정밀화하며, 인간 평가와 자기지도 학습 기반 강화학습으로 전환함으로써 시간이 지남에 따라 인간의 참여가 점차 감소하는 효율적이고 적응 가능한 학습을 가능하게 한다.

ABSTRACT

We discuss different types of human-robot interaction paradigms in the context of training end-to-end reinforcement learning algorithms. We provide a taxonomy to categorize the types of human interaction and present our Cycle-of-Learning framework for autonomous systems that combines different human-interaction modalities with reinforcement learning. Two key concepts provided by our Cycle-of-Learning framework are how it handles the integration of the different human-interaction modalities (demonstration, intervention, and evaluation) and how to define the switching criteria between them.

연구 동기 및 목표

  • 보상 함수가 계산이 불가능하거나 가용하지 않은 실제 환경에서 자율 시스템을 훈련하는 데 도전하는 데 목적을 두며.
  • 다양한 인간 상호작용 모달리티—시연, 간섭, 평가—를 하나의 일관된 훈련 과정에 통합하는 통합 학습 프레임워크를 체계화하는 데 목적을 두며.
  • 성능, 데이터 가용성 또는 이점 함수에 기반해 상호작용 모달리티를 동적으로 전환함으로써 인간 트레이너의 부담을 줄이는 데 목적을 두며.
  • 높은 인간 참여도(시연 및 간섭)에서 시작하여 점차 시스템 자율성(평가 및 순수 강화학습)으로의 매끄러운 전환을 가능하게 하는 데 목적을 두며.

제안 방법

  • 세 단계 학습 사이클을 제안한다: (1) 인간 시연로부터의 학습(LFD), (2) 인간 간섭으로부터의 학습(LFI), (3) 인간 평가로부터의 학습(LFE), 이어서 순수 강화학습(RL)을 수행한다.
  • 액터-크리틱 아키텍처를 사용하며, 액터는 먼저 시연와 간섭을 통해 훈련되고, 크리틱은 인간 제공 피드백과 시간 차분 학습을 통해 훈련된다.
  • 인버스 강화학습(IRL)을 사용해 인간 시연에서 보상 함수를 추론함으로써 시스템이 보상 모델 $ R_H $ 를 학습할 수 있도록 한다.
  • 학습된 보상 모델 $ R_H $ 를 표준 액터-크리틱 RL 프레임워크에 통합하여 정책 $ \pi_{\theta D_H} $ 를 정책 기반 강화학습 방법으로 최적화한다.
  • 성능 지표, 데이터 모달리티 제약 조건, 그리고 이점 함수 $ A(s,a) = Q(s,a) - V(s) $ 를 사용해 모달리티 간 전환 기준을 정의한다.
  • 이점 함수를 사용해 인간과 시스템의 성능를 비교함으로써, 시스템의 기대 수익에서 인간을 초월할 경우 자동으로 자율 강화학습으로 전환할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1다양한 인간 상호작용 모달리티—시연, 간섭, 평가—를 어떻게 체계적으로 통합하여 자율 시스템을 위한 단일이고 일관된 학습 프레임워크로 만들 수 있는가?
  • RQ2학습 효율성과 인간 자원 제약 조건을 균형 있게 유지하기 위해 다양한 상호작용 모달리티 간 전환에 어떤 기준을 적용해야 하는가?
  • RQ3인간의 시연와 간섭에서 보상 모델을 어떻게 학습시켜 수동으로 설계된 보상 함수 없이도 후속 강화학습을 가능하게 할 수 있는가?
  • RQ4시간이 지남에 따라 인간의 참여를 줄이며 시스템의 자율성을 점진적으로 높일 수 있는 방법은 무엇인가?
  • RQ5성능 지표, 데이터 가용성, 이점 함수는 상호작용 모드 간 최적의 전환 시점 결정에 어떤 역할을 하는가?

주요 결과

  • Cycle-of-Learning 프레임워크는 인간이 이끄는 학습(시연 및 간섭)에서 자율 강화학습으로의 체계적이고 순차적인 전환을 가능하게 하여 지속적인 인간 입력 의존도를 감소시킨다.
  • 먼저 액터를 시연와 간섭으로 훈련함으로써 순수 강화학습에서 무작위 초기화 상태에서 시작하는 것보다 샘플 효율성과 수렴 속도가 향상된다.
  • IRL의 통합을 통해 시스템은 인간 행동에서 보상 함수를 추론할 수 있으며, 이는 이후 강화학습 최적화에 학습된 보상 모델을 사용할 수 있도록 한다.
  • 이점 함수 $ A(s,a) $ 의 사용은 시스템 성능가 인간 성능를 초월할 경우 자율 운영으로의 전환을 정량적 근거로 제공한다.
  • 성능 지표나 데이터 가용성 기반 전환은 인간 상호작용에 대한 현실 세계 제약(예: 제한된 시연 시간 또는 피드백 용량)에 대응할 수 있도록 프레임워크를 유연하게 조정할 수 있도록 한다.
  • 인간과 시스템 자원이 모두 제한된 로봇 응용 분야를 고려해 설계되었으며, 인간-시스템 상호작용 학습을 위한 확장 가능하고 직관적인 프레임워크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.