Skip to main content
QUICK REVIEW

[논문 리뷰] Explanation Augmented Feedback in Human-in-the-Loop Reinforcement Learning

Lin Guan, Mudit Verma|arXiv (Cornell University)|2020. 06. 26.
Reinforcement Learning in Robotics참고 문헌 40인용 수 11
한 줄 요약

이 논문은 이진 양호/불량 피드백에 시각적 주목도 맵을 추가하여 샘플 효율성을 향상시키는 인간-중심 강화학습 프레임워크인 EXPAND을 제안한다. 주목도 영역을 기반으로 상태를 변형시킴으로써 EXPAND은 학습 효율성을 향상시키며, Pixel-Taxi와 아케이드 게임을 포함한 다섯 가지 작업에서 환경 및 인간 피드백 샘플 효율성 측면에서 뚜렷한 성과를 보였다.

ABSTRACT

Human-in-the-loop Reinforcement Learning (HRL) aims to integrate human guidance with Reinforcement Learning (RL) algorithms to improve sample efficiency and performance. A common type of human guidance in HRL is binary evaluative good or bad feedback for queried states and actions. However, this type of learning scheme suffers from the problems of weak supervision and poor efficiency in leveraging human feedback. To address this, we present EXPAND (EXPlanation AugmeNted feeDback) which provides a visual explanation in the form of saliency maps from humans in addition to the binary feedback. EXPAND employs a state perturbation approach based on salient information in the state to augment the binary feedback. We choose five tasks, namely Pixel-Taxi and four Atari games, to evaluate this approach. We demonstrate the effectiveness of our method using two metrics: environment sample efficiency and human feedback sample efficiency. We show that our method significantly outperforms previous methods. We also analyze the results qualitatively by visualizing the agent's attention. Finally, we present an ablation study to confirm our hypothesis that augmenting binary feedback with state salient information results in a boost in performance.

연구 동기 및 목표

  • 이진 피드백 기반 인간-중심 강화학습에서 약한 감독과 낮은 효율성의 한계를 해결하기 위해.
  • 이진 피드백과 함께 시각적 설명(주목도 맵)을 통합하여 샘플 효율성을 향상시키기 위해.
  • 주목도 정보 기반 상태 변형이 학습 성능을 향상시키는지 조사하기 위해.
  • Pixel-Taxi와 아케이드 게임을 포함한 다양한 환경에서 방법을 평가하기 위해.
  • 설명을 통합한 피드백이 에이전트 성능 향상에 기여하는지 검증하기 위해.

제안 방법

  • 이진 평가 피드백과 인간이 제공한 주목도 맵을 융합하여 학습을 이끄는 프레임워크인 EXPAND를 도입한다.
  • 주목도 정보를 기반으로 상태를 수정하여 추가적인 학습 신호를 생성하는 상태 변형 기법을 사용한다.
  • 주목도 맵을 활용해 중요한 상태 영역을 식별하고, 이를 변형시켜 다양한 의미 있는 상태 변형을 시뮬레이션한다.
  • 변형된 상태를 이진 피드백과 융합하여 강화학습 에이전트의 더 풍부한 감독 신호를 생성한다.
  • 정책 학습 중 이진 피드백과 변형 기반 신호를 통합하는 피드백 집계 메커니즘을 활용한다.
  • 표준 강화학습 벤치마크를 사용하여 Pixel-Taxi와 네 종류의 아케이드 게임을 포함한 다섯 가지 환경에 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1이진 피드백에 시각적 주목도 설명을 추가하면 인간-중심 강화학습의 샘플 효율성이 향상되는가?
  • RQ2주목도 영역 기반 상태 변형 통합이 표준 이진 피드백 대비 학습 성능에 어떤 영향을 미치는가?
  • RQ3설명을 통합한 피드백은 효과적인 학습을 위해 필요한 인간 피드백 상호작용 수를 얼마나 줄이는가?
  • RQ4주목도 기반 변형은 에이전트의 주목도와 정책 일반화에 어떤 영향을 미치는가?
  • RQ5성능 향상에 기여하는 주목도 정보와 이진 피드백 중 어느 것이 더 중요한가?

주요 결과

  • EXPAND는 이진 피드백만을 사용하는 기준 방법 대비 환경 샘플 효율성이 뚜렷이 향상된다.
  • 더 적은 인간 피드백 샘플로도 높은 학습 성능를 달성하여 인간 피드백 샘플 효율성이 향상됨을 입증한다.
  • 정성적 분석 결과, 에이전트가 상태의 주목도 영역에 주목하는 방식으로 인간의 설명과 일치하는 경향을 보였다.
  • 제거 실험 결과, 주목도 기반 변형을 제거하면 성능 저하가 발생함을 확인하여 메서드의 핵심 가정을 검증하였다.
  • Pixel-Taxi와 네 종류의 아케이드 게임을 포함한 모든 다섯 가지 평가 작업에서 이전 방법을 능가하는 성능을 보였다.
  • 시각적 설명의 통합으로 정책 학습이 더 안정적이고 빠른 수렴을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.