Skip to main content
QUICK REVIEW

[논문 리뷰] Widening the Pipeline in Human-Guided Reinforcement Learning with Explanation and Context-Aware Data Augmentation

Lin Guan, Mudit Verma|arXiv (Cornell University)|2020. 06. 26.
Explainable Artificial Intelligence (XAI)참고 문헌 65인용 수 15
한 줄 요약

이 논문은 인간의 시각적 설명(예: 관련 이미지 영역을 강조하는 열성도 맵)을 딥 강화학습에 통합하여 샘플 효율성을 향상시키는 새로운 방법인 EXPAND을 제안한다. 인간의 시각적 설명을 활용한 맥락 인식 데이터 증강 기법을 통해 비필수 영역에만 변형을 가함으로써 정책 학습을 향상시키며, 기존 기준 대비 30퍼센트 이상의 인간 피드백 신호 감소와 더불어 환경 샘플 효율성 향상을 달성한다.

ABSTRACT

Human explanation (e.g., in terms of feature importance) has been recently used to extend the communication channel between human and agent in interactive machine learning. Under this setting, human trainers provide not only the ground truth but also some form of explanation. However, this kind of human guidance was only investigated in supervised learning tasks, and it remains unclear how to best incorporate this type of human knowledge into deep reinforcement learning. In this paper, we present the first study of using human visual explanations in human-in-the-loop reinforcement learning (HRL). We focus on the task of learning from feedback, in which the human trainer not only gives binary evaluative "good" or "bad" feedback for queried state-action pairs, but also provides a visual explanation by annotating relevant features in images. We propose EXPAND (EXPlanation AugmeNted feeDback) to encourage the model to encode task-relevant features through a context-aware data augmentation that only perturbs irrelevant features in human salient information. We choose five tasks, namely Pixel-Taxi and four Atari games, to evaluate the performance and sample efficiency of this approach. We show that our method significantly outperforms methods leveraging human explanation that are adapted from supervised learning, and Human-in-the-loop RL baselines that only utilize evaluative feedback.

연구 동기 및 목표

  • 딥 강화학습(DRL)의 제한된 샘플 효율성을 개선하기 위해 이진 평가적 판단을 넘어서 인간 피드백을 통합하고자 한다.
  • 인간의 시각적 설명(예: 열성도 주석)이 DRL에 효과적으로 통합되어 학습 효율성이 향상될 수 있는 방법을 탐구하고자 한다.
  • 오프더쉐프 객체 검출기와 트래커를 활용해 반자동으로 열성도 주석을 생성함으로써 인간의 설명 제공 노력 최소화를 목표로 한다.
  • 비필수 영역에 집중된 변형을 적용함으로써 인간 설명의 정보량을 극대화하는 데이터 증강 전략을 개발하고자 한다.
  • 합성 및 인간-함께하는 환경 설정에서의 평가를 통해 환경 샘플 효율성과 인간 피드백 샘플 효율성 측면에서의 우수성을 입증하고자 한다.

제안 방법

  • EXPAND는 에이전트가 상태 이미지에 대해 인간 트레이너에게 이진 '좋음' 또는 '나쁨' 피드백과 시각적 열성도 주석을 요청하는 인간-함께하는 RL 프레임워크를 사용한다.
  • 맥락 인식 데이터 증강 모듈을 활용하여 인간 설명에서 식별된 비열성도 영역에만 변형(예: 가우시안 블러)을 적용함으로써 작업에 관련된 특징을 유지한다.
  • 이중 손실 메커니즘을 도입한다: 동일한 상태의 증강된 뷰 간 일관성 예측을 강제하는 불변성 손실과 증강된 상태와 원본 상태의 예측를 비교하는 이점 손실.
  • 열성도 맵는 사전 학습된 객체 검출기와 트래커를 사용해 인간 주석 객체에서 자동 생성되며, 주석 작업 부담을 감소시킨다.
  • 이중 피드백 신호와 증강된 설명 신호를 함께 최적화하는 수정된 DQN 알고리즘을 사용해 에이전트를 훈련시킨다.
  • 특정 영역에 대한 변형을 통해 관련 및 비관련 특징를 대조함으로써 저자원 환경에서도 안정적이고 효과적인 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1이진 피드백만을 사용하는 것과 비교해 인간의 시각적 설명이 딥 강화학습에서 샘플 효율성을 크게 향상시킬 수 있는가?
  • RQ2강화학습에서 인간 설명의 정보량을 극대화하기 위해 맥락 인식 데이터 증강을 어떻게 설계할 수 있는가?
  • RQ3객체 검출 및 추적을 활용해 낮은 노력으로 인간의 시각적 설명을 수집하는 것이 가능한가?
  • RQ4데이터 증강을 통해 인간 설명을 통합하는 것이 강화학습에서 표준 데이터 증강 기법보다 우월한가?
  • RQ5제안된 방법은 학습 성능을 유지하거나 향상시키면서도 인간 피드백 신호의 수를 줄일 수 있는가?

주요 결과

  • EXPAND는 Pixel-Taxi와 네 종류의 Atari 게임 포함 총 다섯 가지 작업에서 환경 샘플 효율성 측면에서 DQN-Feedback 및 설명 적응형 지도학습 기준보다 뚜렷이 뛰어나다.
  • 기준 방법 대비 30퍼센트 이상의 인간 피드백 신호 요구량 감소를 기록하며, 인간 피드백 효율성 향상을 입증한다.
  • 인간-함께하는 사용자 연구에서, 30분 이내의 상호작용 기간 동안 EXPAND는 DQN-Feedback보다 뛰어난 성능을 달성했으며, 평균적으로 인간 트레이너가 2,026개의 피드백-설명 쌍을 제공했다.
  • 랜덤 크롭핑 및 가우시안 블러와 같은 맥락 무관 데이터 증강 기법은 일부 작업에서 성능 저하를 초래했으며, 맥락 인식 변형보다 덜 효과적임을 시사한다.
  • 제거 실험을 통해 증강된 데이터와 함께 불변성 손실 및 이점 손실을 모두 사용할 경우 최고의 성능을 달성했으며, 각 손실 구성 요소만 사용하는 것 역시 기준 대비 뚜렷한 향상을 보였다.
  • 오프더쉐프 객체 검출기와 트래커의 활용으로 반자동 열성도 주석 생성이 가능했으며, 평균적으로 한 쿼리당 인간 주석 시간이 약 5분 수준이었으며, 낮은 인간 노력이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.