[논문 리뷰] FRESH: Interactive Reward Shaping in High-Dimensional State Spaces using Human Feedback
FRESH는 고차원 상태공간에서 딥 강화학습에 인간 피드백을 통합하기 위해 피드백 기반 보상 형상화 프레임워크를 제안한다. 피드백 신경망과 앙상블 불확실성 추정을 사용하여 인간 레이블링된 상태-행동 품질을 미관측 트레이젝터리로 일반화한다. FRESH는 볼링에서 인간 전문가 대비 21.4% 높은 점수를 기록했으며, 스키잉에서는 전문가 수준의 성능을 달성했고, 최신 딥 RL 알고리즘을 능가한다.
Reinforcement learning has been successful in training autonomous agents to accomplish goals in complex environments. Although this has been adapted to multiple settings, including robotics and computer games, human players often find it easier to obtain higher rewards in some environments than reinforcement learning algorithms. This is especially true of high-dimensional state spaces where the reward obtained by the agent is sparse or extremely delayed. In this paper, we seek to effectively integrate feedback signals supplied by a human operator with deep reinforcement learning algorithms in high-dimensional state spaces. We call this FRESH (Feedback-based REward SHaping). During training, a human operator is presented with trajectories from a replay buffer and then provides feedback on states and actions in the trajectory. In order to generalize feedback signals provided by the human operator to previously unseen states and actions at test-time, we use a feedback neural network. We use an ensemble of neural networks with a shared network architecture to represent model uncertainty and the confidence of the neural network in its output. The output of the feedback neural network is converted to a shaping reward that is augmented to the reward provided by the environment. We evaluate our approach on the Bowling and Skiing Atari games in the arcade learning environment. Although human experts have been able to achieve high scores in these environments, state-of-the-art deep learning algorithms perform poorly. We observe that FRESH is able to achieve much higher scores than state-of-the-art deep learning algorithms in both environments. FRESH also achieves a 21.4% higher score than a human expert in Bowling and does as well as a human expert in Skiing.
연구 동기 및 목표
- 고차원 상태공간에서 보상이 희박하고 지연되는 문제에 대응하기 위해, 인간은 능숙하지만 딥 RL 에이전트는 어려움을 겪는 환경에서의 도전에 대응한다.
- 전문가 시범 데이터나 복잡한 선호도 모델링 없이 인간 피드백을 딥 강화학습에 효과적으로 통합할 수 있도록 한다.
- 시험 시점에 미관측 상태와 행동으로까지 인간이 제공한 피드백을 신경망과 함께 불확실성 추정을 사용해 일반화한다.
- 인간이 참여하는 피드백을 통해 환경 보상을 형상화하여, 아타리 게임과 같은 복잡한 환경에서 샘플 효율성과 최종 성능을 향상시킨다.
- 특정 고차원 제어 과제에서 인간 피드백을 활용해 최신 딥 RL 에이전트와 인간 전문가를 초월할 수 있음을 입증한다.
제안 방법
- 인간 운영자가 재생 버퍼에서 가져온 트레이젝터리를 검토하고, 각 상태-행동 쌍을 '좋음', '나쁨', 또는 '판단 불가'로 레이블링한다.
- 피드백는 피드백 버퍼에 저장되며, 이는 새로운 상태-행동 쌍의 품질을 예측하기 위해 깊이 있는 피드백 신경망을 훈련하는 데 사용된다.
- 공통 아키텍처를 가진 신경망 앙상블을 사용하여 모델의 불확실성과 예측에 대한 신뢰도를 추정한다.
- 피드백 네트워크의 출력은 환경에서 제공하는 보상에 더해지는 형상화 보상 신호로 변환된다.
- 결합된 보상(환경 보상 + 형상화 보상)은 DQN 또는 SAC와 같은 오프-폴리시 알고리즘을 통해 딥 강화학습 에이전트를 훈련하는 데 사용된다.
- 훈련 중 피드백 네트워크는 미세조정되며, 불확실성 추정은 모호하거나 불확실한 상태에서의 피드백 우선순위를 정하는 데 도움이 된다.
실험 결과
연구 질문
- RQ1트레이젝터리 내 상태-행동 쌍에 대한 인간 피드백이 고차원 상태공간에서 딥 강화학습 에이전트의 샘플 효율성과 최종 성능을 크게 향상시킬 수 있는가?
- RQ2비전문가 인간 운영자로부터의 피드백을 깊이 있는 신경망을 사용해 새로운 상태와 행동으로 효과적으로 일반화할 수 있는가?
- RQ3피드백 기반 보상 형상화가 인간 플레이어가 능숙한 환경에서 최신 딥 RL 알고리즘을 능가할 수 있는가?
- RQ4어느 정도까지 인간 피드백이 복잡한 비디오 게임 환경에서 인간 전문가의 성능을 초월할 수 있는가?
- RQ5신경망 앙상블 방법을 통한 모델 불확실성 추정이 피드백 기반 보상 형상화의 강건성과 신뢰성에 어떻게 기여하는가?
주요 결과
- FRESH는 볼링 환경에서 평균 점수 187점을 기록하여 인간 전문가 기준선 대비 21.4% 향상된 성과를 달성했다.
- 볼링에서 FRESH가 기록한 최고 점수는 200을 초과하여, 해당 과제에서 인간의 능력을 뛰어넘는 뛀난 성능을 보였다.
- 스키잉 환경에서 FRESH는 평균 점수 -4400점을 기록하여 인간 전문가 플레이어와 동일한 성능을 달성했다.
- 볼링과 스키잉 양 측면에서 FRESH는 최신 딥 강화학습 알고리즘을 크게 능가했으며, 인간이 참여하는 보상 형상화의 효과성을 입증했다.
- 앙성 피드백 네트워크의 사용은 일반화 능력과 신뢰도 추정을 향상시켜 상태공간의 낮은 피드백 영역에서도 신뢰할 수 있는 형상화 보상을 가능하게 했다.
- 프레임워크는 트레이젝터리에 대한 인간 피드백을 성공적으로 활용하여 보상 형상화를 수행했으며, 환경과의 상호작용 횟수를 줄이고 학습 효율성을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.