Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforced Imitation in Heterogeneous Action Space

Konrad Żołna, Negar Rostamzadeh|arXiv (Cornell University)|2019. 04. 06.
Reinforcement Learning in Robotics참고 문헌 32인용 수 5
한 줄 요약

이 논문은 전문가의 동작이 제공되지 않으며 액션 스페이스가 다를 때에도 작동할 수 있도록, 희박한 환경 보상과 함께 복제 학습을 통합하는 방법인 관찰에서의 강화된 복제 학습(RILO)을 제안한다. 동적으로 복제 학습과 보상 목표를 균형 잡는 방식으로, 에이전트는 전문가의 시연를 뛰어넘는 성능을 보이며, 특히 이질적인 액션 스페이스에서 표준 상태 전용 복제 학습보다 더 효율적으로 학습한다.

ABSTRACT

Imitation learning is an effective alternative approach to learn a policy when the reward function is sparse. In this paper, we consider a challenging setting where an agent and an expert use different actions from each other. We assume that the agent has access to a sparse reward function and state-only expert observations. We propose a method which gradually balances between the imitation learning cost and the reinforcement learning objective. In addition, this method adapts the agent's policy based on either mimicking expert behavior or maximizing sparse reward. We show, through navigation scenarios, that (i) an agent is able to efficiently leverage sparse rewards to outperform standard state-only imitation learning, (ii) it can learn a policy even when its actions are different from the expert, and (iii) the performance of the agent is not bounded by that of the expert, due to the optimized usage of sparse rewards.

연구 동기 및 목표

  • 전문가의 동작이 제공되지 않으며 에이전트의 액션 스페이스가 전문가와 다를 경우 복제 학습의 과제를 해결한다.
  • 전문가로부터의 상태 관찰만 제공되고 보상이 희박한 환경에서 효율적인 정책 학습을 가능하게 한다.
  • 에이전트가 전문가 행동을 모방하는 것과 환경 보상 최적화 사이를 동적으로 전환할 수 있도록 한다.
  • 에이전트의 액션이 전문가와 정확히 일치하지 않더라도, 희박한 보상을 최적의 방식으로 활용함으로써 전문가 정책을 초월하는 성능을 달성한다.

제안 방법

  • 전문가의 동작 레이블이 필요 없이 전문가의 상태 관찰만으로 작동하는 GAIL을 확장한다.
  • 시간이 지남에 따라 복제 학습 손실과 강화 학습 손실을 자동으로 균형 잡는 자기 탐색 메커니즘을 도입한다.
  • 전체 상태 경로가 전문가의 것인지 에이전트가 생성한 것인지 구분하는 디스criminator를 사용하며, 오직 상태 관찰만을 기반으로 한다.
  • 다양한 보상 형식화 전략에 대한 성능 및 내구성을 평가하기 위해 여러 복제 학습 보상 형태(CSD, SSD, ATD, RTGD)를 적용한다.
  • 완전 관측 및 부분 관측 그리드 월드 환경, 3D 픽셀 기반 환경(ViZDoom)에서 에이전트를 훈련하며, 메모리가 필요한 경우 순환 정책을 사용한다.
  • 훈련 과정에서 복제 학습 손실 의존도를 점차 줄여가며, 에이전트가 복제에서 보상 최적화 행동으로 전환하도록 한다.

실험 결과

연구 질문

  • RQ1전문가의 상태 관찰만 제공되고 액션 스페이스가 다를 경우, 에이전트는 전문가의 시범을 넘어서는 정책을 학습할 수 있는가?
  • RQ2전문가의 동작 레이블이 없을 경우, 복제 학습을 어떻게 효과적으로 희박한 환경 보상과 조합할 수 있는가?
  • RQ3복제 학습과 강화 학습 목표 간의 동적 균형은 정적 복제 학습이나 순수한 강화 학습보다 더 나은 성능을 낼 수 있는가?
  • RQ4에이전트의 액션 스페이스가 전문가와 다를 경우에도, 희박한 보상을 활용하여 전문가 정책을 초월할 수 있는가?
  • RQ5이 방법은 완전 관측 대비 부분 관측, 픽셀 기반 환경 등 다양한 액션 스페이스 구성과 환경에서 일반화되는가?

주요 결과

  • 희박한 환경 보상을 활용함으로써 표준 상태 전용 복제 학습보다 더 빠른 수렴과 더 나은 최종 성능을 달성한다.
  • ViZDoom 3D 환경에서, 액션 스페이스가 크게 다를 경우, 자기 탐색 에이전트는 목표에 도달하는 평균 단계 수를 비자기 탐색 에이전트보다 최대 50% 감소시켰다.
  • 전문가와 동일한 액션 스페이스를 가진 에이전트(단일 액션)의 경우, 자기 탐색은 단계 수를 10% 감소시켰고, 더 능력 있는 에이전트(다중 액션)의 경우 개선률은 20%에 이르렀다.
  • 액션 스페이스가 다를 경우 자기 탐색과 비자기 탐색 에이전트 간의 성능 격차가 가장 커, 이는 이 방법이 이질적 환경에서 특히 효과적임을 보여준다.
  • 엄청난 양의 전문가 데이터가 제공될 경우, 상태 전용 복제 학습만으로도 자기 탐색 성능에 도달할 수 있었으며, 이는 자기 탐색이 전문가 데이터가 제한적일 때 가장 유익함을 확인한다.
  • CSD, SSD, ATD, RTGD 등 다양한 복제 학습 보상 형태에 대해 이 방법이 일반화되며, 특정 보상 형식화 전략에 관계없이 일관되고 안정적인 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.