Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Exploration of Reward Functions in Inverse Reinforcement Learning via Bayesian Optimization

Sreejith Balakrishnan, Quoc Phong Nguyen|arXiv (Cornell University)|2020. 11. 17.
Reinforcement Learning in Robotics참고 문헌 36인용 수 7
한 줄 요약

이 논문은 정책 불변성을 다루기 위해 새로운 $ρ$-투영을 도입함으로써 보상 함수 공간을 효율적으로 탐색하는 베이지안 최적화 프레임워크인 BO-IRL을 제안한다. 동일한 보상 함수를 한 점으로 매핑함으로써 잠재 공간에서의 구조적 불변성을 유지함으로써, 표준 정적 커널의 효과적인 사용이 가능해져 비용이 많이 드는 정책 최적화를 줄이고, 높은 샘플 효율성으로 다수의 일관된 보상 함수를 발견할 수 있다.

ABSTRACT

The problem of inverse reinforcement learning (IRL) is relevant to a variety of tasks including value alignment and robot learning from demonstration. Despite significant algorithmic contributions in recent years, IRL remains an ill-posed problem at its core; multiple reward functions coincide with the observed behavior and the actual reward function is not identifiable without prior knowledge or supplementary information. This paper presents an IRL framework called Bayesian optimization-IRL (BO-IRL) which identifies multiple solutions that are consistent with the expert demonstrations by efficiently exploring the reward function space. BO-IRL achieves this by utilizing Bayesian Optimization along with our newly proposed kernel that (a) projects the parameters of policy invariant reward functions to a single point in a latent space and (b) ensures nearby points in the latent space correspond to reward functions yielding similar likelihoods. This projection allows the use of standard stationary kernels in the latent space to capture the correlations present across the reward function space. Empirical results on synthetic and real-world environments (model-free and model-based) show that BO-IRL discovers multiple reward functions while minimizing the number of expensive exact policy optimizations.

연구 동기 및 목표

  • 다양한 보상 함수가 동일한 전문가 행동을 생성할 수 있는 IRL의 불안정한 성질을 해결하기 위해.
  • 정확한 정책 최적화의 계산 비용을 줄이기 위해 베이지안 최적화를 활용하기 위해.
  • 새로운 커널을 사용해 보상 함수 간의 상관관계를 모델링함으로써 보상 함수 공간의 효율적 탐색을 가능하게 하기 위해.
  • 단일 해로 수렴하는 것이 아니라, 다수의 타당한 보상 함수를 발견하는 방법을 제공하기 위해.
  • 보상 함수에 대한 가우시안 프로세스 사후분포를 통해 불확실성 추정을 제공함으로써 후속 분석을 지원하기 위해.

제안 방법

  • 정책 불변성 보상 함수를 잠재 공간의 단일 점으로 매핑하는 $ρ$-투영을 도입하여 구조적 불변성을 유지한다.
  • 유사한 가능도를 가진 보상 함수 간의 상관관계를 모델링하기 위해 잠재 공간을 활용한 $ρ$-RBF 커널을 설계한다.
  • 전문가 시연의 음의 로그우도(NLL)를 최소화하기 위해 베이지안 최적화를 적용하고, NLL 표면을 가우시안 프로세스로 모델링한다.
  • GP 사후분포를 사용해 NLL의 불확실성을 추정함으로써, 활동적 학습과 후보 보상 함수의 반복적 개선을 가능하게 한다.
  • 필요한 경우에만 정책 최적화 서브루틴을 사용하여, 유망한 보상 함수 파라미터를 전략적으로 선택함으로써 비용이 많이 드는 평가를 최소화한다.
  • 합성 및 실제 환경(모델 기반 및 모델리스 설정 포함)에서 방법을 검증하여 샘플 효율성과 강건성을 입증한다.

실험 결과

연구 질문

  • RQ1비정적 및 정책 불변성 보상 함수 공간의 도전 과제에도 불구하고, 베이지안 최적화가 IRL에 효과적으로 적용될 수 있는가?
  • RQ2다른 보상 함수가 동일한 최적 정책을 생성하는 정책 불변성은 어떻게 모델링할 수 있으며, 이를 통해 보상 함수 공간에서 커널 기반 일반화가 향상될 수 있는가?
  • RQ3학습된 잠재 표현을 통해 $ρ$-투영을 사용하면, 표준 정적 커널(예: RBF)이 표준 커널보다 보상 함수 상관관계를 더 효과적으로 포착할 수 있는가?
  • RQ4BO-IRL은 최신 IRL 방법에 비해 얼마나 많은 비용이 많이 드는 정책 최적화 호출 횟수를 줄일 수 있는가?
  • RQ5BO-IRL은 다양한 환경에서 전문가 행동을 설명할 수 있는 다수의 일관된 보상 함수를 얼마나 잘 발견할 수 있는가?

주요 결과

  • BO-IRL는 $ρ$-RBF 커널을 사용해 격자 환경에서 16.0 ± 15.6회 반복만으로 70%의 성공률를 기록했으며, 표준 RBF 커널 대비 50% 성공률(30.0 ± 34.4회 반복)에 비해 뚜렷한 성능 향상을 보였다.
  • Börlange 도로 네트워크에서는 BO-IRL이 단지 2.0 ± 1.1회 반복만으로 100% 성공률를 달성했고, RBF 커널 대비 80% 성공률(9.5 ± 6.3회 반복)을 기록했다.
  • BO-IRL는 이산 및 연속 제어 작업, 특히 Fetch-Reach 환경에서 전문가 시연와 일관된 다수의 보상 함수를 발견했다.
  • 불확실성 인식 베이지안 최적화를 활용해 정확한 정책 최적화 횟수를 줄였으며, 샘플 효율성에서 BIRL, AIRL, GCL을 모두 능가했다.
  • 실험 결과, 표준 커널은 정책 불변성으로 인해 보상 함수 상관관계를 포착하지 못하는 반면, $ρ$-RBF 커널은 이러한 구조를 효과적으로 모델링함을 입증했다.
  • Fetch-Reach 작업에서 BO-IRL는 제90회 반복에 거리 임계값이 큰 보상 함수(파란 구)를 식별했으며, 이는 의미 있는 행동 일관성 있는 해를 발견할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.