Skip to main content
QUICK REVIEW

[논문 리뷰] Inverse Reinforcement Learning with the Average Reward Criterion

Feiyang Wu, Jingyang Ke|arXiv (Cornell University)|2023. 05. 24.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 평균 보상 기준을 사용하는 새로운 역강화학습 프레임워크를 제안하며, 평균 보상 MDP를 해결하기 위한 스토하스틱 정책 미러 강하(SPMD)와 IRL을 위한 역정책 미러 강하(IPMD)를 도입한다. SPMD는 $Ó(1/\varepsilon)$ 수렴성을 보이고, IPMD는 $Ó(1/\varepsilon^2)$ 수렴성을 보이며, 일반 함수 근사가 가능한 평균 보상 설정에서 IRL에 대한 최초의 유한 시간 수렴 분석을 제공한다.

ABSTRACT

We study the problem of Inverse Reinforcement Learning (IRL) with an average-reward criterion. The goal is to recover an unknown policy and a reward function when the agent only has samples of states and actions from an experienced agent. Previous IRL methods assume that the expert is trained in a discounted environment, and the discount factor is known. This work alleviates this assumption by proposing an average-reward framework with efficient learning algorithms. We develop novel stochastic first-order methods to solve the IRL problem under the average-reward setting, which requires solving an Average-reward Markov Decision Process (AMDP) as a subproblem. To solve the subproblem, we develop a Stochastic Policy Mirror Descent (SPMD) method under general state and action spaces that needs $\mathcal{O}(1/\varepsilon)$ steps of gradient computation. Equipped with SPMD, we propose the Inverse Policy Mirror Descent (IPMD) method for solving the IRL problem with a $\mathcal{O}(1/\varepsilon^2)$ complexity. To the best of our knowledge, the aforementioned complexity results are new in IRL. Finally, we corroborate our analysis with numerical experiments using the MuJoCo benchmark and additional control tasks.

연구 동기 및 목표

  • 할인율이 알려져 있는 할인 MDP 기반의 기존 IRL 방법들이 가지는 한계를 해결하기 위해.
  • 장기적이고 정적 행동을 더 잘 모델링하는 평균 보상 기준 하에서 역강화학습의 이론적 프레임워크를 개발하기 위해.
  • 특히 일반 상태 및 행동 공간에서 평균 보상 설정 하에서 IRL 알고리즘의 유한 시간 수렴 보장을 제공하기 위해.
  • 최대 엔트로피 원리를 통합하여 보상 복원의 모호함을 해소하기 위해.
  • 증명 가능하고 수렴 속도가 보장된 1차 수준의 확률적 최적화 방법을 통해 효율적이고 확장 가능한 IRL을 가능하게 하기 위해.

제안 방법

  • 일반 상태 및 행동 공간에서 비선형 함수 근사를 사용하는 평균 보상 MDP(AMDP)를 해결하기 위한 1차 방법인 스토하스틱 정책 미러 강하(SPMD)를 도입한다.
  • 성능 차이 보조정을 통해 수렴 경계를 확립하며, 특정 함수 클래스에 대해서는 $Ó(1/\varepsilon)$ 단계, 일반 함수 근사에 대해서는 $Ó(1/\varepsilon^2)$ 단계를 보여준다.
  • 최대 엔트로피 IRL의 이중 형식인 역정책 미러 강하(IPMD)를 제안하며, 전문가와 에이전트의 평균 보상 간의 격리 최소화를 목표로 한다.
  • SPMD가 각 반복에서 내부의 엔트로피 정규화된 RL 문제를 해결하도록, 이중 시간 척도의 확률적 근사 프레임워크를 사용하여 IPMD를 분석한다.
  • 예측 보상의 노름에 대한 $Ó(\cdot)$ 표기법과 안정성 항목인 $\nu$ 및 $C_d$를 활용하여 기울기 오차 경계를 설정한다.
  • 학습 중 목적 함수의 폭주를 방지하기 위해 예측 보상의 0.05배 노름을 정규화 항으로 통합한다.
Figure 1: Reward recovery performance of IPMD and IQ-Learn. The lower the bar, the better the performance.
Figure 1: Reward recovery performance of IPMD and IQ-Learn. The lower the bar, the better the performance.

실험 결과

연구 질문

  • RQ1일반 함수 근사가 가능한 경우, 평균 보상 기준 하에서 역강화학습에 대한 유한 시간 수렴 분석을 개발할 수 있는가?
  • RQ2스토하스틱 1차 방법을 사용해 IRL의 기본 AMDP 하위 문제를 효율적으로 해결할 수 있는가?
  • RQ3최대 엔트로피 정규화가 적용된 평균 보상 설정 하에서 1차 IRL 알고리즘의 수렴 속도는 무엇인가?
  • RQ4SPMD는 비선형 함수 근사를 사용한 AMDP에서 $Ó(1/\varepsilon)$ 수렴성을 달성할 수 있으며, 일반적인 경우 $Ó(1/\varepsilon^2)$ 수렴성을 보일 수 있는가?
  • RQ5제안된 IPMD 방법은 보상 복원 정확도와 샘플 효율성 측면에서 최신 기술 대비 어떻게 비교되는가?

주요 결과

  • SPMD 알고리즘은 AMDP를 해결하는 데 있어 특정 비선형 함수 근사기법에 대해 $Ó(1/\varepsilon)$ 수렴성을 보인다.
  • 일반 함수 근사에 대해서는 SPMD가 $Ó(1/\varepsilon^2)$ 단계 내에 수렴하며, 이는 AMDP에서 스토하스틱 정책 최적화에 대한 새로운 이론적 경계를 확립한다.
  • 평균 보상 기준 하에서 IRL을 위한 IPMD 알고리즘은 $Ó(1/\varepsilon^2)$ 수렴 속도를 보이며, 이는 이 설정에서 최초의 유한 시간 수렴 분석이다.
  • MuJoCo 벤치마크에서의 수치 실험 결과, IPMD는 최신 기술 대비 보상 복원에서 뛰어난 성능을 보이며 오차를 크게 감소시킨다.
  • 제안된 알고리즘들은 제어 과제 전반에서 안정적인 학습과 기존 GAN 기반 및 샘플 기반 IRL 방법 대비 향상된 샘플 효율성을 보이며 뛰어난 성능을 유지한다.
  • 보상 함수에 작은 L2 정규화를 통합함으로써 목적 함수의 폭주를 방지하고 학습 안정성을 유지하며, 이는 이론적 수렴에 영향을 주지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.