[논문 리뷰] f-IRL: Inverse Reinforcement Learning via State Marginal Matching
f-IRL는 에이전트의 상태 분포와 전문가의 상태 분포 사이의 f-divergence를 최소화함으로써 분석적 기울기 계산을 통해 정적 보상 함수를 학습하는 새로운 역강화학습 방법을 제안한다. 이는 우수한 샘플 효율성을 달성하며, MuJoCo 벤치마크에서 적대적 일관성 학습 방법들을 능가하여 효과적인 행동 전이와 빠른 후행 정책 학습을 가능하게 한다.
Imitation learning is well-suited for robotic tasks where it is difficult to directly program the behavior or specify a cost for optimal control. In this work, we propose a method for learning the reward function (and the corresponding policy) to match the expert state density. Our main result is the analytic gradient of any f-divergence between the agent and expert state distribution w.r.t. reward parameters. Based on the derived gradient, we present an algorithm, f-IRL, that recovers a stationary reward function from the expert density by gradient descent. We show that f-IRL can learn behaviors from a hand-designed target state density or implicitly through expert observations. Our method outperforms adversarial imitation learning methods in terms of sample efficiency and the required number of expert trajectories on IRL benchmarks. Moreover, we show that the recovered reward function can be used to quickly solve downstream tasks, and empirically demonstrate its utility on hard-to-explore tasks and for behavior transfer across changes in dynamics.
연구 동기 및 목표
- 일관성 학습에서 전문가의 상태 분포로부터 정적 보상 함수를 학습하는 데 도전 과제를 해결하기 위해.
- 제한된 전문가 트레이젝터리가 있는 경우에도 역강화학습의 샘플 효율성을 향상시키기 위해.
- 회복된 보상 함수를 사용하여 동역학 변화가 있는 상황에서도 행동 전이를 가능하게 하기 위해.
- 전문가의 시연 또는 직접 지정된 목표 상태 밀도 중 어느 것을 사용하여도 통합된 프레임워크를 제공하기 위해.
- 이전의 적대적 일관성 학습 방법에 비해 하이퍼파rameter 민감도를 감소시키기 위해.
제안 방법
- 이 방법은 에이전트의 상태 분포와 전문가의 상태 분포 사이의 f-divergence에 대한 보상 파라미터에 대한 분석적 기울기를 유도한다.
- 역강화학습을 궤적 또는 상태-행동 분포가 아닌 상태 마진 분포 간의 f-divergence 최적화 문제로 재정의한다.
- f-IRL는 f-divergence를 최소화하기 위해 경사 하강법을 사용하여 보상 함수의 엔드 투 엔드 학습을 가능하게 한다.
- 이 방법은 정방향 및 역방향 f-divergence를 모두 지원하여 선택에 따라 모드 탐색 또는 모드 커버리지 행동을 가능하게 한다.
- 비정규화된 밀도 지정을 지원하여 선호도 표현 및 목표 밀도 정의를 단순화한다.
- 이 방법은 정책을 다시 학습할 수 있도록 재사용 가능한 정적 보상 함수를 회복하도록 설계되어 있다.
실험 결과
연구 질문
- RQ1f-divergence의 분석적 기울기를 사용하여 전문가의 상태 분포에서 정적 보상 함수를 학습할 수 있는가?
- RQ2f-IRL는 GAIL 및 AIRL와 같은 적대적 일관성 학습 방법에 비해 샘플 효율성이 뛰어나게 되는가?
- RQ3회복된 보상 함수는 탐색이 어려운, 보상이 희박한 환경에서 학습을 가속화할 수 있는가?
- RQ4동일한 보상 함수를 로봇 형태 변화와 같은 동역학 변화가 있는 상황에서도 전이할 수 있는가?
- RQ5f-IRL는 이전의 IRL 방법에 비해 하이퍼파rameter 조정이 더 적게 필요한가?
주요 결과
- f-IRL는 MuJoCo 벤치마크에서 환경 상호작용 단계 수와 전문가 트레이젝터리 수 측면에서 GAIL, AIRL, MaxEntIRL보다 더 뛰어난 샘플 효율성을 달성한다.
- 50개의 전문가 트레이젝터리가 있는 Ant 환경에서 f-IRL는 보상 145.5를 기록했으며, AIRL(-29.9)과 MaxEntIRL(130.3)을 모두 능가했다.
- 이 방법은 장애를 가진 Ant 에이전트에서 걷기 정책을 성공적으로 학습하여 동역학 변화에 따른 효과적인 행동 전이를 보였다.
- 포인트매스 목표 도달 작업에서 f-IRL는 기대하는 모드 커버리지(정방향 KL) 및 모드 탐색(역방향 KL) 행동을 보이는 보상을 학습했다.
- f-IRL는 모든 MuJoCo 작업에서 최소한의 하이퍼파rameter 조정으로 성능을 유지했으며, f-MAX 및 AIRL와 같은 민감한 기준 모델들과는 대조적으로 그러한 민감도가 없었다.
- 회복된 보상 함수는 희박한 보상 작업에서 정책 학습을 더 빠르게 가능하게 하여 후행 정책 학습에 실용성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.