Skip to main content
QUICK REVIEW

[논문 리뷰] Identifiability in inverse reinforcement learning

Haoyang Cao, Samuel N. Cohen|arXiv (Cornell University)|2021. 06. 07.
Reinforcement Learning in Robotics참고 문헌 23인용 수 5
한 줄 요약

이 논문은 엔트로피 정규화를 통해, 두 가지 다른 할인 인자 또는 충분히 다를 만한 환경에서 최적 정책을 관측할 경우, 비정규화된 보상 함수가 상수 이동까지 유일하게 복원될 수 있음을 보여줌으로써, 역강화학습(IRL)에서의 비정규화 문제를 해결한다. 핵심 통찰은 가치 함수와 정책이 일관된 보상의 공간을 매개변수화한다는 것이며, 이는 다수의 행동 관측 자료가 가용할 경우 복원이 가능함을 의미한다.

ABSTRACT

Inverse reinforcement learning attempts to reconstruct the reward function in a Markov decision problem, using observations of agent actions. As already observed in Russell [1998] the problem is ill-posed, and the reward function is not identifiable, even under the presence of perfect information about optimal behavior. We provide a resolution to this non-identifiability for problems with entropy regularization. For a given environment, we fully characterize the reward functions leading to a given policy and demonstrate that, given demonstrations of actions for the same reward under two distinct discount factors, or under sufficiently different environments, the unobserved reward can be recovered up to a constant. We also give general necessary and sufficient conditions for reconstruction of time-homogeneous rewards on finite horizons, and for action-independent rewards, generalizing recent results of Kim et al. [2021] and Fu et al. [2018].

연구 동기 및 목표

  • 역강화학습에서 동일한 최적 정책을 생성할 수 있는 다수의 보상 함수가 존재하는 기본적인 정규화 문제를 해결하기 위해.
  • 엔트로피 정규화된 마르코프 결정 과정(MDP)에서 주어진 최적 정책과 일치하는 보상 함수의 전체 공간을 특성화하기 위해.
  • 다른 환경 또는 할인 인자에서 행동 데이터로부터 진짜 보상이 상수 이동까지 유일하게 복원될 수 있는 조건을 설정하기 위해.
  • 기존의 시간 동질성과 행동 독립성 보상에 대한 결과를 일반화하여, Kim 등(2021)과 Fu 등(2018)의 결과를 확장하기 위해.
  • 보상 모호성의 형식적 특성화를 통해 즉각적 보상과 향후 보상의 영향을 정책 행동에서 분리하기 위해.

제안 방법

  • 저자들은 역학습 문제의 안정성과 정규화 개선을 위해 엔트로피 정규화된 마르코프 결정 과정(MDP)을 사용한다.
  • 주어진 최적 정책을 유도하는 모든 보상 함수의 매개변수화를 도출하여, 이 공간이 제어 문제의 가치 함수에 의해 완전히 결정됨을 보여준다.
  • 이 방법은 엔트로피 정규화된 설정에서 벨먼 방정식을 통해 최적 정책, 가치 함수, 보상 간의 관계를 활용한다.
  • 두 가지 다른 할인 인자(예: γ₁ = 0.95 및 γ₂ = 0.25)에서 최적 정책을 관측함으로써, 진짜 보상 함수가 상수 이동까지 유일하게 복원됨을 보였다.
  • 다양한 환경 또는 할인율에서 정책 예측 오차를 동시에 최소화하는 손실 함수를 사용하여, 최적화 기반의 보상 복원을 가능하게 한다.
  • 수치 실험을 통해 Adam 최적화를 사용하고, 보상 및 가치 함수 추정치의 ℓ₂ 오차를 통해 복원 정확도를 평가하였다.

실험 결과

연구 질문

  • RQ1역강화학습에서 관측된 최적 정책이 있을 경우, 문제 자체가 본질적으로 불안정하더라도 진짜 보상 함수가 고유하게 식별될 수 있는가?
  • RQ2엔트로피 정규화는 마르코프 결정 과정에서 보상의 정규화에 어떤 영향을 미치는가?
  • RQ3여러 개의 최적 정책이 서로 다른 할인 인자에서 관측될 경우, 보상이 상수 이동까지 복원될 수 있는 조건은 무엇인가?
  • RQ4유한 수평 MDP에서 시간 동질성과 행동 독립성 보상을 식별하기 위한 일반적인 필수 및 충분 조건은 무엇인가?
  • RQ5정책이 주어졌을 때 가치 함수가 보상 함수 복원을 위한 충분통계량으로 얼마나 잘 작용하는가?

주요 결과

  • 단일 할인 인자에서 최적 정책의 정확한 지식이 있을 경우, 보상 함수는 여전히 비정규화되지만, 일치하는 보상의 집합은 가치 함수에 의해 완전히 매개변수화된다.
  • 두 개의 서로 다른 할인 인자(예: γ₁ = 0.95 및 γ₂ = 0.25)에서 최적 정책을 관측할 경우, 진짜 보상 함수가 상수 이동까지 유일하게 복원될 수 있다.
  • 수치 실험 결과, 두 개의 정책을 사용할 경우 학습 손실이 거의 0에 수렴하며, 단일 정책을 사용할 경우보다 보상 복원의 ℓ₂ 오차가 약 10배 작아진다.
  • 학습된 보상 행렬은 진짜 보상과 매우 유사하며, 그 차이는 그림 6에서 보듯이 크기로 약 10⁻¹ 수준이다.
  • 다중 정책을 사용할 경우 가치 함수 추정 오차도 크게 감소하여, 그림 7에서 γ₁ 및 γ₂에 대해 ℓ₂ 오차가 약 10⁻³ 수준이 된다.
  • 이 방법은 두 할인율 모두에서 진짜 최적 정책에 매우 가까운 정책을 성공적으로 복원하였으며, 차이는 약 10⁻³ 수준으로 나타나 보상 복원의 정확성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.