Skip to main content
QUICK REVIEW

[논문 리뷰] Inverse Reinforcement Learning with Multiple Ranked Experts

Pablo Samuel Castro, Shijian Li|arXiv (Cornell University)|2019. 07. 31.
Transportation and Mobility Innovations참고 문헌 14인용 수 8
한 줄 요약

이 논문은 성능 수준 간의 순서형 선호도를 모델링함으로써 더 완전하고 강건한 보상 함수를 복원하기 위해 다수의 순위가 매겨진 전문가 및 비전문가를 활용하는 새로운 역강화학습 방법을 제안한다. 문제를 마진 최대화 순서형 회귀로 공식화함으로써, 이 방법은 최적의 행동뿐만 아니라 낮은 순위의 시연자로부터의 부정적 행동까지 포착하여 도시 택시 주행과 같은 복잡한 환경에서 더 정확하고 일반화 능력이 뛰어난 정책을 도출한다.

ABSTRACT

We consider the problem of learning to behave optimally in a Markov Decision Process when a reward function is not specified, but instead we have access to a set of demonstrators of varying performance. We assume the demonstrators are classified into one of k ranks, and use ideas from ordinal regression to find a reward function that maximizes the margin between the different ranks. This approach is based on the idea that agents should not only learn how to behave from experts, but also how not to behave from non-experts. We show there are MDPs where important differences in the reward function would be hidden from existing algorithms by the behaviour of the expert. Our method is particularly useful for problems where we have access to a large set of agent behaviours with varying degrees of expertise (such as through GPS or cellphones). We highlight the differences between our approach and existing methods using a simple grid domain and demonstrate its efficacy on determining passenger-finding strategies for taxi drivers, using a large dataset of GPS trajectories.

연구 동기 및 목표

  • 기존의 역강화학습 방법이 전적으로 전문가 시연에 의존하여 진정한 보상 함수의 핵심 요소를 놓칠 수 있는 한계를 해결하기 위해.
  • 비전문가로부터의 행동 피드백을 통합함으로써 정책 학습을 향상시켜 에이전트가 무엇을 해야 할지 뿐 아니라 무엇을 해서는 안 될지도 학습할 수 있도록 하기 위해.
  • 성능 순위를 순서형 클래스로 모델링하고 마진 최대화를 통해 보상 함수 복원에 대해 안정적이고 비퇴화된 해를 도출하기 위해.
  • 실제 GPS 궤적 데이터와 성과 순위를 활용하여 택시 기사의 세밀한, 데이터 기반의 승객 찾기 전략을 가능하게 하기 위해.
  • 전문가가 특정 영역을 피하는 환경에서 단일 전문가 IRL의 한계를 극복하여 전문가가 자주 방문하지 않는 영역까지도 커버할 수 있도록 하기 위해.

제안 방법

  • 이 방법은 시연자의 순위를 순서형 클래스로 모델링하여 각 순위를 마진 기반 분류기로 구분할 수 있는 성능 수준으로 간주한다.
  • 보상 함수 복원 문제를 각 인접한 성능 순위 간의 마진을 최대화하는 볼록 최적화 문제로 공식화하며, 각 시연자로부터의 기대 특징 벡터를 사용한다.
  • 오차 변수(ε 및 ζ)를 포함하여 잘못 순위가 매겨진 시연자에 대비하고 노이즈 또는 잘못된 순위에 대한 강건성을 확보한다.
  • 해결책은 보상 함수를 정의하는 가중치 벡터 w이며, 이는 환경의 MDP 표현(예: 도로 네트워크)에 대해 가치 함수를 계산하는 데 사용된다.
  • 각 단계에서 정책 평가가 필요한 방법들과는 달리, 이 방법은 기대 특징 통계 자료에 의존하기 때문에 반복적인 MDP 해법이 필요 없어 계산적으로 효율적이다.
  • 오차 값이 높은 시연자(즉, 잠재적인 순위 오류가 있는 시연자)를 식별하고 제거함으로써 시연자 집합을 개선하기 위한 증분 또는 잘라내기 기반 전략을 지원한다.

실험 결과

연구 질문

  • RQ1비전문가의 행동을 통합함으로써 전문가 전용 IRL에 비해 더 완전하고 정확한 보상 함수 복원이 가능할까?
  • RQ2마진 최대화를 통해 성능 순위를 순서형 클래스로 모델링하면 기존 IRL 방법보다 더 안정적이고 비퇴화된 해를 도출할 수 있을까?
  • RQ3이 방법은 전문가 관찰 시에 놓치는 보상 함수의 숨겨진 부정적 요소를 드러낼 수 있을까?
  • RQ4이 방법은 GPS 궤적 데이터로부터 택시 기사의 최적의 승객 찾기 전략을 학습하는 데 실생활 주행 작업에서 얼마나 효과적인가?
  • RQ5낮은 순위의 기사들의 행동에서 학습함으로써 전문가가 자주 방문하지 않는 영역으로도 일반화가 가능할까?

주요 결과

  • 이 방법은 전문가가 이들 영역에서 기대 특징이 낮았음에도 불구하고 공항, 버스 터미널, 병원과 같은 고수요 승객 탑승지역을 성공적으로 식별했다.
  • 전문가가 피하는 산악 지역과 같이 수요가 낮은 저수익 지역은 비전문가 행동을 바탕으로 정확히 식별했으며, 이는 전문가가 이러한 지역을 피하는 경향이 있음에도 불구하고 성립한다.
  • 알고리즘은 도심 지역에 대해 낮은 가치를 할당하는 가치 함수를 생성했으며, 이는 이전 연구에서 최고 수준의 기사들이 장기적인 성과를 위해 고밀도, 고교통 지역을 피한다는 점과 일치한다.
  • 비전문가로부터 학습함으로써 이 방법은 전문가 전용 접근 방식이 자주 탐색하지 않는 큰 지역을 포함하여 도시 전역에 걸쳐 더 넓은 공간 커버리지를 달성했다.
  • 오차 변수의 사용을 통해 잘못 순위가 매겨진 시연자를 탐지할 수 있었으며, 이러한 이상치를 잘라내는 것으로 학습된 보상 함수의 품질이 크게 향상되었다.
  • 최종로 도출된 정책은 전통적인 루트 찾기 알고리즘보다 더 세밀한 해상도로 택시 기사에게 실행 가능한 세밀한 내비게이션 전략을 제공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.