Skip to main content
QUICK REVIEW

[논문 리뷰] Active Learning for Risk-Sensitive Inverse Reinforcement Learning

Rui Chen, Wenshuo Wang|arXiv (Cornell University)|2019. 09. 14.
Reinforcement Learning in Robotics참고 문헌 22인용 수 4
한 줄 요약

이 논문은 인간의 위험 선호도를 학습하는 데 있어 수렴 속도를 가속화하고 분산을 감소시키기 위해 정보성 있는 교란을 적응적으로 선택하는 위험 감수성 역강화학습(RS-IRL)을 위한 액티브 러닝 프레임워크를 제안한다. 확률 단체 위에서 향후 개선 방향을 계산함으로써 최적화 문제를 해결하지 않고도 높은 영향을 미치는 시범을 식별할 수 있으며, 이는 단일 및 다단계 설정 모두에서 표본 효율성을 크게 향상시킨다.

ABSTRACT

One typical assumption in inverse reinforcement learning (IRL) is that human experts act to optimize the expected utility of a stochastic cost with a fixed distribution. This assumption deviates from actual human behaviors under ambiguity. Risk-sensitive inverse reinforcement learning (RS-IRL) bridges such gap by assuming that humans act according to a random cost with respect to a set of subjectively distorted distributions instead of a fixed one. Such assumption provides the additional flexibility to model human's risk preferences, represented by a risk envelope, in safe-critical tasks. However, like other learning from demonstration techniques, RS-IRL could also suffer inefficient learning due to redundant demonstrations. Inspired by the concept of active learning, this research derives a probabilistic disturbance sampling scheme to enable an RS-IRL agent to query expert support that is likely to expose unrevealed boundaries of the expert's risk envelope. Experimental results confirm that our approach accelerates the convergence of RS-IRL algorithms with lower variance while still guaranteeing unbiased convergence.

연구 동기 및 목표

  • 중복된 전문가 시범으로 인한 RS-IRL의 느린 수렴 문제를 해결하기 위해.
  • 일관된 위험 측정과 위험 봉투를 사용하여 불확실성 하에서 인간의 위험 선호도를 모델링하기 위해.
  • 전문가의 위험 봉투 경계가 드러나지 않은 가능성이 높은 교란을 선택하는 액티브 러닝 기법을 개발하기 위해.
  • 각 단계에서 전체 최적화 문제를 해결하지 않고도 효율적이고 적응적인 전문가 시범 쿼리 방법을 제공하기 위해.
  • 위험 선호성과 위험 회피 행동을 보이는 참가자를 포함한 시뮬레이션된 차량 따라하기 작업에서 방법을 검증하기 위해.

제안 방법

  • 이 방법은 확률 단체 위에서 향후 개선 방향을 추정하는 확률적 교란 샘플링 기반의 방법을 도출하여 정보성 있는 교란을 식별한다.
  • 비용 함수를 모델링하기 위해 이차 특징 함수를 사용하며, 상대적 거리, 속도, 제어 노력 페널티를 포함한다.
  • 전문가 시범으로부터 반공간 제약 조건을 통해 위험 봉투를 추론하며, 액티브 러닝은 봉투 경계를 가장 잘 개선할 가능성이 높은 교란을 우선순위에 올린다.
  • 교란 실현은 전체 최적화를 피하기 위해 새로운 반공간 제약 조건을 생성할 잠재력을 계산하여 평가된다.
  • 연속적인 에피소드에서 순차적 단계에 걸쳐 교란을 분석함으로써 다단계 설정으로 일반화된다.
  • 시뮬레이션 및 분석을 위해 전문가 반응 시퀀스를 15개의 대표적 행동으로 이산화하기 위해 K-평균 클러스터링을 사용한다.

실험 결과

연구 질문

  • RQ1액티브 러닝은 정보성 있는 시범을 선택하여 위험 감수성 역강화학습의 표본 효율성을 향상시킬 수 있는가?
  • RQ2RS-IRL 에이전트는 전문가의 위험 봉투 경계를 가장 잘 개선할 가능성이 높은 교란을 어떻게 식별할 수 있는가?
  • RQ3제안된 액티브 러닝 기법은 무작위 또는 균일한 시범 샘플링과 비교해 분산을 줄이고 수렴 속도를 가속화하는가?
  • RQ4이 방법은 자율 주행과 같은 다단계 순차적 의사결정 과제로 일반화될 수 있는가?
  • RQ5위험 선호 또는 위험 회피 행동과 같은 위험 선호도는 정보성 있는 교란의 선택에 어떻게 영향을 미치는가?

주요 결과

  • 액티브 러닝 기법은 기준 방법과 비교해 반복 에피소드 동안 수렴 속도를 크게 향상시키고 분산을 낮춘다.
  • 이 방법은 성공적인 위험 봉투 개선을 이끌어내는 교란을 식별하며, 시뮬레이션의 25단계에서 위험 선호 참가자에 대해 주요 제약 조건을 생성한다.
  • 25단계에서 가속 조작의 액티브 러닝 샘플링 확률은 0.4227로 전문가의 위험 선호도와 일치한다.
  • 25단계에서의 교란 샘플링 확률 분포 p = [0.3802, 0.4227, 0.1971]는 전문가의 위험 봉투를 가장 잘 드러내는 조작을 우선시한다.
  • 이 방법은 각 단계에서 전체 최적화 문제를 해결하지 않고도 위험 봉투를 효율적으로 추론할 수 있으며, 대신 개선 방향 추정에 의존한다.
  • 실험 결과는 부정확한 수렴을 방지하면서 중복된 시범을 줄임으로써 안전이 중요한 설정에서 이 방법의 효과성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.