Skip to main content
QUICK REVIEW

[논문 리뷰] Active Inverse Reward Design

Sören Mindermann, Rohin Shah|arXiv (Cornell University)|2018. 09. 09.
Reinforcement Learning in Robotics참고 문헌 23인용 수 7
한 줄 요약

이 논문은 주어진 최종 대체 보상 외에 하위 최적의 보상 함수를 비교하는 정보성 있는 질의를 적극적으로 선택함으로써 보상 추론을 향상시키는 Active Inverse Reward Design (AIRD)을 제안한다. 각 설계자 선택 이후 Inverse Reward Design (IRD)을 사용해 신뢰도를 갱신함으로써, AIRD는 해석 가능한 선형 특징을 사용하는 질의에서도 비선형 진정 보상 함수를 추론할 수 있으며, 기존의 단순 IRD에 비해 테스트 환경에서 유의미하게 감소한 회귀를 달성한다.

ABSTRACT

Designers of AI agents often iterate on the reward function in a trial-and-error process until they get the desired behavior, but this only guarantees good behavior in the training environment. We propose structuring this process as a series of queries asking the user to compare between different reward functions. Thus we can actively select queries for maximum informativeness about the true reward. In contrast to approaches asking the designer for optimal behavior, this allows us to gather additional information by eliciting preferences between suboptimal behaviors. After each query, we need to update the posterior over the true reward function from observing the proxy reward function chosen by the designer. The recently proposed Inverse Reward Design (IRD) enables this. Our approach substantially outperforms IRD in test environments. In particular, it can query the designer about interpretable, linear reward functions and still infer non-linear ones.

연구 동기 및 목표

  • 역보상 설계(IRD)의 한계를 해결하기 위해, 최종 대체 보상만을 사용하고 하위 최적 행동에 대한 선호도를 추론하지 못하는 문제를 해결한다.
  • 순차적 의사결정에서 보상 추론을 향상시키기 위해 설계 과정을 적극적인 질의 시퀀스로 구조화한다.
  • 해석 가능한 선형 보상 특징에 대한 질의를 통해 비선형 진정 보상 함수를 추론할 수 있도록 한다.
  • 적극적인 질의 선택을 통해 단순 IRD보다 더 정보성 있는 피드백을 확보함으로써 테스트 시간 회귀를 감소시킨다.
  • 인간-모델 선호도를 시뮬레이션한 환경에서 방법을 평가하여, IRD에 비해 뛰어난 성능을 입증한다.

제안 방법

  • AIRD는 각 질의가 설계자에게 비교할 수 있는 소수의 후보 보상 함수를 제시하는 방식으로 보상 설계를 질의 시퀀스로 구조화한다.
  • 각 설계자 선택 이후 Inverse Reward Design (IRD)을 사용해 진정 보상 함수에 대한 사후 분포를 갱신한다.
  • 질의는 진정 보상에 대한 정보량을 최대화하도록 베이지안 적 활성 학습 방법을 사용해 적극적으로 선택된다.
  • 두 가지 유형의 질의를 도입한다: 이산 질의(보상 함수 N개 비교)와 특징 질의(기타 특징의 가중치를 고정한 상태에서 일부 특징의 가중치 설정 요청).
  • 특징 질의는 보상 공간의 구조를 활용하여 궤도 평가 없이도 저수준 보상 선호도를 추론할 수 있도록 한다.
  • 질의 설계를 최적화하여 정보량을 극대화함으로써, 단순한 고수준 특징 비교에서 복잡한 비선형 보상 함수를 추론할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1최종 대체 보상에만 의존하는 것보다, 보상 함수 비교를 적극적으로 선택함으로써 더 나은 보상 추론이 가능할 수 있는가?
  • RQ2최적 행동만으로는 확보할 수 없는 정보를 하위 최적 보상 간 비교가 진정 보상에 대한 정보로 제공할 수 있는가?
  • RQ3해석 가능한 선형 특징 질의로도 복잡한 환경에서 비선형 보상 함수를 추론할 수 있는가?
  • RQ4적극적인 질의 선택은 단순 IRD에 비해 테스트 시간 회귀를 감소시키는가?
  • RQ5특징 질의는 사용성은 유지하면서 저수준 보상 선호도의 효율적 추론을 가능하게 하는가?

주요 결과

  • AIRD는 기존의 단순 IRD에 비해 테스트 시간 회귀를 유의미하게 감소시키며, 종종 진정 보상 함수를 완전히 복원한다.
  • 하위 최적 보상 간 선호도를 질의함으로써, 최종 대체 보상이 포괄하지 못한 특징에 대한 선호도를 추론할 수 있으며, 예를 들어 적안 비행 페널티와 같은 사례를 포함한다.
  • 질의에 해석 가능한 선형 보상 특징을 사용하더라도 AIRD는 비선형 진정 보상 함수를 성공적으로 추론한다.
  • 특징 질의를 통해 사용자는 궤도 평가 없이도 고수준 보상 가중치를 조정할 수 있어 사용성과 확장성 향상이 가능하다.
  • 비행 예약 및 2D 탐색 도메인에서 시뮬레이션된 인간 모델 하에서 AIRD는 IRD를 능가하는 성능을 보였다.
  • 적극적인 질의 선택은 피드백의 효율성과 정보성 측면에서 수동적 최종 보상 선택보다 뛰어난 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.