Skip to main content
QUICK REVIEW

[논문 리뷰] Interpretable Preference-based Reinforcement Learning with Tree-Structured Reward Functions

Tom Bewley, Freddy Lécué|arXiv (Cornell University)|2021. 12. 20.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 인간 피드백으로부터 내재적으로 해석 가능한 트리 구조의 보상 함수를 구성하는 온라인, 능동형 선호 기반 강화학습 알고리즘을 제안한다. 상태-행동 공간을 계층적으로 분해하여 상호 배타적인 구성 요소로 나누고, 상한 신뢰도 기반(UCB)을 사용해 점진적으로 개선함으로써, 샘플 효율적인 학습과 정렬 디버깅을 위한 향상된 해석 가능성 기반의 학습을 가능하게 하였다. 이는 합성 및 인간 피드백을 모두 사용한 네 가지 환경에서 입증되었다.

ABSTRACT

The potential of reinforcement learning (RL) to deliver aligned and performant agents is partially bottlenecked by the reward engineering problem. One alternative to heuristic trial-and-error is preference-based RL (PbRL), where a reward function is inferred from sparse human feedback. However, prior PbRL methods lack interpretability of the learned reward structure, which hampers the ability to assess robustness and alignment. We propose an online, active preference learning algorithm that constructs reward functions with the intrinsically interpretable, compositional structure of a tree. Using both synthetic and human-provided feedback, we demonstrate sample-efficient learning of tree-structured reward functions in several environments, then harness the enhanced interpretability to explore and debug for alignment.

연구 동기 및 목표

  • 이전 방법이 투명한 신경망을 사용함으로써 선호 기반 강화학습에서의 해석 가능성 격차를 해결하기 위해.
  • 정렬 평가 및 디버깅을 지원하는 강력하고 인간이 읽을 수 있는 보상 함수 구조를 가능하게 하기 위해.
  • 인간의 선호 피드백을 사용하여 점진적으로 트리 구조의 보상 함수를 구축하고 개선하는 능동 학습 알고리즘을 개발하기 위해.
  • 다양한 환경에서 오프라인 및 온라인 설정 모두에서 샘플 효율적이고 정렬된 학습을 입증하기 위해.
  • 구성 요소 수준의 시각화 및 특성 중요도를 통해 오류 원인과 비정상 동작 모드를 식별할 수 있는 진단 도구를 제공하기 위해.

제안 방법

  • 이 방법은 이진 트리 구조의 보상 함수를 구성하며, 각 리프 노드는 상태-행동 공간의 상호 배타적인 부분집합을 나타내고, 내부 노드는 보상의 계층적 조합을 나타낸다.
  • 각 보상 구성 요소는 선호도 레이블이 부여된 트레이젝터리로부터 평균과 분산을 추정한 가우시안 분포로 모델링되며, 이는 불확실성 인식 기반 능동 학습을 가능하게 한다.
  • 알고리즘은 상한 신뢰도(UCB)를 사용하여 가장 정보가 많은 선호도 질의를 선택하며, 개선이 필요한 높은 불확실성의 구성 요소를 우선순위로 지정한다.
  • 선호도 피드백에 기반하여 트리의 구조는 동적으로 증가 및 정렬을 통해 업데이트되며, 이로써 해석 가능성과 조합적 구조를 유지한다.
  • 다양한 시각화 기능을 지원한다: 구성 요소 수준의 학습 곡선, 트레이젝터리 수준의 적합도 추정치, 그리고 논리적 분리 합성형태(DNF)로 기술된 에피소드 행동에 대한 텍스트 보고서 카드.
  • 특성 중요도는 트리 구조를 효율적으로 활용하여 계산되며, 정책 행동을 이끄는 구성 요소를 분석할 수 있다.

실험 결과

연구 질문

  • RQ1희소한 인간 선호도로부터 트리 구조의 보상 함수를 효율적으로 학습하면서도 해석 가능성은 유지할 수 있는가?
  • RQ2트리 구조의 보상 함수의 해석 가능성은 정렬 디버깅 및 실패 분석을 어떻게 향상시키는가?
  • RQ3불확실성 기반 질의 선택을 통한 능동 선호 학습은 PbRL에서 샘플 효율성을 얼마나 향상시키는가?
  • RQ4구성 요소 수준의 동역학과 보상 구조는 복잡한 환경에서 정책 행동과 수렴에 어떤 영향을 미치는가?
  • RQ5이 방법은 인과적 혼동이나 조기 보상 고정과 같은 오정렬 문제를 탐지하고 진단할 수 있는가?

주요 결과

  • 이 알고리즘은 합성 및 인간 피드백을 모두 사용하여 네 가지 벤치마크 환경에서 트리 구조의 보상 함수를 샘플 효율적으로 학습하였다.
  • FoodLava 환경에서, 에이전트는 제250 에피소드까지 목표 영역(구성 요소 9)을 우선시하게 되었으며, 대부분의 시간을 거기서 소비하고 빠른 탐색 성공을 달성하였다.
  • 목표에 해당하는 구성 요소 1은 시간이 지남에 따라 평균 보상이 점차 증가하고 분산이 감소하여 최적 행동의 안정적 학습을 나타내었다.
  • 이 방법은 오정렬을 성공적으로 탐지하였다: 높은 성능을 보였던 한 에피소드(에피소드 975)는 비록 성능이 높았지만, 목표가 아닌 구성 요소(6)에 머물러 있어 오정렬임이 밝혀졌다.
  • 시스템은 자연어로 기술된 진단 보고서 카드를 제공하여, 목표에 도달한 정렬된(예: 목표에 도달함)과 직진 주행과 같은 비정렬된(예: 직진 주행) 트레이젝터리를 구분할 수 있었다.
  • 오프라인 설정에서는 인과적 혼동과 같은 실패 모드를 드러내었으며, 이는 제한된 탐색으로 인해 에이전트가 허구적 연관성을 악용하는 방식으로 학습한 결과였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.