Skip to main content
QUICK REVIEW

[논문 리뷰] Inverse Preference Learning: Preference-based RL without a Reward Function

Joey Hejna, Dorsa Sadigh|arXiv (Cornell University)|2023. 05. 24.
Advanced Graph Neural Networks인용 수 6
한 줄 요약

이 논문은 인간의 선호도와 일치하도록 Q함수를 직접 최적화함으로써 명시적인 보상 함수 학습을 회피하는 파rameter 효율적인 오프라인 강화학습 알고리즘인 Inverse Preference Learning (IPL)을 소개한다. 역 소프트-벨만 연산자를 활용함으로써, 복잡한 보상 모델(예: 트랜스포머)을 사용하는 최신 기법들보다 더 적은 파라미터와 초모수를 사용하여 로봇 기반 벤치마크에서 경쟁 가능한 성능을 달성한다.

ABSTRACT

Reward functions are difficult to design and often hard to align with human intent. Preference-based Reinforcement Learning (RL) algorithms address these problems by learning reward functions from human feedback. However, the majority of preference-based RL methods naïvely combine supervised reward models with off-the-shelf RL algorithms. Contemporary approaches have sought to improve performance and query complexity by using larger and more complex reward architectures such as transformers. Instead of using highly complex architectures, we develop a new and parameter-efficient algorithm, Inverse Preference Learning (IPL), specifically designed for learning from offline preference data. Our key insight is that for a fixed policy, the $Q$-function encodes all information about the reward function, effectively making them interchangeable. Using this insight, we completely eliminate the need for a learned reward function. Our resulting algorithm is simpler and more parameter-efficient. Across a suite of continuous control and robotics benchmarks, IPL attains competitive performance compared to more complex approaches that leverage transformer-based and non-Markovian reward functions while having fewer algorithmic hyperparameters and learned network parameters. Our code is publicly released.

연구 동기 및 목표

  • 기존의 선호도 기반 RL 방법들이 학습된 보상 함수에 의존함으로써 발생하는 높은 복잡성과 초모수 민감도 문제를 해결하기 위해.
  • 별도의 보상 네트워크가 필요 없도록 하여 오프라인 RL의 계산 및 아키텍처 오버헤드를 줄이기 위해.
  • 연속 제어 및 로봇 작업에서 성능를 유지하면서도 샘플 및 파라미터 효율성을 향상시키기 위해.
  • 고정된 정책 하에서 Q함수만으로도 효과적인 선호도 일치를 위한 충분한 보상 정보를 인코딩할 수 있는지 탐색하기 위해.
  • 기존의 별도의 보상 모델 학습 단계를 포함하는 이중 단계 접근법보다 더 안정적이고 조정이 쉬운 방법을 개발하기 위해.

제안 방법

  • IPL는 고정된 정책 하에서 Q함수를 암묵적 보상 함수로 되돌리는 데 역 소프트-벨만 연산자를 사용함으로써, 직접적인 선호도 기반 최적화를 가능하게 한다.
  • 알고리즘은 최적의 Q*와 일치하도록 Q함수를 학습시키며, 동시에 암묵적 보상이 전문가 선호 데이터와 일관되도록 보장한다.
  • 초모수 λ를 사용한 정규화 항은 선호도 일관성 있는 Q값에서의 이탈을 억제하여, 별도의 보상 모델 없이도 학습을 안정화시킨다.
  • IPL는 오프라인 RL 프레임워크 내에서 완전히 작동하며, IQL이나 AWAC와 같은 오프폴리시 알고리즘을 사용하고, 별도의 보상 네트워크 학습을 피한다.
  • 고정된 정책 하에서 Q함수는 보상 함수를 재구성하는 데 필요한 모든 정보를 포함하고 있다는 사실을 활용한다.
  • 최적의 Q값과 선호도 일관성에 대한 동시 최적화를 수행하는 단일 단계 학습 절차를 사용하여 오차 전파를 줄인다.

실험 결과

연구 질문

  • RQ1명시적인 보상 모델 없이도 Q함수만으로도 선호도 기반 RL에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2보상 네트워크를 제거함으로써 초모수 민감도가 감소하고 학습 안정성이 향상되는가?
  • RQ3IPL의 파라미터 효율성은 보상 모델링에 트랜스포머나 RNN을 사용하는 최신 기법들과 비교해 어떻게 되는가?
  • RQ4정규화 강도 λ의 선택이 IPL의 성능에 어느 정도 영향을 미치는가?
  • RQ5명시적인 보상 함수 학습 없이도 IPL은 다양한 로봇 벤치마크에 일반화 가능한가?

주요 결과

  • IPL는 보상 함수 학습 없이도 대부분의 작업에서 마르코프 보상 모델을 사용하는 IQL과 유사하거나 더 뛰어난 성능을 달성한다.
  • 서랍 열기 작업에서, 64차원의 MLP를 사용하는 IPL는 파라미터 수가 더 적은 35차원 MLP 기반 보상 모델인 MR(35)보다 성능이 뛰어나다.
  • 보상 예측 오차 전파가 줄어들었기 때문에, 보상 모델 학습에 의존하는 방법들보다 IPL는 런 간에 변동성이 크게 낮다.
  • 매우 낮은 파라미터 예산(14k 파라미터)으로도, 최대 10배 더 많은 파라미터를 사용하는 표준 선호도 기반 RL 기반선들보다 성능가 뛰어나다.
  • IPL의 성능는 정규화 초모수 λ의 변화에 거의 민감하지 않아, 초모수 조정에 대한 강건성을 보여준다.
  • MR 모델은 학습 스텝 수가 부족하면 과소적합되고, 너무 많으면 과적합되지만, IPL는 단일 단계 및 종단 간 최적화 방식 덕분에 이러한 상충 관계를 피한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.