[논문 리뷰] Preference Transformer: Modeling Human Preferences using Transformers for RL
이 논문은 인간의 선호를 비마르코프 보상의 가중합으로 모델링하는 트랜스포머 기반 아키텍처인 Preference Transformer를 제안한다. 이는 더 정확하고 시간적으로 민감한 보상 추론을 가능하게 하며, 실제 인간 피드백을 사용하여 복잡한 제어 행동(예: Hopper에서의 듀얼 백플립)을 학습하는 데 이전 방법들을 능가한다. 또한 자기주의 주의 메커니즘을 통해 궤적 내 핵심 사건을 자동으로 식별한다.
Preference-based reinforcement learning (RL) provides a framework to train agents using human preferences between two behaviors. However, preference-based RL has been challenging to scale since it requires a large amount of human feedback to learn a reward function aligned with human intent. In this paper, we present Preference Transformer, a neural architecture that models human preferences using transformers. Unlike prior approaches assuming human judgment is based on the Markovian rewards which contribute to the decision equally, we introduce a new preference model based on the weighted sum of non-Markovian rewards. We then design the proposed preference model using a transformer architecture that stacks causal and bidirectional self-attention layers. We demonstrate that Preference Transformer can solve a variety of control tasks using real human preferences, while prior approaches fail to work. We also show that Preference Transformer can induce a well-specified reward and attend to critical events in the trajectory by automatically capturing the temporal dependencies in human decision-making. Code is available on the project website: https://sites.google.com/view/preference-transformer.
연구 동기 및 목표
- 선호 기반 강화학습에서 마르코프 보상 가정의 한계를 해결하기 위해 인간 의사결정의 시간적 의존성을 반영하지 못하는 문제를 해결한다.
- 비마르코프 보상의 가중합을 통해 인간 선호를 모델링하여 선호 기반 강화학습의 확장성과 성능을 향상시킨다.
- 자기주의 주의를 통해 궤적 내 핵심 사건을 추론하고 적절한 중요도 가중치를 할당할 수 있는 신경망 아키텍처를 설계한다.
- 실제 인간 피드백을 사용하여 다중 백플립 및 로봇 조작과 같은 복잡한 행동을 샘플 효율적으로 학습할 수 있도록 한다.
제안 방법
- 각 보상이 궤적 내 중요도에 따라 동적으로 가중되는 비마르코프 보상의 가중합 기반 신규 선호 모델을 제안한다.
- 비마르코프 보상과 그 중요도 가중치를 생성하기 위해 스택된 인과적 및 양방향 자기주의 주의 레이어를 갖춘 트랜스포머 기반 아키텍처를 도입한다.
- 궤적 세그먼트를 기반으로 주의를 계산하여 핵심 사건을 추론하고 동적 가중치를 할당하는 새로운 '선호 주의' 레이어를 설계한다.
- 선호 예측기로 비마르코프 보상의 가중합을 사용하며, 이를 인간의 쌍별 비교에 맞추어 훈련시킨다.
- 각 궤적 세그먼트를 처리하는 데 사용되는 하나의 스트림과 선호 점수를 가중합을 통해 계산하는 다른 하나의 스트림을 갖춘 이중 스트림 아키텍처를 활용한다.
- 트랜스포머가 장거리 의존성을 모델링할 수 있는 능력을 활용하여, 복잡하고 시간적으로 연장된 행동에 걸쳐 더 나은 책임 할당을 가능하게 한다.
실험 결과
연구 질문
- RQ1마르코프 가정에 비해 비마르코프 보상 모델링 접근이 선호 기반 강화학습 성능을 향상시킬 수 있는가?
- RQ2트랜스포머 기반 아키텍처가 궤적 내 다양한 사건에 대한 중요도 가중치를 효과적으로 학습하여 인간 의사결정을 반영할 수 있는가?
- RQ3제안된 방법이 인간 선호 피드백만으로도 이중 백플립과 같은 복잡한 장기 목표 행동을 학습할 수 있는가?
- RQ4모델이 학습한 주의 가중치가 인간 선호 판단에 영향을 주는 핵심 사건을 식별하고 강조할 수 있는가?
- RQ5다양한 제어 작업에 걸쳐 샘플 효율성과 일반화 능력 측면에서 기존 선호 모델링 방법과 비교해 볼 때 모델은 어떻게 성능을 내는가?
주요 결과
- Preference Transformer는 300개의 인간 피드백 쿼리만으로 Hopper 환경에서 듀얼 백플립을 성공적으로 학습했으며, 마르코프 보상 함수는 이 행동을 학습하지 못했다.
- 실제 인간 선호를 사용하여 D4RL 내비게이션 및 로케모션 벤치마크, 그리고 Robomimic 로봇 조작 작업에서 최신 기준 성능을 달성했다.
- 선호 주의 레이어에서 학습된 중요도 가중치는 백플립 궤적에서 이륙 및 착지 단계와 같은 핵심 사건을 명확히 강조하며 인간의 주의 패턴과 일치했다.
- 비마르코프 역학과 다중 목표 목표를 가진 다양한 제어 작업에 걸쳐 뛰어난 강건성과 일반화 능력을 보였다.
- 주의 맵의 시각적 분석을 통해 모델이 시간적 의존성을 잘 포착하고 인간 선호에 크게 영향을 주는 사건에 더 높은 가중치를 할당하는 것으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.