[논문 리뷰] Learning Human Objectives by Evaluating Hypothetical Behavior
ReQueST는 복잡하고 고차원적인 환경에서 인간의 보상 함수를 효율적으로 학습하기 위해 궤적 최적화를 사용해 정보적인 가상 에이전트 행동을 합성하는 새로운 활성 학습 방법이다. 이 방법은 불확실성, 보상 극단, 안전성, 새로운 행동을 대상으로 사용자에게 질문을 던져, 이전 방법들보다 더 적은 질문 수로도 뛰어난 보상 모델 전이 성능과 안전성 탐지 성능을 달성한다.
We seek to align agent behavior with a user's objectives in a reinforcement learning setting with unknown dynamics, an unknown reward function, and unknown unsafe states. The user knows the rewards and unsafe states, but querying the user is expensive. To address this challenge, we propose an algorithm that safely and interactively learns a model of the user's reward function. We start with a generative model of initial states and a forward dynamics model trained on off-policy data. Our method uses these models to synthesize hypothetical behaviors, asks the user to label the behaviors with rewards, and trains a neural network to predict the rewards. The key idea is to actively synthesize the hypothetical behaviors from scratch by maximizing tractable proxies for the value of information, without interacting with the environment. We call this method reward query synthesis via trajectory optimization (ReQueST). We evaluate ReQueST with simulated users on a state-based 2D navigation task and the image-based Car Racing video game. The results show that ReQueST significantly outperforms prior methods in learning reward models that transfer to new environments with different initial state distributions. Moreover, ReQueST safely trains the reward model to detect unsafe states, and corrects reward hacking before deploying the agent.
연구 동기 및 목표
- 모델이 알려지지 않은 동역학, 보상 함수, 위험한 상태를 포함하는 환경에서 인간의 보상 함수를 학습하는 데 있어 직접적인 사용자 질의가 비용이 많이 들기 때문에 이를 해결하는 것.
- 실제 환경 상호작용을 최소화하면서도 사용자 피드백을 통해 가상 행동에 기반한 안전하고 상호작용 가능한 방법을 개발하여 보상 모델을 효율적으로 학습하는 것.
- 특히 복잡하고 연속 상태 공간을 가진 환경에서 새로운 초기 상태 분포로의 일반화 및 전이 능력을 향상시키기 위한 보상 모델의 일반화 능력을 향상시키는 것.
- 에이전트를 실제 위험한 시나리오에 투입하지 않고도 보상 해킹을 조기에 탐지하고 수정하는 것.
- 가장 정보적인 가상 행동을 적극적으로 선택하여 레이블링하는 데 필요한 사용자 질의 수를 줄이는 것.
제안 방법
- ReQueST는 오프-폴리시 데이터를 기반으로 훈련된 초기 상태의 생성 모델과 전진 동역학 모델을 사용하여 가상의 에이전트 궤적을 합성한다.
- 정보적인 궤적을 생성하기 위해 네 가지 획득 함수를 활용한다: 불확실성 최대화, 보상 최대화, 보상 최소화, 궤적 신선도 최대화.
- 값의 정보(VoI)에 대한 계산이 비효율적인 경우를 방지하기 위해 궤적 최적화를 사용하여 계산 가능한 대체 지표를 최대화하는 행동을 생성한다.
- 이러한 합성된 행동에 대한 사용자 피드백을 사용하여 신경망 기반의 보상 모델을 훈련하고, 수렴할 때까지 반복적으로 개선한다.
- 훈련된 보상 모델을 기반으로 모델 기반 강화 학습 에이전트를 훈련하여 학습된 보상 함수를 최적화한다.
- 동역학 모델과 초기 상태 모델을 통해 궤적을 정규화함으로써 질문의 이해 가능성과 현실성 확보.
실험 결과
연구 질문
- RQ1궤적 최적화를 통한 가상 행동 합성은 정확한 보상 모델을 학습하기 위해 필요한 사용자 질의 수를 크게 줄일 수 있는가?
- RQ2기본 방법들과 비교했을 때 ReQueST는 초기 상태 분포가 다른 새로운 환경으로의 전이 성능이 얼마나 우수한가?
- RQ3실제 환경 상호작용 없이도 ReQueST는 에이전트 배포 이전에 보상 해킹을 탐지하고 수정할 수 있는가?
- RQ4복잡한 환경에서 ReQueST는 얼마나 안전하게 위험한 상태를 식별하고 피할 수 있는가?
- RQ5다양한 데이터 제약 조건과 도메인에서 불확실성, 보상 최대/최소, 신선도 등 다양한 획득 함수가 모델 성능에 어떤 기여를 하는가?
주요 결과
- 2D 내비게이션과 Car Racing 환경에서의 전이 설정에서 ReQueST는 적어도 2배 이상 뛰어난 최종 성능를 달성하여 뛰어난 일반화 능력을 입증했다.
- 2D 내비게이션 작업에서 ReQueST는 100%의 위험 상태를 위험하다고 정확히 분류했고, 에이전트 배포 시 실패가 전혀 발생하지 않았으며, 기존 방법들은 75%의 경우에서 실패했다.
- 에이전트 배포 이전에도 의도한 목표에서 벗어난 고보상 행동을 식별하고 수정함으로써 보상 해킹을 성공적으로 탐지했다.
- 불확실성 최대화 질의는 목표 영역과 함정 영역의 경계 근처에 집중되어 있어, 이러한 영역의 정의 정밀도를 향상시켰다.
- 보상 최대화 질의는 보상 모델의 편향으로 인해 초기에는 목표 영역를 초월해 외삽했지만, 고보상이지만 비정책 행동에 대한 사용자 레이블링 이후에 수정되었다.
- 신선도 최대화 질의는 지도의 모서리 등 표현이 부족한 영역을 탐색하여 목표 영역와 함정 영역의 공간적 범위를 학습하는 데 기여했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.