[논문 리뷰] Non-Markovian Reward Modelling from Trajectory Labels via Interpretable Multiple Instance Learning
이 논문은 인간 피드백의 시간적 의존성을 모델링하기 위해 해석 가능한 다중 예측 학습(MIL) 기반의 비마르코프 보상 모델링 접근법을 제안한다. 여기서 경로는 백으로 간주되고, 상태-행동 쌍은 인스턴스로 간주되어 시간적 의존성을 처리한다. 이 방법은 LSTM 기반의 MIL 모델을 사용하여 수상한 상태 동역학과 보상 함수를 수상한 수익 레이블이 부여된 경로에서 재구성하며, 높은 정확도를 달성하고 강화학습(RL) 에이전트가 진정한 보상 함수에 접근할 수 없더라도 비마르코프 작업을 성능이 높거나 그에 준하는 수준으로 해결할 수 있도록 한다.
We generalise the problem of reward modelling (RM) for reinforcement learning (RL) to handle non-Markovian rewards. Existing work assumes that human evaluators observe each step in a trajectory independently when providing feedback on agent behaviour. In this work, we remove this assumption, extending RM to capture temporal dependencies in human assessment of trajectories. We show how RM can be approached as a multiple instance learning (MIL) problem, where trajectories are treated as bags with return labels, and steps within the trajectories are instances with unseen reward labels. We go on to develop new MIL models that are able to capture the time dependencies in labelled trajectories. We demonstrate on a range of RL tasks that our novel MIL models can reconstruct reward functions to a high level of accuracy, and can be used to train high-performing agent policies.
연구 동기 및 목표
- 인간의 경로 평가에서 시간적 의존성을 고려함으로써 마르코프 가정을 초월한 보상 모델링을 일반화하기 위해.
- 인간 피드백에서 독립적이고 즉각적인 보상 평가의 심리적 및 실용적 한계를 해결하기 위해.
- 경로 수익 레이블에서 은닉 상태 동역학과 보상 함수를 모두 재구성하는 방법을 개발하기 위해.
- 진정한 보상 함수나 은닉 상태에 접근할 수 없더라도, 수익 레이블이 부여된 경로만을 사용하여 RL 에이전트가 높은 성능의 정책을 학습할 수 있도록 하기 위해.
- 학습된 보상 함수와 은닉 상태 동역학을 검증하고 이해할 수 있는 해석 가능성 도구를 제공하기 위해.
제안 방법
- 경로를 백으로, 상태-행동 쌍을 인스턴스로 간주하여 비마르코프 보상 모델링을 다중 예측 학습(MIL) 문제로 공식화한다.
- 은닉 상태 동역학을 경로 간에 모델링하고 인스턴스 수준의 보상 예측을 추론하기 위해 장기 순환 신경망(LSTM)을 사용한다.
- 백 수준의 수익 레이블에서 동시에 보상 함수와 은닉 상태 표현을 학습하는 새로운 MIL 모델 아키텍처를 설계한다.
- 내부 표현과 의사결정 과정을 분석하고 검증하기 위해 해석 가능성 기법을 적용한다.
- 인스턴스 수준의 레이블이 없이도 수익 레이블이 부여된 경로에서 끝내기로 모델을 훈련하여 보상과 은닉 상태 경로를 추론할 수 있도록 한다.
- 학습된 보상 모델을 RL 학습 파이프라인에 통합하여 비마르코프 작업에서 정책 성능을 평가한다.
실험 결과
연구 질문
- RQ1다중 예측 학습(MIL)이 가시 상태에서 포착되지 않는 은닉 상태 동역학에 의존하는 비마르코프 보상 함수를 효과적으로 모델링할 수 있는가?
- RQ2MIL 기반 모델은 수익 레이블이 부여된 경로에서 진정한 은닉 상태와 보상 함수를 얼마나 잘 재구성할 수 있는가?
- RQ3예측된 보상으로 훈련된 RL 에이전트가 진정한 보상과 은닉 상태에 접근한 에이전트와 비교해 성능이 유사하거나 뛰어나게 할 수 있는가?
- RQ4제안된 MIL 모델은 경로 데이터의 레이블 노이즈와 분포 이탈에 대해 얼마나 강건한가?
- RQ5해석 가능성 분석은 학습된 보상 모델의 내부 표현과 의사결정 과정에 대해 어떤 통찰을 제공하는가?
주요 결과
- 제안된 MIL 기반 보상 모델은 합성 비마르코프 환경에서 진정한 보상 함수와 은닉 상태 경로를 정확하게 재구성한다.
- 모델은 높은 수익 예측 정확도를 달성하였으며, 진정한 은닉 상태에 접근한 모델과 비교해 성능이 유사하거나 뛰어나다.
- MIL 모델에서 예측된 보상으로 훈련된 RL 에이전트는 진정한 보상에 접근한 에이전트와 비교해 비마르코프 작업을 성능이 유사하거나 뛰어나게 해결한다.
- 해석 가능성 분석 결과, 모델은 키 수집, 보물 영역 진입과 같은 의미 있는 은닉 상태 동역학을 학습하며, 인간이 추론한 경로 의미론과 일치한다.
- 모델은 레이블 노이즈에 강건하여 수익 레이블이 손상되거나 일관성이 없어져도 강력한 성능을 유지한다.
- 월면 착륙기(Lunar Lander) 작업에서, 모델은 오라클 보상 함수보다 실질적인 개선을 학습하였으며, 가장자리에서 멀리 떨어진 안정된 허브 위치를 보상함으로써 허브 작업에서 더 높은 실제 성능을 기여하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.