[논문 리뷰] Semi-supervised reward learning for offline reinforcement learning
이 논문은 제한된 인간 주석(에피소드 수준의 시연 또는 희박한 타임스텝 수준의 보상)과 함께 레이블이 없는 데이터를 활용하여 효과적인 정책을 학습하는 오프라인 강화학습을 위한 준감독 보상 학습 방법을 제안한다. 자기지도 학습, 반복적 개선 및 다중 예제 학습을 조합함으로써, 최소한의 지도 학습 조건에서도 진정한 보상 성능에 가까운 성능을 달성하며, 오프라인 RL이 부정확한 보상 모델에 대해 강건함을 보여준다.
In offline reinforcement learning (RL) agents are trained using a logged dataset. It appears to be the most natural route to attack real-life applications because in domains such as healthcare and robotics interactions with the environment are either expensive or unethical. Training agents usually requires reward functions, but unfortunately, rewards are seldom available in practice and their engineering is challenging and laborious. To overcome this, we investigate reward learning under the constraint of minimizing human reward annotations. We consider two types of supervision: timestep annotations and demonstrations. We propose semi-supervised learning algorithms that learn from limited annotations and incorporate unlabelled data. In our experiments with a simulated robotic arm, we greatly improve upon behavioural cloning and closely approach the performance achieved with ground truth rewards. We further investigate the relationship between the quality of the reward model and the final policies. We notice, for example, that the reward models do not need to be perfect to result in useful policies.
연구 동기 및 목표
- 실제 오프라인 강화학습 응용에서 희박하거나 가용하지 않은 보상 신호 문제를 해결하기 위해.
- 큰 레이블이 없는 데이터 세트와 제한된 인간 주석을 함께 활용하여 보상 학습의 샘플 효율성을 향상시키기 위해.
- 오프라인 RL에서 보상 모델 품질과 최종 정책 성능 간의 관계를 조사하기 위해.
- 에피소드 수준 및 타임스텝 수준의 지도 학습을 효과적으로 조합하는 준감독 알고리즘을 개발하기 위해.
- 오프라인 RL이 높은 품질의 보상 주석에 의존하지 않도록, 부정확한 보상 모델에 대해 강건함을 보여주기 위해.
제안 방법
- 제한된 인간 주석 데이터(타임스텝 또는 에피소드 수준)와 레이블이 없는 트레이젝터리 조합을 사용하여 보상 모델을 훈련하는 준감독 학습 프레임워크를 제안한다.
- 시간 구조 모델(TGR-i)을 활용한 반복적 개선을 수행하여 보상 모델의 예측 결과를 기반으로 여러 라운드에 걸쳐 자체 레이블 추정치를 향상시킨다.
- 성공적인 시연의 시간적 구조를 활용하여 에피소드 수준 주석을 보다 세밀한 타임스텝 수준의 보상을 유추함으로써, 근본적인 에피소드 수준 주석을 다루기 위해 다중 예제 학습 원리를 적용한다.
- 자기 학습 및 공훈련 기반 전략을 활용하여 모델의 예측 결과를 가짜 레이블로 삼아 동일하거나 유사한 모델을 개선한다.
- 다중 헤드 분류 헤드를 보상 예측에 도입하고, 정밀도, F-스코어, AUC-PR 지표를 사용하여 클래스 불균형 문제를 최적화한 손실 함수를 적용한다.
- 여러 지표에서 검증 점수를 기반으로 보상 모델을 선택하고, 이를 오프라인 RL에서 정책 훈련을 이끄는 데 활용한다.
실험 결과
연구 질문
- RQ1타임스텝 수준의 보상 주석이 전혀 없이 에피소드 수준의 시연만으로 오프라인 강화학습 정책을 효과적으로 훈련시킬 수 있는가?
- RQ2준감독 보상 모델의 품질은 오프라인 RL에서 도출된 정책의 성능과 어떻게 상관관계가 있는가?
- RQ3부정확하거나 노이즈가 있는 보상 모델로 훈련된 오프라인 RL 알고리즘이 얼마나 일반화 가능한가?
- RQ4초기 지도 학습이 희박한 상황에서도 보상 예측의 반복적 개선이 정책 성능 향상에 기여할 수 있는가?
- RQ5다음 정책 성능을 예측하는 데 가장 적합한 보상 모델 평가 지표는 무엇인가(예: 정밀도, F-스코어, AUC-PR)?
주요 결과
- 제안된 준감독 보상 학습 방법은 최소한의 인간 지도 학습 조건에서도 진정한 보상으로 훈련한 경우와 유사한 정책 성능을 달성한다.
- 에피소드 수준의 시연만으로 훈련된 정책는 행동 복제(Behavioral Cloning)를 초월하며, 진정한 기준 성능에 근접한 성능을 보인다.
- 정밀도, F-스코어 또는 AUC-PR이 높은 보상 모델은 일관되게 더 높은 정책 수익을 보이며, 이는 어느 한 지표도 정책 성능을 완벽하게 예측하지 못함을 시사한다.
- 낮은 분류 점수를 가진 보상 모델조차도 정책 훈련에 유용한 신호를 제공함을 확인하여, 오프라인 RL이 노이즈가 있거나 부정확한 보상 함수에 대해 강건함을 입증한다.
- 보상 모델의 반복적 개선은 런에 따른 정책 수익의 분산을 감소시켜 훈련 안정성을 향상시키고 모델 선택을 용이하게 한다.
- 레이블이 없는 데이터와 희박한 주석을 조합함으로써, 특히 시간적 구조를 활용할 경우, 비용이 많이 드는 타임스텝 수준의 보상 주석이 크게 감소함을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.