Skip to main content
QUICK REVIEW

[논문 리뷰] Positive-Unlabeled Reward Learning

Danfei Xu, Misha Denil|arXiv (Cornell University)|2019. 11. 01.
Adversarial Robustness in Machine Learning참고 문헌 49인용 수 10
한 줄 요약

이 논문은 보상 학습을 지도적 복제와 GAIL 유사 방법 모두를 일관된 양성-무 nhãn(positive-unlabeled, PU) 학습으로 재구성하는 통합 프레임워크인 Positive-Unlabeled Reward Learning(PURL)을 제안한다. 전문가(양성)와 에이전트가 생성한(무 nhãn) 궤적을 사용해 판별기(discriminator)가 성공과 실패를 구분하도록 훈련시킴으로써, PURL은 지도 학습에서의 보상 과대평가와 GAIL에서의 판별기 과적합을 모두 완화하며, 추가적인 가정이나 레이블 없이도 성능 향상을 이룬다.

ABSTRACT

Learning reward functions from data is a promising path towards achieving scalable Reinforcement Learning (RL) for robotics. However, a major challenge in training agents from learned reward models is that the agent can learn to exploit errors in the reward model to achieve high reward behaviors that do not correspond to the intended task. These reward delusions can lead to unintended and even dangerous behaviors. On the other hand, adversarial imitation learning frameworks tend to suffer the opposite problem, where the discriminator learns to trivially distinguish agent and expert behavior, resulting in reward models that produce low reward signal regardless of the input state. In this paper, we connect these two classes of reward learning methods to positive-unlabeled (PU) learning, and we show that by applying a large-scale PU learning algorithm to the reward learning problem, we can address both the reward under- and over-estimation problems simultaneously. Our approach drastically improves both GAIL and supervised reward learning, without any additional assumptions.

연구 동기 및 목표

  • 희박한 인간 레이블 오류를 악용하는 지도형 보상 학습에서의 보상 망각 문제를 해결하기 위해.
  • GAIL에서 판별기가 임의의 특징이 아닌 작업과 관련된 행동을 학습하는 대신 단순한 특징에 과적합하는 문제를 해결하기 위해.
  • 지도형 보상 학습과 GAIL을 동일한 PU 학습 프레임워크 아래 통합하여 공통된 성능 향상을 가능하게 하기 위해.
  • 시연 환경와 정책 환경 간 도메인 갭이 존재하는 상황에서도 강건성을 확보하기 위해.
  • 대규모 알고리즘을 사용한 PU 학습이 애니메이션 학습에서 더 나은 일반화와 성능을 낼 수 있음을 보여주기 위해.

제안 방법

  • GAIL의 판별기 목적함수를 전문가 대비 에이전트 행동을 구분하는 것에서 성공 대비 실패를 분류하는 것으로 재구성하며, 전문가 궤적을 양성 데이터로, 에이전트 롤아웃을 무 nhãn 데이터로 사용한다.
  • 대규모 PU 학습 알고리즘(Kiryo 등, 2017)을 적용하여 양성(전문가) 및 무 nhãn(에이전트) 데이터에 기반한 신뢰할 수 있는 분류기를 훈련시키며, 음성 레이블이 필요 없도록 한다.
  • 훈련된 판별기를 강화학습에서의 대체 보상 함수로 사용하며, 보상 신호는 단순한 구분이 아닌 신뢰할 수 있는 성공 탐지 결과를 반영한다.
  • 지도형 보상 학습에서 지원 집합 추정 모듈을 도입하여, 보상 모델이 신뢰할 수 있는 상태공간 영역을 식별하기 위해 PU 분류기를 훈련시킨다.
  • PU 학습 이론에서 유도된 위험 최소화 목적함수를 사용하며, 추정된 클래스 사전 확률을 활용해 균형이 깨진 양성-무 nhãn 데이터를 보정한다.
  • PU 학습을 통합한 기울기 역전파가 가능한 종단 간 훈련 파이프라인을 구현하여 지도형 및 적대형 복제 학습에 모두 적용한다.

실험 결과

연구 질문

  • RQ1희박한 레이블 조건에서 지도형 복제 학습의 보상 모델 신뢰성 향상에 PU 학습을 활용할 수 있는가?
  • RQ2GAIL의 판별기를 성공/실패 분류기로 재구성함으로써 고차원 상태공간에서의 단순한 특징에 대한 과적합 문제를 완화할 수 있는가?
  • RQ3지난 지도형 및 적대형 복제 학습을 동일한 PU 학습 목적함수 아래 통합함으로써 일반화 및 성능 향상이 이루어지는가?
  • RQ4전문가 시연와 에이전트 환경 간 도메인 이동이 존재할 경우 PURL의 성능는 어떻게 되는가?
  • RQ5PU 학습은 이미지 GAN과 같은 다른 GAN 기반 생성 모델로 확장되어 샘플 품질 향상에 기여할 수 있는가?

주요 결과

  • PURL은 보상 과대평가와 판별기 과적합을 줄임으로써 GAIL과 지도형 보상 학습 양쪽에서 성능 향상을 크게 달성한다.
  • 추가적인 가정이나 훈련 중 인간 피드백 없이도 샘플 효율성과 최종 정책 성능 향상에 큰 기여를 한다.
  • 도메인 갭이 존재하는 환경에서 nn-PURL은 표준 PURL 및 기준 방법보다 뛰어난 성능을 보이며, 분포 이동에 대한 강건성을 입증한다.
  • 제거 실험 결과에서 PU 학습 알고리즘의 선택과 PU 학습으로 문제를 프레임워킹하는 것이 성능에 결정적인 영향을 미친다.
  • 단지 상태공간의 소수의 영역만 레이블이 붙어 있어도 신뢰할 수 있는 보상 모델링이 가능해져 고비용 인간 감시에 대한 의존도를 감소시킨다.
  • 실증 결과는 PU 학습에서 제안된 위험 추정 및 클래스 사전 처리 기법이 더 안정적이고 정확한 보상 신호를 제공함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.