Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning with Supervision from Noisy Demonstrations

Kun-Peng Ning, Sheng-Jun Huang|arXiv (Cornell University)|2020. 06. 14.
Reinforcement Learning in Robotics참고 문헌 21인용 수 7
한 줄 요약

이 논문은 잠재적 유틸리티를 추정하는 데 기반해 각 시연 인스턴스에 동적 가중치를 할당함으로써 노이즈가 있는 전문가 시연를 적응적으로 활용하는 강화학습 프레임워크인 LfND를 제안한다. 가치 함수의 수익률을 가중치 신호로 사용하여 정책 그래디언트와 가중치가 부여된 교차 엔트로피 손실을 결합함으로써, LfND는 샘플 효율성과 내성적 저항력을 향상시켜 높은 성능을 더 적은 학습 반복 횟수로 달성한다. 이는 높은 노이즈 비율 조건에서도 성능을 유지한다.

ABSTRACT

Reinforcement learning has achieved great success in various applications. To learn an effective policy for the agent, it usually requires a huge amount of data by interacting with the environment, which could be computational costly and time consuming. To overcome this challenge, the framework called Reinforcement Learning with Expert Demonstrations (RLED) was proposed to exploit the supervision from expert demonstrations. Although the RLED methods can reduce the number of learning iterations, they usually assume the demonstrations are perfect, and thus may be seriously misled by the noisy demonstrations in real applications. In this paper, we propose a novel framework to adaptively learn the policy by jointly interacting with the environment and exploiting the expert demonstrations. Specifically, for each step of the demonstration trajectory, we form an instance, and define a joint loss function to simultaneously maximize the expected reward and minimize the difference between agent behaviors and demonstrations. Most importantly, by calculating the expected gain of the value function, we assign each instance with a weight to estimate its potential utility, and thus can emphasize the more helpful demonstrations while filter out noisy ones. Experimental results in various environments with multiple popular reinforcement learning algorithms show that the proposed approach can learn robustly with noisy demonstrations, and achieve higher performance in fewer iterations.

연구 동기 및 목표

  • 기존 RLED 방법들이 완벽한 전문가 시연를 가정하는 한계를 해결하기 위해, 현실 응용에서 흔히 발생하지 않는 이상적인 전문가 시연를 전제로 하지 않는다.
  • 노이즈가 있거나 불완전한 전문가 시연를 효과적으로 활용하여 강화학습의 샘플 효율성을 향상시키기 위해 노력한다.
  • 고품질의 시연 인스턴스를 적응적으로 식별하고 강조함과 동시에 노이즈가 있거나 오도하는 인스턴스를 걸러내는 방법을 개발한다.
  • 환경 상호작용과 시연 활용을 통합된, 통합된 학습 프레임워크 안에서 함께 최적화한다.

제안 방법

  • 각 시연 경로의 단계를 개별 지도 학습을 위한 인스턴스(상태, 행동, 보상)로 정의한다.
  • 기대 보상을 최대화하기 위한 정책 그래디언트와 에이전트 행동을 시연와 일치시키기 위한 교차 엔트로피 손실을 조합한 공동 손실 함수를 정의한다.
  • 각 인스턴스의 잠재적 유틸리티를 추정하기 위해 가치 함수의 기대 수익을 전문가 Q-값 Q_E(s,a)와 에이전트의 상태 가치 V_π(s)의 차이로 계산한다.
  • 이 기대 수익을 바탕으로 각 인스턴스에 동적 가중치를 할당하여 유틸리티가 높은 시연를 강조하고, 노이즈가 있거나 오도하는 인스턴스는 낮게 가중한다.
  • 모든 인스턴스에 대해 가중치가 부여된 공동 손실을 최소화하여 정책 학습과 시연 활용을 동시에 최적화한다.
  • 다양한 환경에서 여러 강화학습 알고리즘(TRPO, PPO 등)을 활용해 프레임워크를 구현함으로써, 강건성과 일반화 능력을 검증한다.

실험 결과

연구 질문

  • RQ1완벽한 시연가 제공되지 않는 상황에서 강화학습 에이전트가 노이즈가 있는 전문가 시연를 효과적으로 학습할 수 있는가?
  • RQ2개별 시연 인스턴스의 유틸리티는 어떻게 추정할 수 있으며, 고품질 시연와 노이즈가 있는 시연를 어떻게 구분할 수 있는가?
  • RQ3가치 함수 수익률에 기반한 적응적 가중치 부여가 노이즈가 있는 시연 상황에서 샘플 효율성과 최종 정책 성능을 향상시키는가?
  • RQ4다양한 노이즈 수준에서 제안된 방법이 표준 강화학습 및 이mitation learning 기준선과 어떻게 비교되는가?

주요 결과

  • LfND는 모든 테스트 환경에서 평균 및 최대 누적 보상 측면에서 표준 강화학습 알고리즘(TRPO, PPO)과 이mitation learning 기준선을 일관되게 능가한다.
  • 노이즈 비율이 0에서 1로 증가함에 따라 LfND와 다른 방법 간의 성능 격차가 더욱 벌어지며, 이는 노이즈가 많은 시연에 대한 뛰어난 강건성을 입증한다.
  • 가치 함수 수익률에 의해 추정된 평균 가중치가 높은 시연 인스턴스는 유의미하게 더 뛰어난 이mitation 학습 성능을 보였으며, 이는 유틸리티 추정의 정확성을 검증한다.
  • 다양한 가중치 전략 중에서 로그형 및 선형 형태(LfND-log, LfND-linear10/20)가 일원형 기준선보다 우수한 성능을 보였으며, 이는 적응적 가중치 부여의 유용성을 확인한다.
  • 특히 높은 시연 노이즈가 존재하는 환경에서 높은 성능에 도달하기 위해 필요한 학습 반복 횟수를 감소시켰다.
  • 제안된 가중치 부여 메커니즘이 오도하는 시연를 성공적으로 걸러내며, 정책 향상에 가장 기여하는 시연를 강조함으로써 효과를 발휘했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.