Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning from Imperfect Demonstrations under Soft Expert Guidance

Mingxuan Jing, Xiaojian Ma|arXiv (Cornell University)|2019. 11. 16.
Reinforcement Learning in Robotics참고 문헌 33인용 수 9
한 줄 요약

이 논문은 전문가가 제공하는 예시를 강력한 보상이 아닌 부드러운 제약 조건으로 간주하는 제약을 받는 강화학습에서의 시도(Constrained RLfD) 방법을 제안한다. 이는 열악한 조건의 예시들로부터도 효과적으로 학습할 수 있도록 해주며, 벤치마크 제어 과제에서 낮은 품질이나 희소한 예시들 조건에서도 페널티 기반 및 사전학습 기반의 기준들을 능가하는 성능을 달성한다. 이는 정책 최적화를 제약 문제로 공식화하고 이중 기반 국소 선형 탐색을 통해 해결함으로써 달성된다.

ABSTRACT

In this paper, we study Reinforcement Learning from Demonstrations (RLfD) that improves the exploration efficiency of Reinforcement Learning (RL) by providing expert demonstrations. Most of existing RLfD methods require demonstrations to be perfect and sufficient, which yet is unrealistic to meet in practice. To work on imperfect demonstrations, we first define an imperfect expert setting for RLfD in a formal way, and then point out that previous methods suffer from two issues in terms of optimality and convergence, respectively. Upon the theoretical findings we have derived, we tackle these two issues by regarding the expert guidance as a soft constraint on regulating the policy exploration of the agent, which eventually leads to a constrained optimization problem. We further demonstrate that such problem is able to be addressed efficiently by performing a local linear search on its dual form. Considerable empirical evaluations on a comprehensive collection of benchmarks indicate our method attains consistent improvement over other RLfD counterparts.

연구 동기 및 목표

  • 기존의 RLfD 방법들이 완벽하고 충분한 예시에 의존하는 데에 기인한 한계를 해결하기 위해, 현실 세계에서는 실현 가능하지 않은 조건을 고려한다.
  • 부적절한 전문가의 품질과 부족한 예시 수량을 특징으로 하는 새로운 RLfD 설정을 정식화한다.
  • 열악한 전문가에 적용될 때 페널티 기반 RLfD 방법의 최적성 및 수렴 문제를 해결한다.
  • 정책 학습 중에 부적절한 예시들을 부드러운 제약 조건으로 활용하는 확장 가능한 효율적인 알고리즘을 개발한다.
  • 다양한 예시 품질과 양 조건에서 기존의 RLfD 접근법에 비해 성능이 뛰어나다는 것을 경험적으로 검증한다.

제안 방법

  • 정책이 제시된 궤적 주변의 유한한 영역 내에 머무르도록 제약된 정책 최적화 문제로 RLfD를 공식화한다.
  • 전문가의 예시를 정책이 제시된 영역에서 벗어날 경우에만 영향을 주는 부드러운 제약 조건으로 간주한다.
  • 제약 문제의 이중 공식을 사용하여 계산 복잡도를 감소시키고 딥 네URAL 네트워크 정책로의 확장성을 확보한다.
  • 각 학습 단계에서 정책 갱신을 효율적으로 계산하기 위해 이중 목표 함수에 대한 국소 선형 탐색을 수행한다.
  • 예시 주변의 탐색 반경을 제어하는 내성 파rameter $d$를 도입하고, 시간이 지남에 따라 점차 제약 조건을 완화하는 애너일링 메커니즘을 적용한다.
  • 오프-폴리시 RL 알고리즘을 사용하여 연속 제어 벤치마크에 적용하고, 보상 형상 조정을 수정하지 않은 채로 정책 갱신에 부드러운 제약 조건을 통합한다.

실험 결과

연구 질문

  • RQ1전문가의 예시가 품질이나 수량 측면에서 열악할 경우, 기존의 RLfD 방법들은 어떻게 성능을 내는가?
  • RQ2부드러운 제약 조건 공식화가 열악한 예시가 존재하는 상황에서 RLfD의 최적성과 수렴성을 향상시킬 수 있는가?
  • RQ3제약 조건의 허용 오차와 그 애너일링 스케줄의 정책 성능에 미치는 영향은 무엇인가?
  • RQ4제안된 제约束 최적화 접근법은 페널티 기반 및 사전학습 기반의 RLfD 방법에 비해 샘플 효율성과 최종 성능 측면에서 어떻게 비교되는가?
  • RQ5제안된 방법은 다양한 환경에서 예시 품질과 양의 변화에 대해 강인한가?

주요 결과

  • 제안된 방법은 낮은 품질이나 희소한 예시 조건에서도 페널티 기반 및 사전학습 기반의 RLfD 방법을 일관되게 능가한다.
  • 고품질의 예시가 존재할 경우에도, 기준들보다 더 나은 성능을 달성함으로써 전문가 데이터를 더 효율적으로 활용한다는 점을 보여준다.
  • 너무 큰 허용 오차 값은 제약 조건을 효과적으로 작용하지 못하게 하고, 너무 작은 값은 열악한 예시 조건에서 성능을 떨어뜨리므로, 정교한 튜닝이 필요함을 시사한다.
  • 허용 오차에 대한 애너일링 메커니즘이 성능과 강인성을 크게 향상시키며, 다양한 애너일링 요소에 대해 안정적인 결과를 보인다.
  • 절단 실험 결과, 고정된 허용 오차는 애너일링된 허용 오차보다 열악한 성능을 보이며, 애너일링 요소의 경미한 변동에도 강인함을 입증한다.
  • HalfCheetah, Walker2D, Ant 과제에서 특히 낮은 품질이나 희소한 예시 조건에서 뛰어난 최종 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.