Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Safe Policies with Expert Guidance

Jessie Huang, Fa Wu|arXiv (Cornell University)|2018. 05. 21.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 전문가의 시연와 일致하는 모든 보상 함수들 중에서 가장 열 劣한 보상에 대해 최적화함으로써 안전한 정책을 학습하는 maxmin 강화학습 프레임워크를 제안한다. 타원체 기반 정확한 방법과 실용적인 follow-the-perturbed-leader (FPL) 알고리즘을 사용하여, 보상 함수의 잘못된 특정화에 대해 강건성을 확보함으로써, 새로운 기능을 가진 미지의 환경에서도 유해한 상태를 피하면서 전문가를 모방할 수 있다.

ABSTRACT

We propose a framework for ensuring safe behavior of a reinforcement learning agent when the reward function may be difficult to specify. In order to do this, we rely on the existence of demonstrations from expert policies, and we provide a theoretical framework for the agent to optimize in the space of rewards consistent with its existing knowledge. We propose two methods to solve the resulting optimization: an exact ellipsoid-based method and a method in the spirit of the "follow-the-perturbed-leader" algorithm. Our experiments demonstrate the behavior of our algorithm in both discrete and continuous problems. The trained agent safely avoids states with potential negative effects while imitating the behavior of the expert in the other states.

연구 동기 및 목표

  • 강화학습에서 보상 함수의 잘못 특정화 문제에 대응함으로써, 해로운 부작용을 초래할 수 있음을 해결하기 위해.
  • 전문가의 시범과 일치하는 보상 함수들 중에서 가장 열 劣한 보상에 대해 최적화함으로써 안전한 에이전트 행동을 보장하는 방법을 개발하기 위해.
  • 학습 중 MDP에 존재하지 않는 기능을 가진 환경에서도, 기능 공간이 공유된다면 강건한 정책 학습을 가능하게 하기 위해.
  • 타원체 방법을 사용한 정확한 다항시간 해법과 실세계 배포를 위한 실용적이고 효율적인 FPL 기반 알고리즘을 제공하기 위해.
  • 정책 일치가 아니라 보상 일관성에 초점을 맞춤으로써, 서로 다를 수 있는 다수의 전문가 정책을 통합할 수 있도록 하기 위해.

제안 방법

  • 에이전트가 전문가의 시범과 일치하는 모든 보상 함수들 중에서 가장 낮은 보상에 대해 최대화하도록 하는 maxmin 최적화 문제로 안전 정책 학습 문제를 수립한다.
  • 일관된 보상은 전문가의 정책가 최적 성능에 근접한 성능(최적에 ε 이내)을 달성하는 보상으로 정의되며, 이는 볼록 집합을 이룬다.
  • MDP 솔버를 활용한 분리 오ракูล을 사용하여 타원체 방법을 적용함으로써, 다항 시간 내에 정확하게 maxmin 문제를 해결한다.
  • O(1/√T)의 리그레트를 달성하는 follow-the-perturbed-leader (FPL) 알고리즘을 제안하며, T 반복 동안 최적의 maxmin 정책으로 수렴한다.
  • MDP 솔버를 서브루틴으로 사용하여 에이전트의 정책 공간과 적대자의 보상 공간에 대한 분리 오라클을 설계한다.
  • FPTAS와 같은 근사 MDP 솔버를 사용하는 경우에도 성능 보장을 유지하면서 FPL 기반 방법을 확장한다.

실험 결과

연구 질문

  • RQ1진정한 보상 함수가 알려지지 않았거나 잘못 특정화된 경우에도, 강화학습 에이전트가 안전하고 높은 성능을 보이는 정책을 학습할 수 있는가?
  • RQ2서로 충돌할 수 있는 다수의 전문가 시범을 어떻게 통합하여 안전 정책 학습을 이끌 수 있는가?
  • RQ3이전에 본 적이 없는 기능을 가진 새로운 환경으로 일반화할 수 있는가, 동시에 안전성을 유지할 수 있는가?
  • RQ4maxmin 안전 정책 학습 문제를 해결하는 데 필요한 계산 복잡도는 무엇이며, 이를 실용적으로 만들 수 있는가?
  • RQ5FPL과 같은 온라인 학습 알고리즘은 이 maxmin 설정에서 효율적이고 근사 최적의 해를 달성하기 위해 어떻게 적응시킬 수 있는가?

주요 결과

  • 제안된 타원체 기반 방법은 분리와 최적화의 등가성에 기반하여, 다항 시간 내에 maxmin 안전 정책 학습 문제를 정확히 해결한다.
  • FPL 기반 알고리즘은 O(1/√T) 리그레트를 달성하여, 반복 횟수가 많아질수록 최적의 maxmin 정책으로 수렴하는 속도가 향상됨을 보여준다.
  • 격자 환경에서 maxmin 정책은 전문가의 경험에 포함되지 않은 위험한 상태(예: 빨간 토지)를 성공적으로 회피하면서 안전한 영역에서는 전문가를 모방한다.
  • 수정된 카트폴 태스크에서, 단일 전문가가 안내할 경우 유해한 블록을 피하는 정책을 학습하지만, 다수의 전문가가 제공되면 안전 범위가 확장되며, 일부 기능(예: 노란색 블록)이 해로우지 않음을 학습한다.
  • 이 방법은 연속 제어 작업으로 일반화되며, 근사 MDP 솔버를 사용할 경우에도 효과적으로 작동함을 보여, 실용적 적용 가능성을 입증한다.
  • 실험 결과, maxmin 정책는 단일 전문가를 모방하는 표준 애자일러닝보다 안전성 면에서 뛰어나며, 최악의 성능을 우선시한다는 점에서 뛰어난 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.