Skip to main content
QUICK REVIEW

[논문 리뷰] Neural-encoding Human Experts' Domain Knowledge to Warm Start Reinforcement Learning

Andrew Silva, Matthew Gombolay|arXiv (Cornell University)|2019. 02. 15.
Reinforcement Learning in Robotics참고 문헌 41인용 수 8
한 줄 요약

이 논문은 인간의 도메인 전문 지식을 결정 트리에서 제시된 명제 논리 규칙으로 인코딩하여 강화학습 에이전트를 지능적으로 초기화하는 새로운 신경망 아키텍처인 ProLoNets를 소개한다. 직접 전문 지식을 네트워크 가중치와 아키텍처에 통합함으로써 ProLoNets는 기준선 대비 초기 기대 보상에서 >80% 향상되고 학습 후 >60% 향상되는 성능을 달성하였으며, 전문가가 아닌 인간의 입력이라도 가능하다.

ABSTRACT

Deep reinforcement learning has been successful in a variety of tasks, such as game playing and robotic manipulation. However, attempting to learn extit{tabula rasa} disregards the logical structure of many domains as well as the wealth of readily available knowledge from domain experts that could help "warm start" the learning process. We present a novel reinforcement learning technique that allows for intelligent initialization of a neural network weights and architecture. Our approach permits the encoding domain knowledge directly into a neural decision tree, and improves upon that knowledge with policy gradient updates. We empirically validate our approach on two OpenAI Gym tasks and two modified StarCraft 2 tasks, showing that our novel architecture outperforms multilayer-perceptron and recurrent architectures. Our knowledge-based framework finds superior policies compared to imitation learning-based and prior knowledge-based approaches. Importantly, we demonstrate that our approach can be used by untrained humans to initially provide >80% increase in expected reward relative to baselines prior to training (p < 0.001), which results in a >60% increase in expected reward after policy optimization (p = 0.011).

연구 동기 및 목표

  • 복잡한 도메인에서 테이블러사(탭룰라 라사) 딥 강화학습의 비효율성을 해결하기 위해 쉽게 확보 가능한 인간 전문 지식을 활용하는 것.
  • 대규모 레이블링 데이터셋이 필요하거나 인간의 수작업 레이블링이 필요한 이뮬레이션 학습의 한계를 극복하는 것.
  • 비전문가 인간이 효과적인 정책 사양을 제공하여 초기 학습 성능을 크게 향상시킬 수 있도록 하는 것.
  • 초기 지식 기반 초기화를 넘어서 표현력이 향상되는 학습 가능한 신경망 아키텍처를 개발하는 것.
  • 거대한 컴퓨팅 자원, 전문가 데이터 또는 복잡한 수작업 설계에 의존하는 것을 줄여 강화학습의 민주화를 이루는 것.

제안 방법

  • 결정 트리에서 제시된 인간이 지정한 명제 논리 규칙을 네트워크 가중치와 구조에 직접 통합하는 신경망 아키텍처인 ProLoNets를 제안한다.
  • 결정 트리를 사용해 도메인 전문가 또는 비전문가가 if-then 형태의 상태-행동 규칙을 통해 고수준 정책을 정의할 수 있는 사용자 友好的 인터페이스를 제공한다.
  • 결정 트리에서 직접 신경망의 아키텍처와 파rameters를 초기화하여 논리적 구조를 네트워크의 연결성과 가중치에 통합한다.
  • 정책 그래เดียน트 업데이트를 적용하여 초기화된 정책을 개선함으로써 에이전트가 초기 전문가 사양을 초월할 수 있도록 한다.
  • ProLoNets에 동적 성장을 도입하여 학습 도중 네트워크의 용량과 표현력을 확장할 수 있도록 하여 원래 지식을 초월하게 한다.
  • 도메인의 구조적 및 논리적 제약 조건을 활용하여 무작위 탐색을 줄이고 복잡한 환경에서 수렴 속도를 가속화한다.

실험 결과

연구 질문

  • RQ1결정 트리 형태로 제공된 인간의 도메인 지식이 대규모 레이블링 데이터셋이 없이도 강화학습의 초기 성능을 크게 향상시킬 수 있는가?
  • RQ2전문 지식을 신경망 아키텍처와 가중치에 직접 통합하는 것이 복잡한 환경에서 이뮬레이션 학습 및 표준 딥 강화학습 기준선을 초월하는가?
  • RQ3비전문가 인간이 유용한 정책 사양을 제공하여 랜덤 초기화 대비 뛰어난 학습 성과를 이끌 수 있는가?
  • RQ4정책 그래디언트 최적화를 통해 신경망의 표현력이 얼마나 향상되어 초기 지식 기반 초기화를 초월할 수 있는가?
  • RQ5제안된 방법이 더 빠른 수렴과 더 나은 샘플 효율성을 통해 딥 강화학습의 계산 부담을 줄일 수 있는가?

주요 결과

  • 비전문가 인간이 제공한 정책 사양으로 기준선 대비 학습 이전에 기대 보상이 80% 향상되었다 (p < 0.001).
  • 정책 최적화 이후 ProLoNet 에이전트는 기준선 대비 기대 보상이 60% 향상되었다 (p = 0.011), 이는 초기 지식의 효과적인 개선을 보여준다.
  • 수정된 StarCraft II 미니게임에서 ProLoNets는 가장 성능이 좋았던 기준선(이뮬레이션 학습 및 지식 기반 방법 포함)보다 평균 보상이 100% 이상 높았다.
  • Lunar Lander 환경에서 ProLoNets의 동적 성장 기능은 초기 정책의 평균 보상의 두 배에 달하는 성과를 달성하여 원래 전문가 사양을 초월하였다.
  • OpenAI Gym 및 수정된 StarCraft II 환경을 포함한 모든 평가 작업에서 ProLoNets는 다층 퍼셉트론 및 순환 신경망 아키텍처를 모두 압도하였다.
  • 불꽃번개 시뮬레이션 도메인에서 이 프레임워크는 난이도 높은 실용성과 견고성을 입증하였으며, 훈련을 받지 않은 참가자들이 초기 정책을 성공적으로 제공하여 랜덤 초기화보다 뚜렷이 뛰어난 성능을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.