Skip to main content
QUICK REVIEW

[논문 리뷰] Symbolic Relational Deep Reinforcement Learning based on Graph Neural Networks.

Jaromír Janisch, Tomáš Pevný|arXiv (Cornell University)|2020. 09. 25.
Reinforcement Learning in Robotics참고 문헌 42인용 수 6
한 줄 요약

이 논문은 상태 공간과 행동 공간이 변하는 관계적 환경을 다루기 위해 자동회귀 정책 분해를 사용하는 그래프 신경망 기반 딥 강화학습 프레임워크를 제안한다. 이 프레임워크는 10x10 크기의 3개 상자 문제로만 훈련된 후 15x15 사카반 문제의 89%를 성공적으로 해결하는 강력한 제로샷 일반화 성능을 달성한다.

ABSTRACT

We focus on reinforcement learning (RL) in relational problems that are naturally defined in terms of objects, their relations, and manipulations. These problems are characterized by variable state and action spaces, and finding a fixed-length representation, required by most existing RL methods, is difficult, if not impossible. We present a deep RL framework based on graph neural networks and auto-regressive policy decomposition that naturally works with these problems and is completely domain-independent. We demonstrate the framework in three very distinct domains and we report the method's competitive performance and impressive zero-shot generalization over different problem sizes. In goal-oriented BlockWorld, we demonstrate multi-parameter actions with pre-conditions. In SysAdmin, we show how to select multiple objects simultaneously. In the classical planning domain of Sokoban, the method trained exclusively on 10x10 problems with three boxes solves 89% of 15x15 problems with five boxes.

연구 동기 및 목표

  • 고정 길이 표현이 비현실적인 상태 공간과 행동 공간이 변하는 관계적 환경에서 강화학습을 수행하는 데 도전하는 것.
  • 객체, 관계, 그리고 그들의 조작을 자연스럽게 모델링할 수 있는 도메인 독립적 강화학습 프레임워크를 개발하는 것.
  • 복잡한 관계적 작업에서 다양한 문제 크기 간에 효과적인 학습과 제로샷 일반화를 가능하게 하는 것.

제안 방법

  • 프레임워크는 관계적 상태 표현을 인코딩하기 위해 그래프 신경망을 사용하여 객체와 그 상호작용을 노드와 간선으로 포착한다.
  • 복잡한 다중 매개변수 행동과 사전 조건을 갖는 행동을 순차적으로 생성하기 위해 자동회귀 정책 분해를 사용한다.
  • 정책 네트워크는 딥 강화학습을 통해 엔드 투 엔드로 훈련되어 상태 표현과 행동 선택을 함께 최적화할 수 있다.
  • 이 방법은 행동 내에서 다수의 객체를 동시에 선택할 수 있으며, 이는 SysAdmin 도메인에서 입증되었다.
  • 완전히 도메인 독립적이며, 수작업으로 설계된 특징이 아닌 관계적 구조에만 의존한다.
  • 변동하는 크기의 입력 상태와 행동을 지원하여 객체 수가 동적으로 변하는 문제에 적합하다.

실험 결과

연구 질문

  • RQ1그래프 신경망 기반 딥 강화학습 프레임워크는 관계적 환경에서 다양한 문제 크기 간에 제로샷 일반화를 달성할 수 있는가?
  • RQ2이 방법은 다중 객체 관계적 도메인에서 사전 조건이 있는 복잡한 행동을 얼마나 잘 처리할 수 있는가?
  • RQ3고정 길이 표현이 없는 상태 공간과 행동 공간이 변하는 환경에서 이 프레임워크는 효과적인 정책을 얼마나 잘 학습할 수 있는가?

주요 결과

  • 프레임워크는 3개 상자와 함께 10x10 문제로만 훈련된 후 15x15 사카반 문제의 89%를 성공적으로 해결했다.
  • BlockWorld에서 프레임워크는 사전 조건이 있는 다중 매개변수 행동을 성공적으로 처리하여 복잡한 행동 순서를 보여주었다.
  • SysAdmin 도메인에서 프레임워크는 단일 행동 내에서 다수의 객체를 동시에 선택할 수 있게 하여 객체 조작의 확장성을 입증했다.
  • 다양한 문제 크기 간에 강력한 제로샷 일반화 성능를 보이며 분포 이탈에 대한 강건성을 보였다.
  • 고전적 계획 수립 및 시스템 관리 작업을 포함한 세 가지 다른 관계적 도메인에서 경쟁 가능한 성능를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.