Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Programmatically Structured Representations with Perceptor Gradients

Svetlin Penkov, Subramanian Ramamoorthy|arXiv (Cornell University)|2019. 05. 02.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 perceptor gradients 알고리즘을 소개한다. 이 알고리즘은 에이전트의 정책을 원시 관측에서 기호적 상태를 추출하는 신경 perceptor 네트워크와 기호를 행동으로 매핑하는 사용자 정의 작업 인코딩 프로그램으로 분해함으로써 기호적 표현을 학습한다. 이 방법은 더 빠르고 효율적인 이식 가능하고 의미 있는 표현을 학습할 수 있게 하며, cart-pole 및 Minecraft 유사 탐색 작업에서 픽셀 입력으로 LQR 컨트롤러와 A* 플래너를 성공적으로 학습시켜 보여준다.

ABSTRACT

We present the perceptor gradients algorithm -- a novel approach to learning symbolic representations based on the idea of decomposing an agent's policy into i) a perceptor network extracting symbols from raw observation data and ii) a task encoding program which maps the input symbols to output actions. We show that the proposed algorithm is able to learn representations that can be directly fed into a Linear-Quadratic Regulator (LQR) or a general purpose A* planner. Our experimental results confirm that the perceptor gradients algorithm is able to efficiently learn transferable symbolic representations as well as generate new observations according to a semantically meaningful specification.

연구 동기 및 목표

  • 계획 및 제어에 의미적으로 유의미한 원시이고 노이지한 관측에서 기호적 표현을 학습하는 데 도전하는 것.
  • 프로그램 기반 인덕티브 바이어스를 표현 학습에 통합하여 데이터 기반 신경망과 기호적 추론 사이의 격차를 메우는 것.
  • 하류의 플래너(예: LQR 또는 A*)에 직접 사용 가능한 효율적이고 샘플 효율적인 표현 학습을 가능하게 하는 것.
  • 기존에 학습된 perceptor를 재사용하고 새로운 작업에 적응시킴으로써 전이 학습과 수명 주기 학습을 촉진하며, 치명적인 잊음( catastrophic forgetting)을 방지하는 것.
  • 기호적 사양에서 현실적인 관측을 생성함으로써 의미 있는 데이터 증강을 가능하게 하는 것.

제안 방법

  • 정책을 원시 관측에서 기호적 상태로 매핑하는 신경 perceptor 네트워크(신경망)와 기호를 행동으로 매핑하는 사용자 제공 작업 인코딩 프로그램으로 분해한다.
  • REINFORCE 추정기와 정책 기반 강화를 사용하여 perceptor를 학습하며, 보상 신호는 작업 인코딩 프로그램의 성능에서 유도된다.
  • 프로그램 기반 정규화를 사용하여 잠재 공간을 구조화함으로써 작업 프로그램으로부터 의미적 의미와 인덕티브 바이어스를 통합한다.
  • 전방향 및 오토에코딩 perceptor를 모두 적용하여 픽셀 입력으로부터 분리된, 해석 가능한 표현을 학습한다.
  • 다중 perceptor(예: 자세 및 물체 위치)를 스택하여 전이 학습을 가능하게 하고, 낮은 학습률로 미세조정하여 치명적인 잊음을 방지한다.
  • 다중 perceptor의 공동 잠재 공간을 복호화하여 기호적 사양에서 합성 관측을 생성함으로써 공간적 및 의미적 일관성을 유지한다.

실험 결과

연구 질문

  • RQ1프로그램 기반 작업 기술이 원시 관측에서 기호적 표현을 학습할 때 샘플 효율성을 향상시키는 효과적인 인덕티브 바이어스가 될 수 있는가?
  • RQ2제안된 perceptor gradients 방법이 LQR나 A*와 같은 고전적 제어 방법과 직접 호환되는 표현을 학습할 수 있는가?
  • RQ3기존에 학습된 perceptor가 치명적인 잊음을 일으키지 않고 새로운 작업에 얼마나 잘 전이되고 적응될 수 있는가?
  • RQ4학습된 기호적 표현을 사용하여 기호적 사양에서 의미적으로 의미 있는 현실적인 관측을 생성할 수 있는가?
  • RQ5표현 품질 향상과 하류 작업 성능 향상 측면에서, 통계적 제약(예: 분리성, 독립성)에 비해 프로그램 기반 정규화는 어떻게 비교되는가?

주요 결과

  • perceptor gradients 알고리즘이 표준 정책 기반 강화 학습 방법보다 뛰어나게 성능을 발휘하여, 3,000회 이터레이션 이내에 'wood를 수집하기' 작업에서 최적 성능을 달성한다.
  • 이 방법은 원시 픽셀 관측에서 카트폴 상태의 기호적 표현을 성공적으로 학습하여 선형-제곱형 조절기(LQR)를 통한 효과적인 제어를 가능하게 한다.
  • perceptor gradients를 통해 학습된 기호적 표현은 이식 가능하다: 기존에 학습된 에이전트 자세용 perceptor는 새로운 탐색 및 탐색 작업에 성공적으로 재사용되고 미세조정되었다.
  • 스택된 perceptor의 공동 잠재 공간은 의미적 구조를 유지하며, 기호적 사양에서 현실적인, 음영 처리를 고려한 이미지를 생성할 수 있게 한다.
  • 기호적 입력에서 생성된 관측은 높은 정밀도로 이미지를 재구성하며, 일부 샘플에서 방향성과 관련된 미세한 왜곡만 관측되었다.
  • 작업 인코딩 프로그램을 통한 프로그램 기반 정규화는 일반적이고 효과적인 인덕티브 바이어스를 제공하며 일반화를 향상시키고 기호적 플래너와의 직접 통합을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.