Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Portable Representations for High-Level Planning

Steven James, Benjamin Rosman|arXiv (Cornell University)|2019. 05. 28.
Machine Learning and Algorithms참고 문헌 28인용 수 9
한 줄 요약

이 논문은 에이전트의 경험에서 에고세트릭 상태 공간에서 이동 가능하고 임무에 종속되지 않은 기호적 표현을 학습하는 프레임워크를 제안한다. 이는 환경 간의 전이를 가능하게 한다. 임무에 특화된 정보로 이러한 이동 가능한 기호를 정의함으로써, 샘플 복잡도가 크게 감소한 증명 가능하게 타당한 계획 수립이 가능해진다. 이는 Rod-and-Block 도메인에서 ~600에서 ~330으로, 그리고 보물 게임에서 ~1600에서 ~700으로 감소한 것으로 입증되었다. 이는 다수의 임무를 거친 후의 결과이다.

ABSTRACT

We present a framework for autonomously learning a portable representation that describes a collection of low-level continuous environments. We show that these abstract representations can be learned in a task-independent egocentric space specific to the agent that, when grounded with problem-specific information, are provably sufficient for planning. We demonstrate transfer in two different domains, where an agent learns a portable, task-independent symbolic vocabulary, as well as rules expressed in that vocabulary, and then learns to instantiate those rules on a per-task basis. This reduces the number of samples required to learn a representation of a new task.

연구 동기 및 목표

  • 각 새로운 환경에서 다시 시작하여 임무에 특화된 기호적 표현을 학습하는 데에 드는 비효율성을 해결하기 위해.
  • 다른 역학적 특성과 레이아웃을 가진 다양한 임무와 환경 간에 기호 지식을 전이할 수 있도록 하기 위해.
  • 옵션 실행 데이터로부터 자율적으로 이동 가능한 기호 어휘를 학습하는 프레임워크를 개발하기 위해.
  • 이동 가능한 기호와 임무에 특화된 정보를 조합하면 계획에 대해 증명 가능하게 충분한 표현이 된다는 것을 증명하기 위해.
  • 이전에 학습한 추상화를 재사용함으로써 새로운 임무의 역학을 학습하는 데 필요한 샘플 수를 줄이기 위해.

제안 방법

  • 프레임워크는 에이전트의 감각운동적 시점에 기반하고 환경의 레이아웃 변화에 영향을 받지 않는 에고세트릭 상태 공간에서 기호적 추상화를 학습한다.
  • 고차원의 에고세트릭 관측치에 대해 군집화와 밀도 추정을 적용하여 '문 근처에 있다' 또는 '계단 위에 있다'와 같은 이동 가능한 기호적 상태를 식별한다.
  • 공간적 분할이나 환경적 제약 조건과 같은 임무에 특화된 정보는 별도로 학습되며, 이는 이동 가능한 기호를 임무에 특화된 계획 규칙로 정의하는 데 사용된다.
  • 정의된 규칙는 PDDL에서 업그레이드된 동작 연산자로 표현되며, 각 임무에 맞게 매개변수화되어 추상 상태 공간에서의 계획을 가능하게 한다.
  • 이 방법은 이동 가능한 기호와 임무에 특화된 정의의 조합이 계획에 대해 증명 가능하게 충분한 표현을 제공한다는 것을 증명한다.
  • 이 접근은 두 도메인인 Rod-and-Block과 Treasure Game에서 평가되었으며, 학습된 추상 모델을 사용한 모델 기반 계획을 적용하였다.

실험 결과

연구 질문

  • RQ1다른 레이아웃과 역학적 특성을 가진 환경 간에 일반화되는, 임무에 종속되지 않은 기호적 표현이 에고세트릭 공간에서 학습될 수 있는가?
  • RQ2이동 가능한 기호적 추상화와 임무에 특화된 정보를 조합하면 타당한 계획을 위한 충분한 표현이 되는가?
  • RQ3이 프레임워크는 새로 학습하는 임무의 역학을 학습하는 데 필요한 샘플 수를 다시 시작하는 것보다 줄일 수 있는가?
  • RQ4이동 가능한 표현을 사용할 경우, 만나는 임무의 수가 증가함에 따라 샘플 복잡도는 어떻게 변화하는가?
  • RQ5다양한 환경적 구성 조건을 가진 다양한 임무 간에 동일한 기호 어휘와 규칙을 얼마나 많이 재사용할 수 있는가?

주요 결과

  • 프레임워크는 임무에 특화된 감독 없이도 원시적인 에고세트릭 관측치에서 이동 가능한 기호적 표현을 성공적으로 학습하여, 다양한 레이아웃을 가진 환경 간에 재사용 가능하다.
  • Rod-and-Block 도메인에서, 두 개의 임무를 학습한 후, 특정 임무의 모델을 학습하는 데 필요한 샘플 수가 ~600에서 ~330으로 감소하여, 샘플 수의 비선형적 증가가 감소함을 보여주었다.
  • 보물 게임에서는 일곱 번의 레벨을 거친 후, 레벨당 샘플 요구량이 ~1600에서 ~700으로 감소하여 경험을 통해 일관된 감소를 보였다.
  • 이 방법은 샘플 효율성 향상에 기여한다: 1000개의 임무 설정에서 1000개의 별도의 모델리스 정책이 필요로 하는 대신, 10개의 추상 모델 기반 계획이 충분하다.
  • 프레임워크는 이동 가능한 기호가 임무에 특화된 정보로 정의될 경우, 계획에 대해 증명 가능하게 충분한 표현을 제공한다는 것을 증명하였다. 이는 정확성과 타당성을 보장한다.
  • 이 방법은 다른 역학적 특성과 공간적 구성 조건을 가진 임무 간에 전이 학습을 가능하게 하여, 다시 시작하여 학습할 필요성을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.