Skip to main content
QUICK REVIEW

[논문 리뷰] Continuous Relaxation of Symbolic Planner for One-Shot Imitation Learning

De-An Huang, Danfei Xu|arXiv (Cornell University)|2019. 08. 16.
Multimodal Machine Learning Applications참고 문헌 31인용 수 12
한 줄 요약

이 논문은 일회성 복제 학습을 위한 기호 계획의 연속적 리라크스레이션을 제안하며, 단일 시연로부터 강건한 작업 실행을 가능하게 한다. 이는 확률적 기호 기반 출력을 바탕으로 작동함으로써 달성된다. 작업 간 일반화를 정책 실행에서 분리하고 저자료 환경에서의 불확실성을 다루어, 최소한의 메타학습 데이터로 최신 기술 수준의 성능을 달성하며 수동 히우리스틱 없이도 우수한 성능을 발휘한다.

ABSTRACT

We address one-shot imitation learning, where the goal is to execute a previously unseen task based on a single demonstration. While there has been exciting progress in this direction, most of the approaches still require a few hundred tasks for meta-training, which limits the scalability of the approaches. Our main contribution is to formulate one-shot imitation learning as a symbolic planning problem along with the symbol grounding problem. This formulation disentangles the policy execution from the inter-task generalization and leads to better data efficiency. The key technical challenge is that the symbol grounding is prone to error with limited training data and leads to subsequent symbolic planning failures. We address this challenge by proposing a continuous relaxation of the discrete symbolic planner that directly plans on the probabilistic outputs of the symbol grounding model. Our continuous relaxation of the planner can still leverage the information contained in the probabilistic symbol grounding and significantly improve over the baseline planner for the one-shot imitation learning tasks without using large training data.

연구 동기 및 목표

  • 기존 일회성 복제 학습 방법이 수백 개의 메타학습 작업이 필요로 하는 데이터 비효율성 문제를 해결하기 위해.
  • 복제 학습을 기호 계획 문제로 재구성함으로써 작업 간 일반화를 정책 실행에서 분리하기 위해.
  • 기호 기반의 오류 발생 가능성이 높고 일관되지 않은 기호 상태를 유도할 수 있는 저자료 환경에서의 강건성 향상을 위해.
  • 이산적이고 오류 발생 가능성이 높은 기호 할당 대신 확률적 기호 표현을 기반으로 계획을 수행하기 위해.
  • 수동 규칙나 히우리스틱 없이도 예측되지 않은 작업과 다른 해결 경로로의 강력한 일반화를 달성하기 위해.

제안 방법

  • 일회성 복제 학습을 기호 계획 문제로 재구성하여 정책 실행과 작업 간 일반화를 분리한다.
  • 데이터 효율성을 위해 파라미터 공유를 활용하는 모듈러한 기호 기반 네트워크(SGN)를 도입하여 연속 상태(예: 물체 자세, 이미지)를 기호 상태로 매핑한다.
  • 기호 계획기의 연속적 리라크스레이션을 제안하여 이산적 집합 대신 기호 상태에 대한 확률 분포를 다루는 데 사용한다.
  • 기호 계획의 집합 이론 연산을 불확실성 처리와 잘못된 상태 전이 방지를 위해 확률적 추론으로 대체한다.
  • SGN의 연속적 출력을 계획기의 입력으로 사용하여 모호하거나 노이즈가 있는 기호 예측을 바탕으로 추론할 수 있도록 한다.
  • 각 작업당 단일 시범 예측으로 끝내기까지 훈련하며, 계획기의 불확실성 추론 능력에 의존한다.

실험 결과

연구 질문

  • RQ1기호 계획을 일회성 복제 학습에 적응시켜 일반화를 정책 실행에서 분리함으로써 데이터 효율성을 향상시킬 수 있는가?
  • RQ2저자료 환경에서 기호 기반의 일관되지 않거나 확률적 상태 예측을 유도할 경우, 계획기가 어떻게 강건하게 작동할 수 있는가?
  • RQ3불완전한 기호 기반으로 인한 불확실성을 다루는 데 있어, 기호 계획의 연속적 리라크스레이션이 이산 기호 계획기보다 성능이 뛰어나게 될 수 있는가?
  • RQ4제안된 방법이 수동 히우리스틱 없이도 예측되지 않은 작업과 다른 해결 경로로 일반화되는가?
  • RQ5기존 방법이 일반적으로 필요로 하는 400~1000개의 메타학습 작업보다 훨씬 적은 수로 높은 성능을 달성할 수 있는가?

주요 결과

  • 연속적 계획기는 SGN이 일관되지 않은 이산 기호 출력을 생성하더라도 작업을 성공적으로 완수하여 기호 계획기 베이스라인을 능가한다.
  • 메타학습 작업 수가 8개일 때, 연속적 계획기는 물체 정렬 작업에서 100% 성공률를 기록했고, 기호 계획기 및 NTG 베이스라인은 15개의 작업조차 100%에 도달하지 못했다.
  • 수동 규칙를 추가로 제공하지 않아도, 수동 히우리스틱 베이스라인과 유사한 성능을 내며, 잘못된 상태를 수정하기 위한 수작업 규칙가 필요 없음을 입증했다.
  • 메타학습 작업의 수를 크게 줄였으며, 이는 이전 연구에서 일반적으로 요구되던 400~1000개의 작업보다 훨씬 적은 수로 강력한 일반화 성능를 달성함을 의미한다.
  • 블록 스택킹 도메인에서 기호 계획기는 잘못된 이산 기호 할당으로 인해 실패하는 반면, 연속적 계획기는 이를 성공적으로 해결함으로써 기반 오류에 대한 강건성을 입증했다.
  • 연속적 리라크스레이션 덕분에 확률적 기호 분포에 대한 효과적인 계획이 가능해져, 이산 기반 오류 발생 시에도 정확한 목표 상태를 추론할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.