Skip to main content
QUICK REVIEW

[논문 리뷰] DeepSym: Deep Symbol Generation and Rule Learning from Unsupervised Continuous Robot Interaction for Planning

Alper Ahmetoğlu, M. Yunus Seker|arXiv (Cornell University)|2020. 12. 04.
Multimodal Machine Learning Applications참고 문헌 26인용 수 5
한 줄 요약

DeepSym는 원시적이고 비지도적인 로봇 상호작용 데이터에서 자동으로 이산적이고 행동 기반의 기호 및 확률적 규칙을 생성하는 딥러닝 프레임워크를 제안한다. 물체의 성질과 관계적 영향의 잠재 표현을 추출하기 위해 이진 버블넥 레이어를 갖춘 예측형 오토인코더를 사용하고, 이를 결정식 트리로 학습하여 PPDDL 기반의 확률적 규칙로 단순화함으로써, 로봇 및 비로봇 도메인 전반에서 효과적인 기호적 계획 수단을 제공한다. 다단계 조작 및 퍼즐 해결 작업에서 성공을 거두었다.

ABSTRACT

We propose a novel general method that finds action-grounded, discrete object and effect categories and builds probabilistic rules over them for non-trivial action planning. Our robot interacts with objects using an initial action repertoire that is assumed to be acquired earlier and observes the effects it can create in the environment. To form action-grounded object, effect, and relational categories, we employ a binary bottleneck layer in a predictive, deep encoder-decoder network that takes the image of the scene and the action applied as input, and generates the resulting effects in the scene in pixel coordinates. After learning, the binary latent vector represents action-driven object categories based on the interaction experience of the robot. To distill the knowledge represented by the neural network into rules useful for symbolic reasoning, a decision tree is trained to reproduce its decoder function. Probabilistic rules are extracted from the decision paths of the tree and are represented in the Probabilistic Planning Domain Definition Language (PPDDL), allowing off-the-shelf planners to operate on the knowledge extracted from the sensorimotor experience of the robot. The deployment of the proposed approach for a simulated robotic manipulator enabled the discovery of discrete representations of object properties such as `rollable' and `insertable'. In turn, the use of these representations as symbols allowed the generation of effective plans for achieving goals, such as building towers of the desired height, demonstrating the effectiveness of the approach for multi-step object manipulation. Finally, we demonstrate that the system is not only restricted to the robotics domain by assessing its applicability to the MNIST 8-puzzle domain in which learned symbols allow for the generation of plans that move the empty tile into any given position.

연구 동기 및 목표

  • 로봇 분야에서 저수준의 센서모터 데이터와 고수준의 기호적 추론 사이의 표현 갭을 해소하기 위해.
  • 수동적인 기호 설계 없이 행동-효과 경험에 기반한 자율적인 기호 형성 가능하게 하기 위해.
  • 오프더셰프 기호적 계획기에서 사용 가능한 이해할 수 있는 확률적 규칙을 신경망 표현에서 추출하기 위해.
  • 로봇 외 영역, 예를 들어 8-퍼즐과 같은 비로봇 도메인으로의 일반화를 입증하기 위해.
  • 이전에 학습된 기호를 고수준 추상화의 입력으로 재사용함으로써 점진적 추상화 학습을 지원하기 위해.

제안 방법

  • 이미지 관측치와 적용된 동작을 입력으로 받는 예측형 딥 인코더-디코더 신경망이 픽셀 좌표 기반의 결과 장면 변화를 예측한다.
  • 인코더 내 이진 버블넥 레이어가 행동 기반의 물체 및 효과 카테고리 정보를 포함하는 이산 잠재 벡터를 생성한다.
  • 재구성 오차와 버블넥 크기 사이의 트레이드오프를 최적화함으로써 잠재 공간을 최적화하고 자동 기호 발견을 가능하게 한다.
  • 디코더의 기능을 재현할 수 있도록 결정식 트리를 학습시킨다. 이는 잠재 코드에서 예측된 효과로의 매핑을 수행한다.
  • 결정식 트리의 경로에서 확률적 규칙을 추출하고 이를 확률적 계획 도메인 정의 언어(PPDDL) 연산자로 변환한다.
  • 시스템은 시뮬레이션된 로봇 조작기 환경에서 평가되었으며, 일반성 테스트를 위해 MNIST 8-퍼즐 도메인으로 확장되었다.

실험 결과

연구 질문

  • RQ1딥 뉴럴 네트워크는 원시적이고 비지도적인 로봇 상호작용 데이터로부터 자율적으로 이산적이고 이해 가능한 기호를 발견할 수 있는가?
  • RQ2수동 애너테이션 없이 '굴릴 수 있는' 또는 '삽입 가능한'과 같은 행동 기반의 물체 및 관계적 성질을 어떻게 학습할 수 있는가?
  • RQ3학습된 오토인코더에 내장된 지식을 기호적 계획기에 사용 가능한 확률적 규칙으로 효과적으로 추출할 수 있는가?
  • RQ4제안된 방법은 8-퍼즐과 같은 고전적 계획 문제와 같이 로봇 외 영역으로도 일반화 가능한가?
  • RQ5이전에 학습된 기호를 고수준 추론의 입력으로 재사용함으로써 점진적 추상화 학습을 지원할 수 있는가?

주요 결과

  • 시스템은 로봇 상호작용 데이터로부터 '굴릴 수 있는', '삽입 가능한', '크기가 더 큰' 등의 이해 가능한 기호를 성공적으로 발견하였으며, 이는 의미적으로 유의미하고 인간이 이해할 수 있었다.
  • 시뮬레이션된 로봇 환경에서, 시스템은 오프더셰프 확률적 계획기를 사용하여 원하는 높이의 탑을 쌓는 다단계 작업에 대해 효과적인 계획을 생성하였다.
  • 탁상 환경에서 구체 물체를 정확한 기호 카테고리에 할당하는 데 92.9% ± 8.6%의 정확도를 기록하였으며, 런 간 일관성이 높았다.
  • MNIST 8-퍼즐 도메인에서는 빈 칸을 임의의 목표 위치로 옮기는 계획을 가능하게 하는 기호를 학습하여, 로봇 외 영역으로의 일반화를 입증하였다.
  • 8-퍼즐의 경우 14단위 버블넥, 15-퍼즐의 경우 15단위 버블넥을 사용했을 때, 정보 이론적 하한선과 매우 유사한 성능을 기록하여 효율적인 표현 학습을 나타냈다.
  • 직접 통과 추정기(STE)를 사용한 베이스라인 오토인코더보다 시스템이 유의미하게 높은 정확도를 기록하였으며, 특히 복잡한 물체 유형에서 두드러진 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.