Skip to main content
QUICK REVIEW

[논문 리뷰] Transformers are Adaptable Task Planners

Vidhi Jain, Yixin Lin|arXiv (Cornell University)|2022. 07. 06.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 물체 중심, 시간적, 자세 인식 기반 표현을 사용하여 시연로부터 고수준의 조작 정책을 학습하는 트랜스포머 기반 작업 계획자(TTP)를 제안한다. TTP는 단일 시범을 통해 미리 설정되지 않은 사용자 선호도로 일반화하여 시뮬레이션에서 실제 프랭카 펜다 로봇으로의 제로샷 전이를 달성한다.

ABSTRACT

Every home is different, and every person likes things done in their particular way. Therefore, home robots of the future need to both reason about the sequential nature of day-to-day tasks and generalize to user's preferences. To this end, we propose a Transformer Task Planner(TTP) that learns high-level actions from demonstrations by leveraging object attribute-based representations. TTP can be pre-trained on multiple preferences and shows generalization to unseen preferences using a single demonstration as a prompt in a simulated dishwasher loading task. Further, we demonstrate real-world dish rearrangement using TTP with a Franka Panda robotic arm, prompted using a single human demonstration.

연구 동기 및 목표

  • 동적인 환경과 사용자 중심의 선호도를 고려한 유연하고 장기적인 작업 계획 학습의 과제를 해결한다.
  • 수동으로 설정된 제약 조건을 제거하고 시범에서의 엔드 투 엔드 학습으로 기호 기반 작업 계획의 한계를 극복한다.
  • 단일 인간 시범을 프롬프트로 사용하여 새로운 선호도로 제로샷 일반화를 가능하게 한다.
  • 세제기 적재 및 서랍 정리와 같은 복잡한 조작 작업에서 시뮬레이션에서 실제 세계로의 격차를 해소한다.

제안 방법

  • 각 물체를 3D 자세, 카테고리, 타임스텝을 조합한 7차원 벡터로 표현하여 공간-시간 모델링을 가능하게 한다.
  • 시간, 물체 자세, 카테고리 전용 임bedding을 갖춘 트랜스포머 아키텍처를 사용하여 행동 시퀀스의 장거리 의존성을 모델링한다.
  • 각 선호도당 80개의 시범을 사용하여 7개의 다른 사용자 선호도에서 TTP를 사전 학습하여 일반화된 시간적 표현을 학습한다.
  • 프롬프트 기반 추론 적용: 단일 인간 시범이 테스트 시에 새로운 선호도를 유도하도록 모델을 조정한다.
  • 각 물체 카테고리별로 사전에 컴파일된 이산적인 놓기 자세 집합을 사용하여 세제기 내에서 가능한 위치를 고밀도로 커버한다.
  • 이전 상태의 컨텍스트 윈도우를 활용하여 부분 관측 가능성(예: 닫힌 랙)을 처리하고 불확실성 하에서의 의사결정을 향상시킨다.

실험 결과

연구 질문

  • RQ1기호 기반 작업 기술 기술 없이 장기적인 시범에서 트랜스포머 기반 아키텍처가 작업 구조와 선호도를 암묵적으로 학습할 수 있는가?
  • RQ2선호도 조건 기반 사전 학습이 단일 시범만으로도 새로운 사용자 선호도로 제로샷 일반화를 가능하게 하는가?
  • RQ3변동하는 물체 수와 부분 관측 가능한 상태를 가진 역동적 환경에서 모델의 효과성은 어떠한가?
  • RQ4자세 및 카테고리 임베딩의 설계가 실제 세계 전이에서 성능에 어느 정도 영향을 미치는가?
  • RQ5단일 실제 세계 시범을 사용하여 시뮬레이션에서 실제 세계 조작 작업(예: 접시 재정렬)으로 일반화할 수 있는가?

주요 결과

  • TTP는 모든 컨텍스트 윈도우 크기에서 검증 시 90% 이상의 카테고리 수준 예측 정확도를 달성하여 부분 관측 가능성에 대한 강건성을 보였다.
  • 자세 임베딩의 푸리에 변환은 원본 7차원 자세 벡터보다 성능이 뛰어나 공간적 및 시간적 세부 사항을 더 잘 인코딩하는 것으로 나타났다.
  • 큰 컨텍스트 윈도우는 초기 학습을 가속화하지만 최종 성능에는 영향을 주지 않아, 데이터셋이 짧은 컨텍스트로도 대부분 관측 가능하다는 것을 시사한다.
  • TTP는 새로운 선호도와 역동적 환경으로 일반화하며, 시뮬레이션과 실제 세계 평가에서 경쟁 기반 모델보다 뛰어난 성능을 보였다.
  • 실제 프랭카 펜다 로봇으로의 제로샷 전이가 단일 인간 시범을 프롬프트로 사용하여 두 개의 서랍에 접시를 정리하는 데 성공했다.
  • 모델은 물체 수의 변동성과 새로운 구성에 대해 강력한 일반화 능력을 보이며, 훈련 분포를 초월한 적응 가능성의 확인을 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.